arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 32 篇

2608.29411 2026-09-01 cs.LG cs.SC 新提交 57%

Where Induction Runs Out: Description-Length Difficulty and the Memorisation Gap in Integer-Sequence Benchmarks

归纳的尽头:整数序列基准中的描述长度难度与记忆差距

Sabilashan Ganeshan

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究以OEIS整数序列基准为对象,通过MDL参考学习器发现整数序列存在记忆差距,揭示语言模型在该基准中更多依赖记忆而非归纳,并提出MDL可作为无干扰难度信号。

Comments 14 pages, 6 figures. Code and data: https://github.com/sabilashang/where-induction-runs-out. Archived: doi:10.5281/zenodo.21830331

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-09-01 cs.AI cs.MA 版本更新 57%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 7 篇

2608.28771 2026-09-01 cs.LG 新提交 87%

ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

ERR+: 用于高效且果断的LLM推理的顺序熵分辨率

Xin Jiang, Minhao Wang, Wen Wu, Zhentao Xie, Shangheng Du, Jinxin Shi, Jiabao Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ByteDance(字节跳动)

专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 该研究针对RLVR方法对推理过程质量指导不足的问题,提出两阶段RLVR框架ERR+,通过顺序优化熵缓解奖励与稳健相对效率奖励,在五个数据集上实现了LLM推理准确率与简洁性的提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18987 2026-09-01 cs.CL cs.AI cs.PL 81%

LLMs versus the Halting Problem: Characterizing Program Termination Reasoning

LLMs 与停机问题:程序终止推理的特征化

Oren Sultan, Jordi Armengol-Estape, Pascal Kesseli, Julien Vanegue, Dafna Shahaf, Yossi Adi, Peter O'Hearn

机构 * FAIR Team, Meta AI(Meta AI FAIR 团队) The Hebrew University of Jerusalem, Israel(耶路撒冷希伯来大学) Bloomberg, New York, USA(彭博社,纽约,美国) Imperial College London, UK(伦敦帝国理工学院,英国) University College London, UK(伦敦大学学院,英国)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了前沿LLMs在程序终止推理上的能力,发现GPT-5和Claude Sonnet 4.5在C程序终止判断上达到顶级验证工具水平,但无法生成形式化证明,并引入分歧前置条件形式化描述非终止条件。

Comments long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-09-01 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

机构 * Google Research(谷歌研究院) CNRS(法国国家科学研究中心) IRIF(法国信息学研究所) Université Paris-Cité(巴黎城市大学) Princeton University(普林斯顿大学) Université Paris-Saclay(巴黎萨克雷大学) CEA(法国原子能和替代能源委员会) California Institute of Technology(加州理工学院) Google DeepMind(谷歌DeepMind)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30543 2026-09-01 cs.AI cs.SE 新提交 57%

Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis

设计一种可审计的、由大语言模型(LLM)支持的定性主题分析工作流程

Nadia Jul Jeldtoft, Tariq Yousef

机构 * University of Southern Denmark(南丹麦大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种可审计的LLM支持的定性主题分析工作流程,推导五项设计原则,构建两阶段工作流程,经半结构化丹麦访谈记录评估,其编码覆盖与人工相当,主题更紧凑,可扩展适配不同LLM与领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13387 2026-09-01 cs.CL cs.GT 版本更新 57%

Make an Offer They Can't Refuse: Grounding Bayesian Persuasion in Real-World Dialogues without Pre-Commitment

提出无法拒绝的方案:在无预承诺的真实对话中建立贝叶斯说服

Buwei He, Yang Liu, Zhaowei Zhang, Zixia Jia, Yang Yu, Huijia Wu, Zhaofeng He, Zilong Zheng, Yipeng Kang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对LLM策略性说服的不足,提出无预承诺的贝叶斯说服机制,实现两种变体并经多LLM与人类评估,验证其性能提升源于贝叶斯推理,且微调可缩小模型性能差距。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30803 2026-09-01 cs.LO cs.SE 新提交 50%

Schwarz: Solver-Aware Agentic Program Verification

Schwarz:感知求解器的智能体程序验证工具

Jingyu Ke, Ling-I Wu, Guoqiang Li

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出感知求解器的智能体程序验证工具Schwarz,通过本地化修复任务等方法,在两类基准任务上分别实现95.2%、91.5%的解决率,验证了其有效性与可扩展性。

Comments 12 pages, 4 figures, 4 tables; preprint prepared in IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30635 2026-09-01 cs.GT 新提交 50%

Test-time Reinforcement Learning in Imperfect Information Games

非完美信息博弈中的测试时强化学习

Ondrej Kubicek, Viliam Lisy, Tuomas Sandholm

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究针对两人零和非完美信息博弈,提出将小工具博弈扩展至强化学习场景的策略梯度算法,通过隐式表示消除子博弈规模限制,经实验验证可提升策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 16 篇

2608.30498 2026-09-01 cs.AI 新提交 89%

CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework

CM2:基于集成多智能体框架的多模态文化推理

Qi Li, Zhaojie Kang, Yingjie He, Zheng Lin, Hao Zhang, Guangxin Wu, Yan Gong, Rong Fu, Jianyuan Ni

机构 * Lanzhou University(兰州大学) Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 逻辑推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLM)跨学科文化推理不足的问题,提出基于人类文化解释认知路径的CM2多智能体框架,在CM2D数据集上较CoT等范式取得一致提升,各模块贡献及跨模态仲裁能力均得到验证。

Comments Accepted to the 23rd Pacific Rim International Conference on Artificial Intelligence (PRICAI 2026) as a short paper. 11 pages, 4 figures. Code and dataset are available at https://github.com/GitHub-12138/CM2-Multimodal-Cultural-Reasoning-via-an-Integrated-Multi-Agent-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30256 2026-09-01 cs.CL cs.AI 新提交 88%

Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

超越表面形式:以符号编辑测试大语言模型的逻辑推理能力

Ramya Keerthy Thatikonda, Wray Buntine, Ehsan Shareghi

机构 * Monash University(莫纳什大学) University College London(伦敦大学学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出工具驱动的符号编辑框架,通过可控修改逻辑算子等结构成分,发现不同LLM在算子编辑下的推理行为不一致,可用于评估模型推理可靠性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28006 2026-09-01 cs.CL cs.AI 版本更新 81%

Integrated and Cross-Architecture Interpretation of LLM Reasoning

LLM推理的集成与跨架构解释

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出集成跨架构推理(IAR)框架,通过带宽校准的MIP与Tukey IQR峰值检测、重叠分析及Jaccard稳定性度量,统一解释LLM推理模式。

Comments Accepted as main conference paper by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29490 2026-09-01 cs.MA cs.AI cs.RO 新提交 79%

Generalizable Multi-Agent Planning from Signal Temporal Logic Specifications via Diffusion

基于扩散模型的、可从信号时序逻辑规范实现通用多智能体规划

Joe Eappen, Zikang Xiong, Shreyash S. Iyengar, Suresh Jagannathan

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多智能体STL规划的通用能力与可扩展性的权衡问题,提出STL引导的扩散方法,实现了可泛化、可扩展且规划多样的多智能体规划,减少了安全违规。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17638 2026-09-01 cs.AI 版本更新 79%

Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing

超越轨迹:将可解释推理状态读出与原生MoE路由耦合

Kang Chen, Sihan Zhao, Yixin Cao, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出将可解释推理状态读出J64与原生MoE路由耦合的两级机制,提升推理过程可解释性与性能,R64作为低开销代理可保留其核心增益,还能优化分支选择与投票策略、调整推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30938 2026-09-01 cs.MA 新提交 78%

Evidence, Logic, and Compliance: Multi-Agent Structured Graph Reasoning with Expert Arbitration for Medical Referral

证据、逻辑与合规性:面向医疗转诊的专家仲裁多智能体结构化图推理

Qi Peng, Yi Cai, Jialin Cui, Tong Zhu, Yujuan Ding, Qingbao Huang, Tao Wang, Jiayuan Xie, Changmeng Zheng, Qing Li

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 该研究针对LLM用于医疗转诊的信息过载与非结构化协作问题,提出MASGR框架,通过多智能体结构化图推理及专家仲裁机制提升复杂医疗转诊的精准度,表现优于现有模型。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14479 2026-09-01 cs.AI cs.CL 73%

Reliable Proof Generation with LLMs via Analogical Retrieval and Symbolic Verification: A Case Study in Euclidean Geometry

一种用于LLM可靠证明生成的神经符号方法:以欧几里得几何为例

Oren Sultan, Eitan Stern, Dafna Shahaf

机构 * The Hebrew University of Jerusalem(特拉维夫大学)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合LLM生成能力与结构化组件的神经符号方法,通过类比问题检索和形式验证器反馈,显著提升欧几里得几何证明的准确性。

Comments long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22878 2026-09-01 cs.AI cs.CL cs.IR cs.LG 版本更新 67%

SciAtlas: A Computable Atlas of Science for Knowledge-Grounded AI Research

SciAtlas:面向自动化科学研究的大规模知识图谱

Shuofei Qiao, Yunxiang Wei, Busheng Zhang, Mengru Wang, Jiazheng Fan, Huadong Jian, Bin Wu, Shumin Deng, Yida Xue, Zifan Cheng, Xiang Chen, Dan Zhang, Junfeng Fang, Ningyu Zhang, Keyan Ding, Qiang Zhang, Jeff Z. Pan, Emine Yilmaz, Huajun Chen

机构 * Zhejiang University(浙江大学) University College London(伦敦大学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 为应对学术信息爆炸和跨学科整合困难,提出包含4300万论文、1.57亿实体和30亿三元组的多学科知识图谱SciAtlas,并开发神经符号检索算法,实现从语义匹配到确定性关联发现的转变,降低推理成本。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30258 2026-09-01 cs.CL cs.AI 新提交 62%

Stratified Consistency Distillation for Natural Language Formalization

面向自然语言形式化的分层一致性蒸馏

Zhichao Hou, Ferhat Erata, Joe Lilien, MohamadAli Torkamani

机构 * North Carolina State University(北卡罗来纳州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对自然语言到逻辑公式翻译准确率提升难题,提出分层一致性蒸馏方法,经实验在Pass@K与等价逻辑相似度指标上获显著稳定提升,推进了逻辑翻译技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29529 2026-09-01 cs.CL cs.AI 新提交 62%

Argument-Aware Semantic Alignment of Normative Texts: A Toulmin-Based Neuro-Symbolic Approach

规范文本的论元感知语义对齐:一种基于图尔敏的神经符号方法

William Schroeder

机构 * Purdue University(普渡大学) Cleantech Software(清洁技术软件公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对专业规范文本语义对齐难题,提出结合神经文本表示与图尔敏特征的神经符号方法,在网络安全标准映射基准上验证论元结构特征可提升对齐效果。

Comments 11 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-09-01 cs.LG cs.AI cs.MA 版本更新 62%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments Long paper accepted to EMNLP 2026 main conference, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30277 2026-09-01 cs.AI cs.MA 新提交 57%

SimCRAFT: Distilling Remote Sensing Agents via Synthetic Trajectories and Contextual Retrieval-Augmented Fine-Tuning

SimCRAFT:通过合成轨迹和上下文检索增强微调蒸馏遥感智能体

Haoran Wang, Jing Yao, Xu Yang, Zeqing Wang, Yang Zhang, Pedram Ghamisi, Zhengchao Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗森多夫亥姆霍兹中心)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出SimCRAFT框架,通过合成轨迹与上下文检索增强微调,将复杂遥感编排能力蒸馏到7B模型,性能优于开源LLM,为轻量遥感智能提供开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21719 2026-09-01 cs.DC cs.AI 交叉投稿 57%

PowerSlider: Exploiting Phase Asymmetry for LLM Serving under Demand Response

PowerSlider:利用相位不对称性实现需求响应下的大语言模型服务

Yueying Li, Jiayang Chen, Yuanfan Chen, Leo Han, Haoran Qiu, Esha Choukse, Rodrigo Fonseca, Udit Gupta

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 PowerSlider通过分解大语言模型服务阶段并结合KKT在线求解器,在电网需求响应的时变功率上限下,显著提升了服务吞吐量与延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29808 2026-09-01 cs.CR cs.PL cs.SE 新提交 50%

POLYFLOW: A Neuro-Symbolic Framework for Static Cross-Language Information Flow Analysis

POLYFLOW:用于静态跨语言信息流分析的神经符号框架

Haoran Yang, Zhixuan Zhong, Jiawei Guo, Haipeng Cai

专题命中 逻辑推理 :reasoning(abstract)

AI总结 PolyFlow是结合LLM与静态分析的跨语言信息流分析神经符号框架,在多语言系统实验中表现优于基线,可发现未知跨语言漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29078 2026-09-01 cs.RO 新提交 50%

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM:基于实境到仿真的部署时演示生成,用于可扩展的策略适配

Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究提出DREAM框架,可无需人类演示生成VLA微调数据,经实机实验验证其能降低新工作空间的数据收集成本并提升操纵任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 61 篇

2606.03965 2026-09-01 cs.CL cs.AI 版本更新 93%

Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

Agentic Chain-of-Thought Steering:实现高效且可控的LLM推理

Yu Xia, Zhouhang Xie, Xin Xu, Byungkyu Kang, Prarit Lamba, Xiang Gao, Julian McAuley

专题命中 规划推理 :chain-of-thought(title,title_cn);reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Agentic Chain-of-Thought Steering (ACTS)方法,通过强化学习训练控制器智能体在推理过程中自适应地选择推理策略和引导短语,实现预算感知的策略控制,从而在保持推理质量的同时显著节省token,并支持准确率-效率的可控权衡。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14252 2026-09-01 cs.RO cs.AI cs.CL 版本更新 89%

MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning

MEMORA:基于自我中心视频的具身动作记忆用于推理与规划

Zihao Yu, Xiu Yuan, Chongjie Zhang

专题命中 规划推理 :planning(title,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对长期机器人规划中对具身经验记忆的需求,提出MEMORA方法,通过形成-巩固-检索生命周期及四种类型存储实现具身动作记忆,经实验评估取得良好结果,能为机器人规划提供记忆上下文。

Comments 50 pages. v1: Oral presentation at the Robotics: Science and Systems 2026 Workshop on Foundation Models for Robot Planning (FM4RoboPlan). v2: Accepted to the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30924 2026-09-01 cs.CL 新提交 88%

TRIPPULSE: Multi-Agent Travel Planning with Review-Grounded Reasoning

TRIPPULSE:基于评论推理的多智能体旅行规划

Priyanshu Karmakar, Borru Vijay Sai, Shubhojit Mallick, Abhik Jana, Shreya Ghosh, Manish Gupta

机构 * Microsoft(微软公司) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 TRIPPULSE是基于评论推理的多智能体旅行规划框架,分解行程生成任务为多智能体并结合10万+评论与RGPA指标,可兼顾约束满足与个性化体验。

Comments 31 pages, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28704 2026-09-01 cs.AI cs.LG 新提交 86%

ORDDAR: Observation-Driven Reasoning for Distortion-Resilient Decision, Action, and Cognitive Recovery

ORDDAR:面向抗失真决策、行动与认知恢复的观测驱动推理

Deblina Kar, Anant Nawalgaria, Shyamal Kumar Das Mandal

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) Google Research(谷歌研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出ORDDAR推理框架,通过局部认知状态转换检测、失真定位与针对性修复,提升了多类推理任务的质量、恢复能力与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30395 2026-09-01 cs.CL 新提交 84%

When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角

Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Stony Brook University(石溪大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本综述将大语言模型的推理视为搜索,系统化基于树搜索的推理进展,引入统一设计空间并倡导标准化计算报告,以优化推理权衡。

Comments Accepted by EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏