arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 902 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 902 篇

2608.20084 2026-08-21 cs.RO cs.AI 新提交 83%

Evidence-Gated Task and Motion Planning with Vision-Language Models

基于视觉语言模型的证据门控任务与运动规划

Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

机构 * Waseda University(早稻田大学) Flinders University(弗林德斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对机器人执行自然语言指令长时操纵任务时的部分可观测问题,提出 EAFG 框架,通过视觉证据获取与可行性门控提升食谱完成率并减少无效操纵尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19964 2026-08-21 cs.LG 新提交 83%

G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs

G-MARK:基于知识图谱的协同驾驶接地多智能体推理

Bhavya Gupta, Onat Gungor, Tajana Rosing

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) West Virginia University(西弗吉尼亚大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 提出 G-MARK 框架,通过知识图谱实现协同驾驶多智能体推理,提升遮挡推理与控制选择性能,减小通信负载,效果优于现有基线。

Comments Accepted for oral presentation at the 25th IEEE International Conference on Machine Learning and Applications (ICMLA'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17932 2026-08-19 cs.MA cs.AI 新提交 83%

Collective Counterfactual Planning: Coordination, Consent, and Verification under Representational Constraints

集体反事实规划:表征约束下的协调、同意与验证

Chainarong Amornbunchornvej

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究提出集体反事实规划(CCP)形式化模型,分析表征约束下群体规划的可行性,揭示正负二元性,给出四步可解性方案,解释群体协作的几何机制。

Comments The code is available at https://github.com/DarkEyes/Coll-Counterfactual-Plan

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15600 2026-08-18 cs.AI 新提交 83%

VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation

VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试

Mingyu Yuan, Shengtao Wen, Lingbing Guo, Zhen Bi, Xiang Chen

机构 * NUAA(南京航空航天大学)

专题命中 规划推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12877 2026-08-14 cs.AI 新提交 83%

ReflectFact: Self-Reflective Agents for Improving Comprehension and Reasoning in Multi-Hop Fact Verification

ReflectFact:用于提升多跳事实验证中理解与推理能力的自反思智能体

Runze Zhao, Zixin Tang, Xiaoshuai Hao, Leyuan Chang, Xiaopeng Fu, Boyu Qiao, Dongyang Zhang

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 针对多跳事实验证中智能体推理偏离目标及参数知识与证据冲突的问题,提出自反思智能体框架ReflectFact,经HOVER、EX-FEVER实验,性能优于最强基线。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 83%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 83%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10494 2026-08-12 cs.AI cs.MA 新提交 83%

GeoForge: Non-Parametric Self-Evolving Agents for Earth-Observation Reasoning

GeoForge:用于对地观测推理的非参数自进化智能体

Xin Xiao, Jiang Zhong, Junnan Zhu, Yingchao Feng, Peijin Wang, Yidan Zhang, Kaiwen Wei

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 GeoForge是一种无需训练的自进化框架,通过结构化非参数执行状态及多记忆机制提升EO智能体的规划与推理能力,可改善任务准确率、工具轨迹质量并减少推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09142 2026-08-11 cs.CL 新提交 83%

An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

用于结直肠癌治疗规划的智能体生成式大语言模型

Mengxian Lyu, Cheng Peng, Tim Jang, Ang Li, Mengyuan Zhang, Ziyi Chen, Leighton Elliott, Tianshi Liu, Lidice Galindo, Chiranjeevi Sainatham, Oscar F. Borja-Montes, Kaleb E. Smith, Ying Zhang, Lichao Sun, Jiang Bian, Gloria Lipori, Duane A. Mitchell, Elizabeth A. Shenkman, Yi Guo, Thomas J. George, Yonghui Wu

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07585 2026-08-11 cs.CV cs.LG cs.MA 新提交 83%

LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents

LAVE:面向视频工具使用智能体的隐式视觉证据增强规划

Zijian Wang, Junnan Zhu, Rongzhen Li, Xiao Liu, Guohui Xiang, Quan Lu, Lijia Liu, Yining Wang, Jiang Zhong, Kaiwen Wei

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 针对视频工具使用智能体的工具观测瓶颈,提出无训练框架LAVE,通过双通道观测接口复用隐式视觉证据,在三个基准数据集上提升了智能体性能,Video-MME得分较最强基线提高3.76分。

Comments 16 pages, 6 figures, 9 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06811 2026-08-10 cs.SE cs.AI 新提交 83%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06702 2026-08-10 cs.MA cs.AI cs.RO 新提交 83%

Scalable Long-Horizon Planning with Staggered Updates for Lifelong MAPF

面向终身多智能体路径发现(LMAPF)的、采用交错更新机制的可扩展长时程规划

Vaibhav Sanjay, Jiaoyang Li

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究针对通用地图的终身多智能体路径发现问题,提出PUSH规划器,结合多种框架优势实现可扩展长时程规划,在10k智能体场景下吞吐量优于基线方法

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02650 2026-08-05 cs.AI cs.SE 新提交 83%

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28679 2026-08-03 cs.AI cs.MA 新提交 83%

Multi-Agent Planning with Spatio-Temporal and Topological Constraints using STL-GO

基于STL-GO的时空与拓扑约束下的多智能体规划

Sheryl Paul, Vidisha Kudalkar, Anand Balakrishnan, Lars Lindemann, Alberto Speranzon, Jyotirmoy V. Deshmukh

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 针对多智能体规划中的时空与拓扑约束难题,提出基于STL-GO的混合整数规划与可满足性模理论两种编码方案,在多无人机搜索与救援基准上验证了其表达能力。

Comments Accepted at Formal Methods for Computer-Aided Design 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24582 2026-07-28 cs.CV cs.AI 新提交 83%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 83%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 规划推理 :self-correction(title);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16421 2026-07-21 cs.AI 新提交 83%

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

何时进行规划:学习在反应式控制和审慎规划之间进行选择

Adam Labiosa, Josiah P. Hanna

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究智能体如何学习元推理能力,引入基于反应式策略不确定性得分分配计算的强化学习方法训练元推理策略,通过实证研究表明该设计能让元推理策略学会何时采用反应式策略,何时进行决策时规划,且能随反应式策略改进转向完全反应式控制。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16199 2026-07-21 cs.AI 新提交 83%

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统

Yuhang Wang

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14658 2026-07-17 cs.AI 新提交 83%

TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning

TopoAgent:用于多模态科学推理的自进化拓扑智能体

Mingze Xu, Yinghui Li, Jiayi Kuang, Zhanhui Kang, Di Yin, Ying Shen, Xing Sun, Yuxing Han

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型科学推理难题,提出TopoAgent自进化拓扑框架,用图进化取代线性轨迹,通过前端分解器、DAG组织原子及自适应原子裂变实现,实验证明其显著优于线性智能体框架,为科学推理提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09790 2026-07-14 cs.AI cs.CY 新提交 83%

Semantic Drift and the Stability of Operator Control in Reasoning-Class Decision Support Systems

语义漂移与推理类决策支持系统中操作员控制的稳定性

M. L. Kaluzhsky, V. A. Efirov

机构 * Omsk State Technical University(鄂木斯克国立技术大学)

专题命中 规划推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 研究新一代人机混合决策支持系统中操作员控制稳定性问题,通过实验验证推理LLMs语义漂移现象,提出人机界面交互数学模型及控制稳定性系数,在认知组理论范式下捕捉临界点,给出相关工程建议。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04681 2026-07-07 cs.RO cs.AI 新提交 83%

Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning

视觉语言动作模型所言即所指?论忠实性在具身推理中的作用

Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone

机构 * Stanford University(斯坦福大学) Politecnico di Milano(米兰理工大学) KTH Royal Institute of Technology(皇家理工学院) Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所) NVIDIA Research(英伟达研究院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究视觉语言动作模型中具身思维链是否真实反映决策过程。区分功能推理与忠实推理,指出当前对齐策略不足,通过人类评估揭示差距,用学习的评论家操作具身忠实性的行为替代物,强化学习后训练策略提升了忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03182 2026-07-07 cs.RO cs.AI 新提交 83%

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

AnchorVLA:为视觉-语言-动作规划连接离散决策与连续轨迹

Qi Liu, Yabei Li, Hongsong Wang, Heng Zhang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与交通国家重点实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Meituan Inc.(美团公司) Dongfeng Motor Corporation(东风汽车公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 自动驾驶规划需将多种信息转化为连续轨迹,现有视觉-语言-动作(VLA)规划器有局限。提出AnchorVLA框架,用轨迹模式锚连接高层VLA推理与连续轨迹执行,提升效率、语义动作对齐和生成灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27806 2026-07-07 cs.AI 新提交 83%

Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出GILP方法,结合小参数化世界模型与LLM推理,通过一致性门控减少幻觉,在规划基准上将幻觉率从0.176降至0.035,成功率从0.668提升至0.838。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00283 2026-07-02 cs.RO cs.AI cs.CV 新提交 83%

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

隐藏之物至关重要:使用视觉语言模型识别规划关键性的被遮挡智能体

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型(VLM)识别对自车轨迹影响最大的被遮挡智能体,通过规划KL散度(PKL)度量进行排序,并微调VLM以提升性能,实验表明该方法比随机采样提升约30%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交 83%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31200 2026-07-01 cs.AI 新提交 83%

Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping

Agentic RAG-VLM:基于自反规划与可操作性感知的检索增强生成在机器人抓取中的应用

Tao Chen, Lizheng Liu, Jiaxu Wang, Ziyue Jiang, Ruiqi Tian, JiGuang Huo, Zhongxue Gan

机构 * Fudan University(复旦大学) Kean University(肯恩大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出Agentic RAG-VLM框架,通过可操作性感知检索、场景图推理和自反规划,在杂乱环境中实现鲁棒抓取,成功率78.3%,比纯VLM基线提升53.3个百分点。

Comments 8 pages,5 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27757 2026-06-29 cs.AI 新提交 83%

Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

迈向可靠稳健的LLM规划:符号反馈驱动的迭代自我精炼框架

Jiajing Zhang, Jiamei Jiang, Chenyang Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出符号反馈驱动的迭代自我精炼框架,通过自然语言提示、符号验证器和计划识别器增强LLM在长时域规划中的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 83%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21740 2026-06-23 cs.AI 新提交 83%

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

训练编排器:一种基于监督学习的端到端PDDL规划方法,使用LLM智能体

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

机构 * Oregon State University(俄勒冈州立大学)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出HALO框架,通过监督学习训练编排器,利用验证器提供的轨迹作为监督信号,在11个PDDL领域上以极低成本实现与前沿LLM相当的成功率。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-06-16 cs.CL 新提交 83%

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏