arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2510.21007 2026-01-09 cs.CL 85%

Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?

置信度估计何时决定大语言模型需要链式推理

Samuel Lewis-Lim, Xingwei Tan, Zhixue Zhao, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究通过置信度门控CoT技术,探讨如何根据置信度估计决定是否需要链式推理,以优化大语言模型的计算资源使用。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24957 2026-01-09 cs.AI 83%

AMAP Agentic Planning Technical Report

AMAP 代理规划技术报告

AMAP AI Agent Team, Yulan Hu, Xiangwen Zhang, Sheng Ouyang, Hao Yi, Lu Xu, Qinglin Lang, Lide Tan, Xiang Cheng, Tianchen Ye, Zhicong Li, Ge Chen, Wenjin Yang, Zheng Pan, Shaopan Xiong, Siran Yang, Ju Huang, Yan Zhang, Jiamang Wang, Yong Liu, Yinfeng Huang, Ning Wang, Tucheng Lin, Xin Li, Ning Guo

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 STAgent是一种专门用于时空理解的代理大语言模型,通过稳定工具环境、分层数据筛选和级联训练配方,有效解决复杂任务并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04699 2026-01-09 cs.RO cs.AI 79%

SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning

SeqWalker: 基于分层规划的序列地平线视觉-语言导航

Zebin Han, Xudong Wang, Baichen Liu, Qi Lyu, Zhenduo Shang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 SeqWalker通过分层规划框架解决多任务视觉-语言导航中的信息过载问题,通过高层规划减少认知负荷,低层规划利用指令逻辑结构校正轨迹误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04668 2026-01-09 cs.RO cs.AI 79%

Optimizing Path Planning using Deep Reinforcement Learning for UGVs in Precision Agriculture

利用深度强化学习优化无人机在精准农业中的路径规划

Laukik Patade, Rohan Rane, Sandeep Pillai

机构 * Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究利用深度强化学习优化无人机在精准农业中的路径规划,通过DDPG和TD3算法在动态环境中实现高成功率的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03948 2026-01-09 cs.AI q-fin.TR 79%

Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification

Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境

Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04334 2026-01-09 cs.RO math.OC 78%

Autonomous Reasoning for Spacecraft Control: A Large Language Model Framework with Group Relative Policy Optimization

自主推理的航天器控制:一种基于大语言模型的框架与群体相对策略优化

Amit Jain, Richard Linares

机构 * Department of Aeronautics \& Astronautics Massachusetts Institute of Technology Cambridge, MA 02139

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出一种基于大语言模型和群体相对策略优化的自主推理航天器控制框架,通过两阶段训练方法生成可解释的控制策略,适用于复杂动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06042 2026-01-09 cs.MA 78%

Agent+P: Guiding UI Agents via Symbolic Planning

Agent+P: 通过符号规划引导UI代理

Shang Ma, Xusheng Xiao, Yanfang Ye

专题命中 规划推理 :planning(title,abstract)

AI总结 AGENT+P通过符号规划引导UI代理,提升UI自动化任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04234 2026-01-09 cs.AI 70%

Formal Analysis of AGI Decision-Theoretic Models and the Confrontation Question

AGI决策理论模型的正式分析及对峙问题

Denis Saklakov

机构 * Denis Saklakov(独立研究者)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文分析了AGI在何种条件下会选择夺取权力而非合作,并推导出对峙的阈值条件,探讨了奖励设计和监管的 implications。

Comments 18 pages, 2 tables. Version 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 67%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04767 2026-01-09 cs.AI cs.CL 62%

AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search

AT$^2$PO: 通过树搜索实现基于回合的代理策略优化

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AT$^2$PO 通过树搜索实现多轮代理强化学习,解决探索多样性、奖励分配和策略优化不一致问题,提升性能达1.84个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04888 2026-01-09 cs.AI 57%

SmartSearch: Process Reward-Guided Query Refinement for Search Agents

SmartSearch: 基于过程奖励的查询优化用于搜索代理

Tongyu Wen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 SmartSearch通过过程奖励和查询优化机制提升搜索代理的查询质量与效率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04742 2026-01-09 cs.CL 57%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04703 2026-01-09 cs.AI 57%

Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search

超越单一架构:一种多智能体搜索与知识优化框架用于智能搜索

Yiqun Chen, Lingyong Yan, Zixuan Yang, Erhan Zhang, Jiashu Zhao, Shuaiqiang Wang, Dawei Yin, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Baidu Inc.(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 M-ASK提出了一种多智能体框架,通过分解智能搜索为搜索行为和知识管理两个角色,提升搜索效率与稳定性,实现更优的答案准确性和训练动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04516 2026-01-09 cs.CL 57%

LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue Generation

LinguaGame: 一种基于语言的多智能体对话生成博弈论范式

Yuxiao Ye, Yiming Zhang, Yiran Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) East China University of Political Science and Law(中国政法大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 57%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04327 2026-01-09 cs.DC cs.AI 57%

ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation

ParaCodex: 一种基于性能分析的自主编码代理,用于可靠并行代码生成与翻译

Erel Kaplan, Tomer Bitan, Lian Ghrayeb, Le Chen, Tom Yotam, Niranjan Hasabnis, Gal Oren

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ParaCodex是一种基于性能分析的自主编码代理,通过分阶段热点分析、显式数据规划和正确性门控,实现高效并行代码生成与翻译,显著提升GPU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03135 2026-01-09 cs.AI 57%

Beyond Retrieval: Improving Evidence Quality for LLM-based Multimodal Fact-Checking

超越检索:提升基于大语言模型的多模态事实核查的证据质量

Haoran Ou, Gelei Deng, Xingshuo Han, Jie Zhang, Han Qiu, Shangwei Guo, Tianwei Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Aletheia框架,通过改进证据检索策略提升多模态事实核查的证据质量,实验证明其在虚假信息检测中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24385 2026-01-09 cs.CV cs.RO 50%

Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems

锻造空间智能:面向自主系统多模态数据预训练的路线图

Song Wang, Lingdong Kong, Xiaolu Liu, Hao Shi, Wentong Li, Jianke Zhu, Steven C. H. Hoi

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理学院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出多模态数据预训练框架,旨在通过整合多传感器数据提升自主系统空间智能,解决单模态模型整合难题,并提出统一的预训练范式分类及未来发展方向。

Comments Survey; 40 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-spatial-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏