arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-22 至 2026-01-22 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 13 篇

2601.14456 2026-01-22 cs.AI cs.LG 88%

On the Generalization Gap in LLM Planning: Tests and Verifier-Reward RL

在LLM规划中的泛化差距:测试与验证者奖励强化学习

Valerio Belcamino, Nicholas Attolino, Alessio Capitanelli, Fulvio Mastrogiovanni

机构 * Department of Informatics, Bioengineering, Robotics and Systems Engineering, University of Genoa(信息学、生物工程、机器人学和系统工程系,热那亚大学) AIKO S.r.l.(AIKO公司)

专题命中 规划推理 :planning(title,abstract);verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究发现微调LLM在规划任务中存在显著的泛化差距,通过三种诊断干预揭示模型依赖领域特定模式而非可转移能力。

Comments 9 pages, 4 figures, 3 tables, 2 pages of supplementary materials. Submitted to a conference implementing a double-blind review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05516 2026-01-22 cs.LG cs.AI cs.CL 82%

BayesAgent: Bayesian Agentic Reasoning Under Uncertainty via Verbalized Probabilistic Graphical Modeling

BayesAgent: 通过 verbalized 概率图模型实现不确定性下的贝叶斯代理推理

Hengguan Huang, Xing Shen, Songtao Wang, Lingfa Meng, Dianbo Liu, David Alejandro Duchene, Hao Wang, Samir Bhatt

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BayesAgent 通过 verbalized 概率图模型实现不确定性下的贝叶斯代理推理,提升置信度校准和文本生成质量。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14560 2026-01-22 cs.CL 79%

Rewarding How Models Think Pedagogically: Integrating Pedagogical Reasoning and Thinking Rewards for LLMs in Education

奖励模型如何思考:在教育中整合教学推理和思考奖励

Unggi Lee, Jiyeong Bae, Jaehyeon Park, Haeun Park, Taejun Park, Younghoon Jeon, Sungmin Cho, Junbo Koh, Yeil Jeong, Gyeonggeon Lee

机构 * Chosun University(昌原大学) Korea University(韩国大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程与评价研究院) Upstage Indiana University Bloomington(印第安纳大学布卢明顿分校) Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PedagogicalRL-Thinking框架,通过教学推理提示和思考奖励方法,提升LLM在教育场景中的教学推理能力和结构化决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14615 2026-01-22 cs.CL cs.AI 73%

SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation

SearchGym: 通过高效且高保真的环境模拟提升现实世界搜索代理

Xichen Zhang, Ziyi He, Yinghao Zhu, Sitong Wu, Shaozuo Yu, Meng Chu, Wenhu Zhang, Haoru Tan, Jiaya Jia

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 SearchGym通过高效高保真的模拟环境提升搜索代理的鲁棒性和性能,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14437 2026-01-22 cs.RO cs.AI 70%

Agentic AI Meets Edge Computing in Autonomous UAV Swarms

代理AI遇见边缘计算在自主无人机群中

Thuan Minh Nguyen, Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Québec(INRS大学、魁北克大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出利用LLM驱动的代理AI与边缘计算结合,提升无人机群在高风险场景中的自主性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15047 2026-01-22 cs.MA cs.GT 67%

Game-Theoretic Lens on LLM-based Multi-Agent Systems

基于博弈论的基于大语言模型的多智能体系统视角

Jianing Hao, Han Ding, Yuanjian Xu, Tianze Sun, Ran Chen, Wanbo Zhang, Guang Zhang, Siguang Li

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文通过博弈论视角,系统综述了基于大语言模型的多智能体系统,构建了理解、比较和指导未来研究的框架。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14711 2026-01-22 cs.AI cs.LG 62%

DARA: Few-shot Budget Allocation in Online Advertising via In-Context Decision Making with RL-Finetuned LLMs

DARA: 通过基于上下文的决策制定实现在线广告中的少样本预算分配

Mingxuan Song, Yusen Huo, Bohan Zhou, Shenglin Yin, Zhen Xiao, Jieyi Long, Zhilin Zhang, Chuan Yu

机构 * Peking University(北京大学) School of Computer Science(计算机科学学院) Alibaba Group(阿里巴巴集团) Theta Labs, Inc.(Theta Labs公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DARA通过结合LLMs的上下文学习与细粒度优化,实现在线广告中的少样本预算分配,提升广告商价值。

Comments Accepted at The ACM Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19094 2026-01-22 cs.CL cs.AI cs.IR 62%

Pathways of Thoughts: Multi-Directional Thinking for Long-form Personalized Question Answering

思维路径:多方向思考用于长文本个性化问答

Alireza Salemi, Cheng Li, Mingyang Zhang, Qiaozhu Mei, Zhuowan Li, Spurthi Amba Hombaiah, Weize Kong, Tao Chen, Hamed Zamani, Michael Bendersky

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google DeepMind(谷歌DeepMind) University of Michigan(密歇根大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PoT方法,通过多方向思考生成个性化问答响应,实验证明其在长文本问答任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14914 2026-01-22 cs.CL 57%

CodeDelegator: Mitigating Context Pollution via Role Separation in Code-as-Action Agents

CodeDelegator: 通过角色分离缓解上下文污染在代码作为行动代理中

Tianxiang Fei, Cheng Chen, Yue Pan, Mao Zheng, Mingyang Song

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 CodeDelegator通过角色分离缓解上下文污染,利用多代理框架实现战略规划与实现的分离,提升代码作为行动代理的长期性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11888 2026-01-22 cs.IR cs.CL 57%

Agentic-R: Learning to Retrieve for Agentic Search

Agentic-R: 为代理搜索学习检索

Wenhan Liu, Xinyu Ma, Yutao Zhu, Yuchen Li, Daiting Shi, Dawei Yin, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种针对代理搜索的检索器训练框架,通过结合局部查询-段落相关性和全局答案正确性,提升多轮搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14681 2026-01-22 cs.RO 50%

FARE: Fast-Slow Agentic Robotic Exploration

FARE:快速-缓慢代理机器人探索

Shuhao Liao, Xuxin Lv, Jeric Lew, Shizhe Zhang, Jingsong Liang, Peizhuo Li, Yuhong Cao, Wenjun Wu, Guillaume Sartoretti

机构 * Beihang University, China(北航大学) Department of Mechanical Engineering, National University of Singapore(机械工程系,新加坡国立大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 FARE通过结合大型语言模型和强化学习策略,实现了高效且稳健的机器人探索,显著提升了探索效率并验证了其在大规模建筑环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14544 2026-01-22 cs.CR 50%

AI Agents vs. Human Investigators: Balancing Automation, Security, and Expertise in Cyber Forensic Analysis

AI代理与人类调查员:在自动化、安全与专业知识之间平衡网络取证分析

Sneha Sudhakaran, Naresh Kshetri

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究比较了AI代理与人类调查员在网络取证分析中的有效性,揭示AI的局限性及人类监督的重要性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08012 2026-01-22 cs.SI 50%

Do We Really Need SFT? Prompt-as-Policy over Knowledge Graphs for Cold-start Next POI Recommendation

我们真的需要SFT吗?基于知识图谱的提示作为策略用于冷启动下POI推荐

Jinze Wang, Lu Zhang, Yiyang Cui, Tiehua Zhang, Zhishu Shen, Yuze Liu, Xingjun Ma, Jiong Jin

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出基于知识图谱的提示作为策略方法,通过构建可学习的决策过程提升冷启动下POI推荐性能,实现对非活跃用户11.87%的Acc@1提升。

详情

展开后加载摘要…

URL PDF HTML 收藏