arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-26 至 2026-01-26 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11 篇

2601.01011 2026-01-26 cs.CL cs.AI 84%

Intention Collapse: Intention-Level Metrics for Reasoning in Language Models

意图坍缩:语言模型推理中的意图级度量

Patricio Vera

机构 * School of Engineering and Applied Science(工程与应用科学学院) George Washington University(乔治·华盛顿大学)

专题命中 规划推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究提出意图级度量用于评估语言模型推理性能,通过意图熵、有效维度和可恢复性分析CoT方法的效果差异。

Comments 41 pages, 8 figures, 6 tables. Code: https://github.com/patriciomvera/intention-collapse-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16480 2026-01-26 cs.CL 79%

TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

TL-GRPO:基于回合的强化学习用于推理引导的迭代优化

Peiji Li, Linyang Li, Handa Sun, Wenjin Mai, Yongkang Chen, Xiaozhe Li, Yue Shen, Yichuan Ma, Yiliu Sun, Jiaxi Cao, Zhishu He, Bo Wang, Xiaoqing Zheng, Zhaori Bi, Xipeng Qiu, Qipeng Guo, Kai Chen, Dahua Lin

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TL-GRPO通过回合级分组采样优化解决迭代优化任务中的轨迹级强化学习问题,实现更精细的优化效果。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16486 2026-01-26 cs.CL cs.AI 73%

Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic

及时机器:时间意识使测试时间缩放成为代理

Yichuan Ma, Linyang Li, Yongkang chen, Peiji Li, Xiaozhe Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Fudan University Shanghai AI Laboratory(复旦大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 Timely Machine通过重新定义测试时间为实时时钟时间,提出Timely-RL方法提升时间预算意识,以应对高频工具调用和时间受限推理的挑战。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16276 2026-01-26 cs.CL cs.AI cs.GT cs.LG cs.MA 67%

GameTalk: Training LLMs for Strategic Conversation

GameTalk: 训练 LLMs 进行战略性对话

Victor Conchello Vendrell, Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GameTalk 通过多轮互动训练 LLMs 实现战略性决策,优于传统方法,尤其在奖励塑造下表现突出。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16895 2026-01-26 cs.CV cs.AI 57%

Evaluating Large Vision-language Models for Surgical Tool Detection

评估大型视觉-语言模型用于手术工具检测

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工大学) Center for Imaging Science(成像科学中心) Center for Imaging Science and Biomedical Engineering(成像科学与生物医学工程中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估了三种大型视觉-语言模型在手术工具检测任务中的性能,发现Qwen2.5在检测和泛化能力上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16649 2026-01-26 cs.AI 57%

LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents

LUMINA:多轮交互智能体的长视图理解

Amin Rakhsha, Thomas Hehn, Pietro Mazzaglia, Fabio Valerio Massoli, Arash Behboodi, Tribhuvanesh Orekondy

机构 * University of Toronto(多伦多大学) Qualcomm AI Research(高通人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LUMINA研究通过oracle反事实框架分析多轮交互智能体中各基础能力的重要性,揭示了不同技能在不同环境下的有效性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16479 2026-01-26 cs.AI 57%

Doc2AHP: Inferring Structured Multi-Criteria Decision Models via Semantic Trees with LLMs

Doc2AHP: 通过语义树利用LLMs推断结构化的多准则决策模型

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Doc2AHP通过结合AHP原理和LLMs,实现结构化多准则决策模型的高效推断,提升决策模型的逻辑完整性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 57%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12698 2026-01-26 cs.CL 57%

A Two-Stage GPU Kernel Tuner Combining Semantic Refactoring and Search-Based Optimization

一种结合语义重构和基于搜索的优化的双阶段GPU内核调优器

Qiuyi Qu, Yicheng Sui, Yufei Sun, Rui Chen, Xiaofei Zhang, Yuzhi Zhang, Haofeng Wang, Ge Lan

机构 * NanKai University(南开大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出一种结合语义重构和基于搜索的双阶段GPU内核调优器,通过模板化和参数优化提升内核性能,实现更稳定和高质量的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01238 2026-01-26 cs.AI 57%

Towards Open-World Retrieval-Augmented Generation on Knowledge Graph: A Multi-Agent Collaboration Framework

面向知识图谱的开放世界检索增强生成:一种多智能体协作框架

Jiasheng Xu, Mingda Li, Yongqiang Tang, Peijie Wang, Wensheng Zhang

机构 * School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AnchorRAG通过多智能体协作框架,在无需预定义锚实体的情况下提升开放世界检索增强生成的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16356 2026-01-26 cs.HC 50%

The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes

LLM驱动的GUI代理的行为织体:人类价值观与交互结果

Simret Araya Gebreegziabher, Yukun Yang, Charles Chiang, Hojun Yoo, Chaoran Chen, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Diego Gómez-Zará, Toby Jia-Jun Li

专题命中 规划推理 :reasoning(abstract)

AI总结 本文研究了LLM驱动的GUI代理中人类价值观如何影响其行为和交互结果,提出了一种开源测试平台和实证分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏