arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-28 至 2026-01-28 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2503.21961 2026-01-28 cs.CL cs.AI 86%

Entropy-Gated Branching for Efficient Test-Time Reasoning

熵门分支用于高效的测试时间推理

Xianzhi Li, Ethan Callanan, Abdellah Ghassel, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs Research Institute(电气与计算机工程系及创新实验室研究所)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 熵门分支通过在高不确定步骤进行分支并修剪扩展,提升LLM测试时间推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19611 2026-01-28 cs.LG cs.AI cs.CL 67%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

2510.24940 2026-01-28 cs.CL 89%

SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens

SemCoT:通过语义对齐的隐式令牌加速链式推理

Yinhan He, Wendy Zheng, Yaochen Zhu, Zaiyi Zheng, Lin Su, Sriram Vasudevan, Qi Guo, Liangjie Hong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) LinkedIn Inc.(领英公司)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 SemCoT通过语义对齐的隐式令牌优化,提升链式推理的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19834 2026-01-28 cs.AI 86%

Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models

视觉生成通过多模态世界模型解锁类人推理

Jialong Wu, Xiaoying Zhang, Hongyi Yuan, Xiangcheng Zhang, Tianhao Huang, Changjing He, Chaoyi Deng, Renrui Zhang, Youbin Wu, Mingsheng Long

机构 * Tsinghua University(清华大学)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。

Comments Project page: https://thuml.github.io/Reasoning-Visual-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19605 2026-01-28 cs.CL 57%

Decompose-and-Formalise: Recursively Verifiable Natural Language Inference

分解与形式化:可递归验证的自然语言推理

Xin Quan, Marco Valentino, Louise A. Dennis, André Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出分解与形式化框架,通过自底向上的验证和局部诊断引导细化,提升自然语言推理的解释验证效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26201 2026-01-28 cs.AI cond-mat.mes-hall cond-mat.mtrl-sci 57%

LLM Agents for Knowledge Discovery in Atomic Layer Processing

用于原子层处理中知识发现的LLM代理

Andreas Werbrouck, Marshall B. Lindsay, Matthew Maschmann, Matthias J. Young

机构 * University of Missouri Columbia(密苏里大学哥伦比亚分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用LLM代理在原子层处理中探索化学相互作用,通过试错和持续探索实现知识发现。

Comments Accepted submission to the AI4MAT workshop@NEURIPS 2025. As submitted, except author names added

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 1 篇

2601.19170 2026-01-28 cs.AI 57%

Multi-Agent Procedural Graph Extraction with Structural and Logical Refinement

多代理过程图提取与结构逻辑细化

Wangyang Ying, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, Haifeng Chen

机构 * Arizona State University(亚利桑那州立大学) NEC Labs America(NEC美国实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多代理框架\model{},通过结构和逻辑细化提升过程图提取的准确性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 9 篇

2506.12241 2026-01-28 cs.AI cs.LG 81%

Privacy Reasoning in Ambiguous Contexts

模糊情境中的隐私推理

Ren Yi, Octavian Suciu, Adria Gascon, Sarah Meiklejohn, Eugene Bagdasarian, Marco Gruteser

机构 * Google Research(谷歌研究)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过设计Camber框架,探讨上下文消歧对提升语言模型隐私推理能力的影响,实验显示消歧可显著提高精度和召回率,减少提示敏感性。

Journal ref Advances in Neural Information Processing Systems 38 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14852 2026-01-28 cs.DC cs.AI cs.CL cs.LG cs.PF 75%

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

代理计划缓存:用于快速且低成本LLM代理的测试时间内存

Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Agentic Plan Caching通过测试时间内存提取并重用结构化计划模板,降低LLM代理服务成本和延迟,提升效率。

Comments NeurIPS 2025. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19214 2026-01-28 cs.CL cs.AI 62%

A Hybrid Supervised-LLM Pipeline for Actionable Suggestion Mining in Unstructured Customer Reviews

一种混合监督-大语言模型管道用于无结构客户评论中的可操作建议挖掘

Aakash Trivedi, Aniket Upadhyay, Pratik Narang, Dhruv Kumar, Praveen Kumar

机构 * Department of Computer Science & Information Systems, Birla Institute of Technology and Science, Pilani, India(印度比拉理工学院计算机科学与信息系统系) Birdeye Inc.(Birdeye公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种混合监督-大语言模型管道,用于从无结构客户评论中精准提取可操作建议,通过结合RoBERTa分类器和指令调优的LLM,提升提取准确性和聚类一致性,同时揭示领域适应与部署挑战。

Comments Accepted to EACL 2026 Industry Track (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19607 2026-01-28 cs.AI 57%

ComAgent: Multi-LLM based Agentic AI Empowered Intelligent Wireless Networks

ComAgent:基于多LLM的代理式AI赋能智能无线网络

Haoyun Li, Ming Xiao, Kezhi Wang, Robert Schober, Dong In Kim, Yong Liang Guan

机构 * IEEE

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ComAgent通过多LLM代理式AI框架,实现复杂无线网络任务的自动化设计与优化,展现出超越单体LLM的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16778 2026-01-28 cs.HC cs.AI 57%

GTA: Generative Traffic Agents for Simulating Realistic Mobility Behavior

GTA:生成交通代理用于模拟真实移动行为

Simon Lämmer, Mark Colley, Patrick Ebel

机构 * Leipzig University(莱比锡大学) UCL Interaction Centre(UCL互动中心) ScaDS.AI, Leipzig University(ScaDS.AI,莱比锡大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GTA通过基于角色的代理和大语言模型模拟大规模交通行为,提供了一种无需手工规则的类人交通模拟方法,用于研究未来创新对出行决策的影响。

Comments This version has been conditionally accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12542 2026-01-28 cs.AI 57%

Rethinking the AI Scientist: Interactive Multi-Agent Workflows for Scientific Discovery

重新思考AI科学家:用于科学发现的交互式多智能体工作流

Lukas Weidener, Marko Brkić, Mihailo Jovanović, Ritvik Singh, Chiara Baccin, Emre Ulgac, Alex Dobrin, Aakaash Meduri

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 Deep Research通过交互式多智能体系统实现快速科学发现,其在计算生物学基准上达到领先性能,显著提升研究效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 57%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07639 2026-01-28 cs.AI 57%

PowerGraph-LLM: Novel Power Grid Graph Embedding and Optimization with Large Language Models

PowerGraph-LLM: 利用大语言模型的新型电力网络图嵌入与优化框架

Fabien Bernier, Jun Cao, Maxime Cordy, Salah Ghamizi

机构 * SnT, University of Luxembourg, Luxembourg(卢森堡大学SnT学院,卢森堡) Luxembourg Institute of Health (LIH), Luxembourg(卢森堡健康研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 PowerGraph-LLM利用大语言模型解决电力系统最优潮流问题,结合图与表格表示以捕捉复杂关系,并通过定制的微调协议提升性能。

Comments Published at IEEE Transactions on Power Systems

Journal ref IEEE Transactions on Power Systems (Volume: 40, Issue: 6, Pages: 5483 - 5486, November 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19203 2026-01-28 cs.HC 50%

Before Smelling the Video: A Two-Stage Pipeline for Interpretable Video-to-Scent Plans

在嗅觉之前:一种可解释的视频到香氛计划的两阶段流程

Kaicheng Wang, Kevin Zhongyang Shao, Ruiqi Chen, Sep Makhsous, Denise Wilson

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种两阶段流程,通过视觉语言模型和大型语言模型分离视频语义提取与气味推断,验证了语义规划在提升嗅觉媒体体验中的有效性。

Comments In submission of poster as ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 6 篇

2601.19204 2026-01-28 cs.AI cs.CV 79%

MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning

MATA:一种用于多智能体视觉推理的可训练分层自动机系统

Zhixi Cai, Fucai Ke, Kevin Leo, Sukai Huang, Maria Garcia de la Banda, Peter J. Stuckey, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MATA是一种基于分层自动机的多智能体系统,通过可训练超智能体选择最优智能体进行视觉推理,实现高效任务解决。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18305 2026-01-28 cs.CV 78%

DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition

DiVE-k:基于微细图像识别的差分视觉推理

Raja Kumar, Arka Sadhu, Ram Nevatia

机构 * University of Southern California(南加州大学) Meta

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DiVE-k通过利用模型自身top-k预测作为训练信号,提升细粒度图像识别的差分推理能力,显著优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19155 2026-01-28 cs.AI cs.CV 57%

LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge

LocationAgent: 一种基于解耦策略和参数知识证据的图像地理定位分层代理

Qiujun Li, Zijin Xiao, Xulin Wang, Zhidan Ma, Cheng Yang, Haifeng Li

机构 * Central South University(中南大学) ByteDance (China)(字节跳动(中国))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 LocationAgent通过分层推理和外部证据验证,有效提升图像地理定位的准确性和泛化能力。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 50%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19433 2026-01-28 cs.CV 50%

RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming

RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成

Jisheng Chu, Wenrui Li, Rui Zhao, Wangmeng Zuo, Shifeng Chen, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanyang Technological University(南洋理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14233 2026-01-28 cs.CV 50%

Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception

通过视觉属性增强描述性标题以实现多模态感知

Yanpeng Sun, Jing Hao, Ke Zhu, Jiang-Jiang Liu, Yuxiang Zhao, Xiaofan Li, Na Zhao, Zechao Li, Jingdong Wang

机构 * NJUST(南京理工大学) Baidu VIS(百度视觉部) HKU(香港大学) NJU(南京大学) SUTD(新加坡科技设计大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EDC方法,通过整合视觉专家的低级和细粒度属性,提升图像标题的描述质量,以增强多模态感知能力。

Comments An open-source Agent for generating detailed image captions

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 8 篇

2601.19249 2026-01-28 cs.AI 83%

GLOVE: Global Verifier for LLM Memory-Environment Realignment

GLOVE:LLM内存-环境重对齐的全局验证器

Xingkun Yin, Hongyang Du

机构 * University of Hong Kong(香港大学)

专题命中 测试时计算 :verifier(title,abstract);planning(abstract);分类 cs.AI

AI总结 GLOVE通过引入相对真理的概念,实现LLM内存与环境的自适应重对齐,无需地面真相监督或强依赖模型反思,提升代理在动态环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19280 2026-01-28 cs.LG cs.AI cs.CL 83%

Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning

基于组分布鲁棒优化的强化学习用于大语言模型推理

Kishan Panaganti, Zhenwen Liang, Wenhao Yu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab in Bellevue WA USA(腾讯AI实验室(西雅图华盛顿州))

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多对手组分布鲁棒优化框架,通过动态调整训练分布提升大语言模型推理性能,实现训练后精度提升10.6%和10.1%。

Comments Keywords: Large Language Models, Reasoning Models, Reinforcement Learning, Distributionally Robust Optimization, GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17498 2026-01-28 cs.LG cs.AI cs.CL 82%

Improving Value-based Process Verifier via Structural Prior Injection

通过结构先验注入改进基于价值的过程验证器

Zetian Sun, Dongfang Li, Baotian Hu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过注入结构先验改进基于价值的过程验证器,提升其性能并减少误差。

Comments This version is deprecated. Please refer to our new version: arXiv:2508.10539

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10539 2026-01-28 cs.AI cs.CL 81%

Improving Value-based Process Verifier via Low-Cost Variance Reduction

通过低成本方差减少改进基于价值的过程验证器

Zetian Sun, Dongfang Li, Baotian Hu, Min Zhang

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ComMCS方法,通过低成本方差减少改进基于价值的过程验证器,有效提升数学推理能力。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19847 2026-01-28 cs.CL 79%

Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering

识别并转移推理关键神经元:通过激活引导提升LLM推理可靠性

Fangan Dong, Zuming Yan, Xuri Ge, Zhiwei Xu, Mengqi Zhang, Xuanang Chen, Ben He, Xin Xin, Zhumin Chen, Ying Zhou

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出AdaRAS,通过识别并引导推理关键神经元提升LLM推理可靠性,实验显示在数学和编程基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14140 2026-01-28 cs.AI 79%

RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning

思维强化学习:通过推理时间强化学习导航大语言模型推理

Qianyue Hao, Sibo Li, Jian Yuan, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 RL-of-Thoughts通过强化学习训练轻量级导航模型,提升大语言模型推理能力,实现多任务适应性和参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07981 2026-01-28 cs.CL cs.AI cs.LG stat.ML 67%

Why is Your Language Model a Poor Implicit Reward Model?

为什么你的语言模型是一个差的隐式奖励模型?

Noam Razin, Yong Lin, Jiarui Yao, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现隐式奖励模型(IM-RM)在泛化能力上劣于显式奖励模型(EX-RM),因其更依赖表面token级线索,而设计选择对模型泛化行为有显著影响。

Comments Accepted to ICLR 2026; Code available at https://github.com/princeton-pli/exrm-vs-imrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13547 2026-01-28 cs.CL 57%

ThinkNote: Enhancing Knowledge Integration and Utilization of Large Language Models via Constructivist Cognition Modeling

ThinkNote: 通过建构主义认知建模增强大型语言模型的知识整合与利用

Zhipeng Xu, Zhenghao Liu, Yukun Yan, Shuo Wang, Shi Yu, Zheni Zeng, Chaojun Xiao, Zhiyuan Liu, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ThinkNote通过建构主义认知建模提升大型语言模型的知识整合与利用能力,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏