arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 16 篇

2505.18561 2026-02-03 cs.CV 91%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract)

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01237 2026-02-03 cs.AI 85%

Predictive Scheduling for Efficient Inference-Time Reasoning in Large Language Models

为大语言模型的高效推理时间推理进行预测调度

Katrina Brown, Aneesh Muppidi, Rana Shahout

机构 * Harvard College(哈佛学院) Harvard SEAS(哈佛工程与应用科学学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 预测调度通过预运行轻量级预测器优化标记预算分配,提升大语言模型在推理任务中的准确性和效率。

Comments ICML ES-FoMo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01791 2026-02-03 cs.LG 79%

Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning

Grad2Reward: 从稀疏判断到密集奖励以提升开放性大语言模型推理

Zheng Zhang, Ao Lu, Yuanhao Zeng, Ziwei Shan, Jinjin Guo, Lufei Li, Yexin Li, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 Grad2Reward通过从判断者模型推理过程中提取密集过程奖励,提升开放性大语言模型推理的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00154 2026-02-03 cs.CR cs.AI 79%

ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models

ReasoningBomb: 通过诱导病态长推理实现隐蔽的拒绝服务攻击

Xiaogeng Liu, Xinyan Wang, Yechao Zhang, Sanjay Kariyappa, Chong Xiang, Muhao Chen, G. Edward Suh, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) University of California, Davis(加州大学戴维斯分校) Cornell University(康奈尔大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasoningBomb通过生成短自然提示诱导大型推理模型进入病态长推理,实现隐蔽的拒绝服务攻击,具有高放大率、隐蔽性和可优化性。

Comments Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00127 2026-02-03 cs.LG 79%

ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning

ALIGN: 多智能体LLM推理中的对齐委托与性能保证

Tong Zhu, Baiting Chen, Jin Zhou, Hua Zhou, Sriram Sankararaman, Xiaowu Dai

机构 * Department of Biostatistics, UCLA(生物统计学系,加州大学洛杉矶分校) Department of Statistics and Data Science, UCLA(统计学与数据科学系,加州大学洛杉矶分校) Department of Computer Science, UCLA(计算机科学系,加州大学洛杉矶分校) Departments of Statistics and Data Science, and of Biostatistics, UCLA(统计学与数据科学系和生物统计学系,加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 ALIGN通过多智能体对齐委托机制,提升大语言模型在复杂推理任务中的性能保障与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02143 2026-02-03 cs.LG cs.AI cs.CL 75%

Learning Generative Selection for Best-of-N

学习最佳N的生成选择

Shubham Toshniwal, Aleksander Ficek, Siddhartha Jain, Wei Du, Vahid Noroozi, Sadegh Mahdavi, Somshubra Majumdar, Igor Gitman

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过强化学习,小模型可获得强大的生成选择能力,从而在推理任务中超越基线方法并接近大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20312 2026-02-03 cs.CL 70%

SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger

SAPO:自适应过程优化使小型推理器更强

Kaiyuan Chen, Guangmin Zheng, Jin Wang, Xiaobing Zhou, Xuejie Zhang

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 SAPO通过自适应过程优化方法,有效缩小推理器与验证器之间的差距,提升小型语言模型在数学和代码任务中的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04935 2026-02-03 cs.AI cs.CL cs.LG 67%

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

MARS: 通过多智能体强化学习进行多系统深度研究

Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 glowing 人工智能学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MARS通过多智能体强化学习共进化双认知系统,无需监督微调即可在知识密集型任务中取得显著性能提升。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00426 2026-02-03 cs.LG cs.AI cs.CL eess.SP 67%

LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference

基于注意力机制的高维非线性自回归模型:训练、对齐与推理

Vikram Krishnamurthy

机构 * Cornell University(康奈尔大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将LLMs表述为具有注意力依赖的高维非线性自回归模型,探讨了训练、对齐与推理的原理及方法。

Comments 27 pages, 12 figures. Mathematical survey framing LLMs as high-dimensional nonlinear autoregressive models with attention, covering training, alignment, and inference, with nanoGPT/nanochat-style code examples. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 67%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01613 2026-02-03 cs.LG cs.AI 62%

A Practical Tensor-Network Compression Pipeline for Production-Scale Large Language Models

一种用于生产级大语言模型的实用张量网络压缩管道

Sergii Kozyrev, Davyd Maiboroda

机构 * Minima AI, Inc.(Minima AI 公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 Minima是一种用于大语言模型的实用张量网络压缩管道,通过结构压缩和自定义内核提升推理效率和吞吐量。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20169 2026-02-03 cs.LG cs.CL stat.ML 62%

Learning to Reason in LLMs by Expectation Maximization

通过期望最大化学习大语言模型的推理能力

Junghyun Lee, Branislav Kveton, Anup Rao, Subhojyoti Mukherjee, Ryan A. Rossi, Sunav Choudhary, Alexa Siu

机构 * kaist-ai(韩国科学技术院人工智能学院) adobe(Adobe研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于奖励的过滤期望最大化方法,通过不同采样方案提升大语言模型的推理能力,实验表明PPS在任务表现上优于其他方案。

Comments 27 pages, 15 figures, 5 tables (ver2: major revision, including new experiments, reorganization, etc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07448 2026-02-03 cs.CL 57%

Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey

用于科学思想生成的大型语言模型:以创造力为中心的综述

Fatemeh Shahhosseini, Arash Marioriyad, Ali Momen, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Shaghayegh Haghjooy Javanmard

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型在科学思想生成中的应用,分析了不同方法在创新性与科学合理性之间的权衡,并提出了评估框架以指导未来研究方向。

Comments 75 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01381 2026-02-03 cs.CL stat.ML 57%

On the Power of (Approximate) Reward Models for Inference-Time Scaling

在推理时间扩展中(近似)奖励模型的效能

Youheng Zhu, Yiping Lu

机构 * Department of Industrial Engineering and Management Sciences(工业工程与管理科学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了近似奖励模型在推理时间扩展中的有效性,通过理论分析表明,当贝尔曼误差被限制在O(1/T)时,结合SMC可将推理复杂度从指数级降至多项式级,显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 57%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10038 2026-02-03 cs.AI 57%

Efficient Thought Space Exploration Through Strategic Intervention

通过战略干预实现高效思维空间探索

Ziheng Li, Hengyi Cai, Xiaochi Wei, Yuchen Li, Shuaiqiang Wang, Zhi-Hong Deng, Dawei Yin

机构 * Baidu(百度)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 HPR框架通过战略干预减少计算成本,在保持高准确率的同时实现高效推理。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏