arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 27 篇

2605.11467 2026-09-01 cs.LG cs.AI 版本更新 90%

Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning

摒弃表演:用于忠实推理链的探针过滤强化学习

Swapnil Parekh, Naman Goyal

机构 * Intuit

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProFIL方法,通过探针过滤强化学习减少推理链中的表演现象,提升推理链的忠实度并缩短链长,同时在多个领域和模型架构中验证了其有效性。

Comments 17 pages. Substantially revised presentation and experiments; added Naman Goyal as a co-author; expanded evaluation, controls, and scientific appendix. Core method retained

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30679 2026-09-01 cs.CL cs.AI 新提交 89%

LCoT-GV: Graph Attention Networks for Verifying Long Reasoning Chains in Large Language Models

LCoT-GV:用于验证大语言模型中长推理链的图注意力网络

Bérénice Jaulmes, Mehwish Alam

机构 * Télécom Paris(巴黎电信学院) Institut Polytechnique de Paris(巴黎理工学院) BNP Paribas(法国巴黎银行)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);verifier(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型长推理链存在的步骤缺陷问题,提出LCoT-GV图框架结合图注意力网络验证推理链,构建新数据集且方法具竞争力。

Comments 6 pages without references, 2 tables, 1 algorithm, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28675 2026-09-01 cs.CV cs.CL 新提交 89%

Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning

用于视频推理的多智能体自增强强化学习

Mingwen Zhang, Jisheng Dang, Minqiang Yang, Bimei Wang, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL

AI总结 该研究提出结合可训练Grounder与冻结Verifier的多智能体强化学习框架,在20亿参数规模下实现视频推理任务零样本迁移,相关指标优于同等规模基线,验证了冻结验证作为证据选择训练信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03782 2026-09-01 cs.CL 版本更新 83%

Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?

基于语法的推理:合成语言推理轨迹能否增强低资源机器翻译?

Renhao Pei, Yihong Liu, Sampo Pyysalo, Hinrich Schütze, Shaoxiong Ji

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出自动生成语言推理轨迹的方法,通过上下文学习、监督微调和强化微调评估其对低资源机器翻译的影响,发现推理轨迹在推理时指导效果显著,但作为训练数据收益有限。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22635 2026-09-01 cs.CL cs.AI 版本更新 82%

Learning Composable Chains-of-Thought

学习可组合思维链

Fangcong Yin, Zeyu Leo Liu, Liu Leqi, Xi Ye, Greg Durrett

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对无标注思维链数据的组合推理任务,提出通过可组合思维链训练原子模型并结合多任务学习或模型合并,搭配拒绝采样微调,提升了大型语言模型在组合推理任务上的泛化性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06415 2026-09-01 cs.CL cs.LG 版本更新 81%

PERK: Long-Context Reasoning as Test-Time Learning

PERK:长上下文推理作为参数高效测试时学习

Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PERK通过参数高效测试时学习方法,实现对长上下文的高效推理,显著提升模型性能。

Comments ICLR 2026, 10 pages, 7 figures, test-time learning, long context, meta-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28660 2026-09-01 cs.CL cs.AI cs.LG 新提交 80%

Test-Time Scaling for Scientific Equation Discovery

科学方程发现的测试时缩放

Haowei Lin, Hubert Lim, Xiangyu Wang, Letian Huang, Di He

机构 * Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将测试时缩放(TTS)应用于开放场景的自动方程发现,建模迭代搜索过程并在固定预算下对比控制器,发现搜索宽度是主导分配参数,为缩放LLM基方程发现提供了核心思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29988 2026-09-01 cs.AI 新提交 79%

AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制

Hanjun Luo, Qiushi Liu, Jingya Zhang, Haihong Pang, Jiaheng Wen, Yifei Ma, Yu Yao, Chengxi Zhang, Hanrong Zhang, Yankai Chen, Hanan Salam

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) University of Washington Seattle(华盛顿大学西雅图分校) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-09-01 cs.CV cs.CL 版本更新 79%

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28666 2026-09-01 cs.CV 新提交 78%

Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

通过结构化视频提示提升视频-语言模型的时空推理能力

Sadegh Mohammadian

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 该研究提出无需训练的结构化视频提示方法,在推理时通过为视频添加时空结构锚点,提升视频-语言模型在时空推理任务上的性能,为改进视频理解提供了实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04363 2026-09-01 cs.LG cs.CL 版本更新 73%

Amortizing intractable inference in large language models

摊销大型语言模型中难以处理的推理

Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型的难以处理后验分布采样问题,提出用生成流网络(GFlowNets)的摊销贝叶斯推理方法微调LLM,可替代最大似然训练,还能高效适配需多步推理和工具使用的任务。

Comments ICLR 2024; 23 pages; code: this https URL (https://github.com/GFNOrg/gfn-lm-tuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30713 2026-09-01 cs.SD 新提交 67%

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

专题命中 测试时计算 :verifier(abstract,abstract_cn)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20621 2026-09-01 cs.AI cs.CL cs.LG cs.MA stat.ML 版本更新 67%

PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate

PEAR: 置换等变自适应路由多智能体辩论

Yang Feng, Ziwei Xu, Xia Hu, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。

Comments Published in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP) as a Main Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-01 cs.LG cs.AI cs.CL 版本更新 67%

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24564 2026-09-01 cs.AI cs.CE cs.LG 版本更新 62%

Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models

召唤神谕以屠之:利用大语言模型缓解金融回测中的前瞻偏差

Weixian Waylon Li, Mengyu Wang, Tiejun Ma

机构 * University of Edinburgh(爱丁堡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出FinCAD方法,通过对抗性偏差发现和实体日期自适应规则,在不重新训练的情况下抑制大语言模型对历史结果的记忆,从而缓解金融回测中的参数化前瞻偏差。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17251 2026-09-01 cs.LG cs.AI 版本更新 62%

Training-free LLM Verification via Recycling Few-shot Examples

利用回收少样本示例实现无需训练的大语言模型验证

Dongseok Lee, Jimyung Hong, Dongyoung Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM推理随机性与结论不一致的问题,提出无需训练的ReFeri框架,结合前向置信得分与后向重构惩罚,在7项任务上使3种LLM准确率平均提升8.2%。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30528 2026-09-01 cs.LG 新提交 57%

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:面向大语言模型多任务强化学习的进度增强优势课程

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30252 2026-09-01 cs.LG 新提交 57%

Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

强草稿需要紧凑记忆:带压缩KV缓存的长上下文推测解码

Tong Yuan, Chengxi Liao, Zeyi Wen

机构 * Data Science and Analytics Thrust, Information Hub(数据科学与分析方向、信息枢纽) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出记忆增强草稿技术,为长上下文推测解码配备压缩KV记忆,可降低70%以上草稿侧内存,使Llama~3.1-8B和70B模型分别实现最高2.08倍、3.33倍解码加速,同时保持推测解码的无损保证。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30091 2026-09-01 cs.AI 新提交 57%

VERA: Authority-Preserving Edge Revocation for Federated AI-Agent Workflows

VERA:联邦AI智能体工作流中保留权限的边撤销机制

Lifei Liu, Haoran Yu, Xiaochong Jiang

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对联邦AI智能体工作流的权限一致性问题,提出VERA可验证边撤销机制,解决树级联过度撤销与部署者级联欠撤销问题,在LangGraph等框架中验证了其有效性与模式可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28931 2026-09-01 cs.IR cs.LG 新提交 57%

MERIT: Mitigating Exposure Bias in Generative XMC for User-Interest Propensity Modeling

MERIT:缓解生成式极端多标签分类(XMC)中用户兴趣倾向建模的曝光偏差

Abhinav Mahajan, Arindam Sarkar, Prakash Mandayam Comar

专题命中 测试时计算 :self-correction(abstract);分类 cs.LG

AI总结 针对电商用户兴趣匹配的曝光偏差问题,提出MERIT框架,通过自校正目标缓解偏差,在25万+兴趣类数据集上提升召回率等指标,生产中用户转化率提升0.26%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28726 2026-09-01 cs.AI 新提交 57%

Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

Pro-Router:面向高效多模态大语言模型推理的、具备自适应边云协作的令牌感知渐进式模型路由方法

Xinyuan Gui, Shaowen Wang, Sheng Sun, Zijian Wang, Zishu Yu, Zheming Yang

机构 * Anyscale(安尼斯科尔公司) Mississippi State University(密西西比州立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理开销大的问题,提出具备自适应边云协作的Pro-Router方法,通过两阶段渐进式决策机制提升路由准确率与速度,端到端吞吐量显著优于现有方案。

Comments 9 pages, 7 figures, 2 tables. Code: this https URL (https://github.com/xinyuangui2/pro-router)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-09-01 cs.PL cs.CL 版本更新 57%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27186 2026-09-01 cs.CL 版本更新 57%

MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation

MAIGO: 通过历史清理的在线策略自蒸馏缓解对话丢失

Haoyu Zheng, Yun Zhu, Shu Yuan, Shangming Chen, Qing Wang, Wenqiao Zhang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Fuzhou University(福州大学) Tencent(腾讯)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 针对大语言模型在多轮对话中性能下降(对话丢失)的问题,提出MAIGO方法,通过在线策略自蒸馏和清理历史助手回复来减少自污染,无需验证器或推理时辅助,显著提升多轮对话准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-09-01 cs.CL 版本更新 57%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-09-01 cs.LG cs.PL 版本更新 57%

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see this https URL (https://agnostics.abgru.me)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-09-01 cs.CL 版本更新 57%

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30387 2026-09-01 cs.CR 新提交 50%

Attesting Outputs and Delegation Ancestry in Multi-Agent AI Systems

多智能体AI系统中的输出证明与委托谱系

Lifei Liu, Haoran Yu

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究针对多智能体AI系统的输出与委托谱系验证问题,提出两层证明设计,对比三种方案,经测试其验证效率满足多服务部署需求,可解决跨部署者的授权与溯源难题。

详情

展开后加载摘要…

URL PDF HTML 收藏