arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2408.17017 2025-02-05 cs.CL cs.AI 81%

Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling

Guangya Wan, Yuqi Wu, Jie Chen, Sheng Li

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08815 2024-10-28 cs.CL cs.AI 81%

StructRAG: Boosting Knowledge Intensive Reasoning of LLMs via Inference-time Hybrid Information Structurization

Zhuoqun Li, Xuanang Chen, Haiyang Yu, Hongyu Lin, Yaojie Lu, Qiaoyu Tang, Fei Huang, Xianpei Han, Le Sun, Yongbin Li

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16802 2024-10-25 cs.CL cs.LG 81%

AutoPSV: Automated Process-Supervised Verifier

Jianqiao Lu, Zhiyang Dou, Hongru Wang, Zeyu Cao, Jianbo Dai, Yingjia Wan, Zhijiang Guo

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by NeurIPS 2024 Poster, 21 pages, 1 figure, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09039 2024-10-11 cs.CL cs.AI 81%

TAP4LLM: Table Provider on Sampling, Augmenting, and Packing Semi-structured Data for Large Language Model Reasoning

Yuan Sui, Jiaru Zou, Mengyu Zhou, Xinyi He, Lun Du, Shi Han, Dongmei Zhang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00103 2024-09-04 cs.CL cs.AI 81%

Nuance Matters: Probing Epistemic Consistency in Causal Reasoning

Shaobo Cui, Junyou Li, Luca Mouchel, Yiyang Feng, Boi Faltings

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05189 2024-06-04 cs.CL cs.AI 81%

MIDGARD: Self-Consistency Using Minimum Description Length for Structured Commonsense Reasoning

Inderjeet Nair, Lu Wang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL 2024(main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.14890 2021-11-03 cs.LG cs.AI cs.DB cs.DC 81%

SMORE: Knowledge Graph Completion and Multi-hop Reasoning in Massive Knowledge Graphs

Hongyu Ren, Hanjun Dai, Bo Dai, Xinyun Chen, Denny Zhou, Jure Leskovec, Dale Schuurmans

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.07261 2021-07-16 cs.CL cs.LG 81%

Turning Tables: Generating Examples from Semi-structured Tables for Endowing Language Models with Reasoning Skills

Ori Yoran, Alon Talmor, Jonathan Berant

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07421 2021-01-05 cs.CV cs.AI cs.LG cs.MM 81%

Deep Verifier Networks: Verification of Deep Discriminative Models with Deep Generative Models

Tong Che, Xiaofeng Liu, Site Li, Yubin Ge, Ruixiang Zhang, Caiming Xiong, Yoshua Bengio

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24338 2026-08-26 cs.AI 新提交 80%

Selective Regenerative Decoding: Trajectory-Level Intervention for Inference-Time Reasoning

选择性再生解码:推理时推理的轨迹级干预

Sophia Xiao Pu, Yumo Xu, Sailik Sengupta, Millennium Bismay, Ruixue Lian, James Gung, Yi-an Lai, Arshit Gupta

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Netflix(网飞公司) Amazon Science(亚马逊科学研究院) Meta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出选择性再生解码(SRD),通过对候选轨迹做片段级干预,在低计算量下以更少生成代币达到Best-of-N准确率,提升样本效率,开辟了推理时推理的准确率-计算权衡新领域。

Comments Large Language Model, Test-Time Decoding Technique, Reasoning, 20 pages; Submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24443 2026-04-28 cs.AI 80%

PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记

Sinin Zhang, Yunfei Xie, Yuxuan Cheng, Haoyu Zhang, Tong Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Rice University(里奇大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。

Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00699 2025-11-05 cs.LG 80%

Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals

Sophie Li, Nicholas Huang, Nayan Saxena, Nina Luo, Vincent Lin, Kevin Zhu, Sunishchal Dev

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract,comments);分类 cs.LG

Comments Accepted by NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 80%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05132 2026-03-03 cs.CL cs.AI cs.LG 80%

Training Large Language Models To Reason In Parallel With Global Forking Tokens

训练大型语言模型以并行推理与全局分叉标记

Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan

机构 * University of Toronto(多伦多大学) Amazon(亚马逊) Vector Institute(向量研究所)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSFT和GFPO方法,通过集合基于的损失和双射匹配,提升大型语言模型在并行推理中的多样性和准确性,从而在数学推理和代码生成任务中取得优于传统SFT的性能。

Comments Accepted at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), https://openreview.net/forum?id=xBQvvkg4Wc

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10981 2025-08-18 cs.AI cs.CL cs.LG 80%

Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability Theory

Yexiang Liu, Zekun Li, Zhi Fang, Nan Xu, Ran He, Tieniu Tan

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of California, Santa Barbara(加州大学圣巴巴拉分校) Beijing Wenge Technology Co., Ltd(北京文格科技有限公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 Outstanding Paper Award, 33 pages, 51 figures

Journal ref ACL.Volume 1: Long Papers (2025) 27962-27994

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09659 2025-06-12 cs.AI cs.CL cs.LG 80%

Intent Factored Generation: Unleashing the Diversity in Your Language Model

Eltayeb Ahmed, Uljad Berdica, Martha Elliott, Danijela Horak, Jakob N. Foerster

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05449 2025-06-03 cs.CL cs.AI cs.LG 80%

Iterative Deepening Sampling as Efficient Test-Time Scaling

Weizhe Chen, Sven Koenig, Bistra Dilkina

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06773 2025-02-11 cs.AI cs.CL cs.LG 80%

On the Emergence of Thinking in LLMs I: Searching for the Right Intuition

Guanghao Ye, Khiem Duc Pham, Xinzhi Zhang, Sivakanth Gopi, Baolin Peng, Beibin Li, Janardhan Kulkarni, Huseyin A. Inan

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Abstract shortened for arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07466 2024-09-20 cs.CL cs.AI cs.LG 80%

On Measuring Faithfulness or Self-consistency of Natural Language Explanations

Letitia Parcalabescu, Anette Frank

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper accepted for publication at ACL 2024 Main (Bangkok, Thailand); 10 main paper pages, 30 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-08-25 cs.AI 版本更新 79%

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-21 cs.CL 版本更新 79%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-19 cs.LG cs.AR cs.DC 版本更新 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15574 2026-08-18 cs.CV cs.AI 新提交 79%

Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study

视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究

Yogesh Kumar

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12399 2026-08-18 cs.LG stat.ML 版本更新 79%

ROC-n-reroll: How verifier imperfection affects test-time scaling

ROC-n-reroll:验证器缺陷对测试时缩放的影响

Florian E. Dorner, Yatong Chen, André F. Cruz, Fanny Yang

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本工作针对测试时缩放中验证器缺陷的理论空白,证明相关方法的实例级精度由验证器ROC曲线几何刻画,经Qwen、LLaMA模型在指定数据集上验证,得出RS与BoN在不同计算条件下的性能规律。

Comments 47 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 79%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13179 2026-08-14 cs.AI 新提交 79%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10447 2026-08-12 cs.IR cs.AI 新提交 79%

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

基于模型合并的大语言模型推荐系统高效推理研究

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17188 2026-08-12 cs.AI 版本更新 79%

UPAIR: Diagnosing Reasoning States via Uncertainty-Progress Alignment for Selective Intervention

你的模型是在思考还是停滞不前?PUMA:通过相位动量对齐诊断推理病理学

Cheng Yan, Zhijun Fan, Guangyang Ye, Fan Xu, Xiang Xia, Yawei Wang, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型推理模型测试时的“过度思考”问题,提出相位动量对齐假设并构建认知能量模型,引入PUMA框架,通过分层诊断架构区分主动探索与被动停滞,在多基准实验中优于现有基线,实现更好的准确性-效率权衡和跨域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04611 2026-08-06 cs.SE cs.AI 新提交 79%

The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals

顺序是保障:基于静态优先学习提议的验证者预算代码删除

Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Han Wang, Jie Li, Ru Zhang

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究针对验证者预算有限时的AI代码删除问题,提出DELSCOUT调度方法,结合静态与学习候选排序,提升已验证删除覆盖率并控制验证器调用,明确了模型、顺序与执行的分工。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00437 2026-08-04 cs.SE cs.AI 新提交 79%

Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks

将推理痕迹提炼为软件工程任务的建议提示词

Faizan Faisal, Prem Devanbu, Toufique Ahmed

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏