arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2603.04977 2026-03-06 cs.CV 75%

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13342 2026-02-06 cs.AI cs.CL cs.LG 75%

Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers

验证验证者:揭示事实验证器中的陷阱与潜力

Wooseok Seo, Seungju Han, Jaehun Jung, Benjamin Newman, Seungwon Lim, Seungbeen Lee, Ximing Lu, Yejin Choi, Youngjae Yu

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了多种大语言模型和事实验证器,揭示了数据标注问题、前沿模型性能及小型验证器的改进潜力。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02143 2026-02-03 cs.LG cs.AI cs.CL 75%

Learning Generative Selection for Best-of-N

学习最佳N的生成选择

Shubham Toshniwal, Aleksander Ficek, Siddhartha Jain, Wei Du, Vahid Noroozi, Sadegh Mahdavi, Somshubra Majumdar, Igor Gitman

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过强化学习,小模型可获得强大的生成选择能力,从而在推理任务中超越基线方法并接近大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04411 2026-01-09 cs.LG cs.AI cs.CL 75%

Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards

速率还是命运?RLV$^\varepsilon$R:具有可验证噪声奖励的强化学习

Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad

机构 * Cognichip AI University of Toronto(多伦多大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLV$^\varepsilon$R框架,通过分析验证噪声对强化学习的影响,揭示了噪声如何影响学习速率与命运,并通过实验验证了在不同Youden指数下动态变化的相变特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18581 2025-12-15 cs.CL cs.AI cs.LG 75%

Scalable Best-of-N Selection for Large Language Models via Self-Certainty

通过自我确定性实现大规模语言模型的可扩展最佳-N选择

Zhewei Kang, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(伯克利大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我确定性方法,通过利用LLM输出的概率分布,高效提升大规模语言模型的推理能力,适用于多种推理任务和开放性生成场景。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14943 2025-10-17 cs.CL cs.AI cs.LG 75%

LaSeR: Reinforcement Learning with Last-Token Self-Rewarding

Wenkai Yang, Weijie Liu, Ruobing Xie, Yiju Guo, Lulu Wu, Saiyong Yang, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) LLM Department, Tencent(腾讯机器学习部)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress. Github repo: https://github.com/RUCBM/LaSeR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18056 2025-09-26 cs.CV 75%

TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs

Yunheng Li, Jing Cheng, Shaoyong Jia, Hangyi Kuang, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08589 2025-08-13 cs.CV 75%

DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding

Wenwen Yu, Zhibo Yang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20227 2025-08-05 cs.IR 75%

CTR-Driven Ad Text Generation via Online Feedback Preference Optimization

Yanda Chen, Zihui Ren, Qixiang Gao, Jiale Chen, Si Chen, Xubin Li, Tiezheng Ge, Bo Zheng

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 13 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05563 2025-06-25 cs.CL cs.AI cs.LG 75%

Rational Metareasoning for Large Language Models

C. Nicolò De Sabbata, Theodore R. Sumers, Badr AlKhamissi, Antoine Bosselut, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) EPFL(洛桑联邦理工学院) Anthropic(Anthropic公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12303 2025-06-17 cs.CV 75%

Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition

Xiaoying Zhang, Da Peng, Yipeng Zhang, Zonghao Guo, Chengyue Wu, Jen-Tse Huang, Chi Chen, Wei Ke, Helen Meng, Maosong Sun

机构 * The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 43 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23743 2025-06-06 cs.CL cs.AI cs.LG 75%

What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective

Ming Li, Yanhong Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Chicago(芝加哥大学)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2025 main, Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04378 2025-06-02 cs.CL cs.AI cs.LG 75%

HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Daniel Egert, Ellie Evans, Hoo-Chang Shin, Felipe Soares, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages, 2 figures, Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14682 2025-05-21 cs.CV 75%

UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation

Rui Tian, Mingfei Gao, Mingze Xu, Jiaming Hu, Jiasen Lu, Zuxuan Wu, Yinfei Yang, Afshin Dehghan

机构 * Apple(苹果公司) Fudan University(复旦大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);verifier(abstract)

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12249 2025-05-20 cs.CL cs.AI cs.LG 75%

LLMs are not Zero-Shot Reasoners for Biomedical Information Extraction

Aishik Nagar, Viktor Schlegel, Thanh-Tung Nguyen, Hao Li, Yuping Wu, Kuluhan Binici, Stefan Winkler

机构 * ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务) Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18494 2025-03-25 cs.AI cs.CL cs.LG 75%

Verbal Process Supervision Elicits Better Coding Agents

Hao-Yuan Chen, Cheng-Pong Huang, Jui-Ming Yao

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13161 2024-06-21 cs.AI cs.CL cs.LG cs.PL 75%

APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts

Honghua Dong, Qidong Su, Yubo Gao, Zhaoyu Li, Yangjun Ruan, Gennady Pekhimenko, Chris J. Maddison, Xujie Si

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02909 2026-08-18 cs.LG cs.AI 版本更新 74%

Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR

延迟、平台期或崩溃:评估系统性验证错误对RLVR的影响

Kazuki Egashira, Mark Vero, Jasper Dekoninck, Florian E. Dorner, Robin Staab, Martin Vechev

专题命中 测试时计算 :verifier(abstract,comments);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究探究系统性验证错误对RLVR的影响,发现系统性误报会引发次优平台期或性能崩溃,验证器质量需结合错误模式而非仅样本级错误率评估。

Comments COLM 2026. Code: https://github.com/eth-sri/llm-verifier-noise

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01463 2026-08-05 cs.AI cs.MA 版本更新 74%

Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering

推理分歧之处:本地化多智能体辩论

Weijun Gao, Xiang Ding, Haoyang Liu, Tiancheng Xing

机构 * The Chinese University of Hong Kong(香港中文大学) Nagoya University(名古屋大学) Institute of Science Tokyo(东京科学大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title);分类 cs.AI

AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08700 2026-07-10 cs.CL 新提交 74%

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

深度研究源归因的基准测试:评估用于验证引用的前沿模型

Ethan Leung, Elias Lumer, Corey Feld, Austin Huber, Vamse Kumar Subbiah, Kevin Paul

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.(普华永道商业技术与创新办公室)

专题命中 测试时计算 :verifier(title);分类 cs.CL

AI总结 研究深度研究系统中引用质量校准问题,用现成LLM对1248个评分决策与黄金标准标签对比,发现较便宜模型有竞争力,校准模型是用引用评分作奖励信号的前提,校准不须最昂贵模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05439 2026-05-11 cs.AI cs.FL 74%

BEAVER: An Efficient Deterministic LLM Verifier

BEAVER:一种高效的确定性大语言模型验证器

Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 BEAVER 提出了一种计算大语言模型安全属性确定性概率界限的框架,通过新颖的 Token trie 和 Frontier 数据结构系统探索模型输出空间,提供可靠保证并识别更多高风险实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15005 2026-02-17 cs.CL cs.IR 74%

Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation

通过推理和蒸馏学习用户兴趣以实现跨领域新闻推荐

Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

机构 * Microsoft(微软公司) Emory University(埃默里大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL

AI总结 本文提出通过推理和蒸馏学习用户兴趣的方法,提升跨领域新闻推荐的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09770 2026-02-13 cs.CL 74%

GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning

黄金矿砂:用于针叶堆寻针推理的战略上下文洗牌

Adam Byerly, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL

AI总结 GOLD PANNING通过战略上下文洗牌方法,在针叶堆推理中以更少的查询实现高效目标识别,利用信号锚定技术提升模型性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22803 2026-02-02 cs.AI cs.SE 74%

CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning

CVeDRL: 一种通过难度感知强化学习实现的高效代码验证器

Ji Shi, Peiming Guo, Meishan Zhang, Miao Zhang, Xuebo Liu, Min Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(title);分类 cs.AI

AI总结 CVeDRL通过难度感知强化学习提升代码验证效率,实现更高通过率和分支覆盖,参数更少,推理更快。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11769 2025-11-18 physics.chem-ph cs.LG q-bio.QM stat.ME 74%

Socrates-Mol: Self-Oriented Cognitive Reasoning through Autonomous Trial-and-Error with Empirical-Bayesian Screening for Molecules

Xiangru Wang, Zekun Jiang, Heng Yang, Cheng Tan, Xingying Lan, Chunming Xu, Tianhang Zhou

机构 * State Key Laboratory of Heavy Oil Processing, China University of Petroleum (Beijing), Beijing 102249, China(石油加工国家重点实验室,中国石油大学(北京)) Shanghai AI Laboratory,L1 Building, International Media Port, No. 129 Longwen Road, Xuhui District, Shanghai(上海人工智能实验室) College of Energy Innovation, China University of Petroleum (Beijing), Beijing 102249, China(能源创新学院,中国石油大学(北京))

专题命中 测试时计算 :reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13651 2025-10-16 cs.LG math.OC 74%

What is the objective of reasoning with reinforcement learning?

Damek Davis, Benjamin Recht

机构 * Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(统计与数据科学系,沃森商学院,宾夕法尼亚大学) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(电气工程与计算机科学系,加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23324 2025-09-30 cs.DC cs.AI 74%

Scaling LLM Test-Time Compute with Mobile NPU on Smartphones

Zixu Hao, Jianyu Wei, Tuowei Wang, Minxing Huang, Huiqiang Jiang, Shiqi Jiang, Ting Cao, Ju Ren

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 测试时计算 :test-time compute(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22275 2025-03-31 eess.AS cs.AI cs.SD 74%

Make Some Noise: Towards LLM audio reasoning and generation using sound tokens

Shivam Mehta, Nebojsa Jojic, Hannes Gamper

专题命中 测试时计算 :reasoning(title);分类 cs.AI

Comments 5 pages, 2 figures, Accepted at ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00369 2024-07-02 cs.CL 74%

How to Train Your Fact Verifier: Knowledge Transfer with Multimodal Open Models

Jaeyoung Lee, Ximing Lu, Jack Hessel, Faeze Brahman, Youngjae Yu, Yonatan Bisk, Yejin Choi, Saadia Gabriel

专题命中 测试时计算 :verifier(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15610 2024-06-14 cs.CL 74%

Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning

Tejas Srinivasan, Jack Hessel, Tanmay Gupta, Bill Yuchen Lin, Yejin Choi, Jesse Thomason, Khyathi Raghavi Chandu

专题命中 测试时计算 :reasoning(title);分类 cs.CL

Comments Accepted to ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏