arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2505.14432 2025-05-21 cs.IR cs.CL 79%

Rank-K: Test-Time Reasoning for Listwise Reranking

Eugene Yang, Andrew Yates, Kathryn Ricci, Orion Weller, Vivek Chari, Benjamin Van Durme, Dawn Lawrie

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11049 2025-05-19 cs.AI cs.CR 79%

GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning

Yue Liu, Shengfang Zhai, Mingzhe Du, Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang, Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13292 2025-04-11 cs.CL 79%

Refining Answer Distributions for Improved Large Language Model Reasoning

Soumyasundar Pal, Didier Chételat, Yingxue Zhang, Mark Coates

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05345 2025-04-09 cs.LG cs.DB 79%

ZeroED: Hybrid Zero-shot Error Detection through Large Language Model Reasoning

Wei Ni, Kaihang Zhang, Xiaoye Miao, Xiangyu Zhao, Yangyang Wu, Yaoshu Wang, Jianwei Yin

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23395 2025-04-01 cs.SD cs.AI eess.AS 79%

Scaling Auditory Cognition via Test-Time Compute in Audio Language Models

Ting Dang, Yan Gao, Hong Jia

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21295 2025-03-28 cs.CL 79%

R-PRM: Reasoning-Driven Process Reward Modeling

Shuaijie She, Junxiao Liu, Yifeng Liu, Jiajun Chen, Xin Huang, Shujian Huang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments The project is available at https://github.com/NJUNLP/R-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18205 2025-03-27 cs.SE cs.AI 79%

Lemur: Log Parsing with Entropy Sampling and Chain-of-Thought Merging

Wei Zhang, Xiangyuan Guan, Lu Yunhong, Jie Zhang, Shuangyong Song, Xianfu Cheng, Zhenhe Wu, Zhoujun Li

专题命中 测试时计算 :chain-of-thought(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21321 2025-03-25 cs.CL cs.CV 79%

LLM Post-Training: A Deep Dive into Reasoning Large Language Models

Komal Kumar, Tajamul Ashraf, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Mubarak Shah, Ming-Hsuan Yang, Phillip H. S. Torr, Fahad Shahbaz Khan, Salman Khan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments 32 pages, 7 figures, 3 tables, 377 references. Github Repo: https://github.com/mbzuai-oryx/Awesome-LLM-Post-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10291 2025-03-14 cs.CV cs.CL 79%

VisualPRM: An Effective Process Reward Model for Multimodal Reasoning

Weiyun Wang, Zhangwei Gao, Lianjie Chen, Zhe Chen, Jinguo Zhu, Xiangyu Zhao, Yangzhou Liu, Yue Cao, Shenglong Ye, Xizhou Zhu, Lewei Lu, Haodong Duan, Yu Qiao, Jifeng Dai, Wenhai Wang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08551 2025-03-12 cs.AI 79%

Reasoning and Sampling-Augmented MCQ Difficulty Prediction via LLMs

Wanyong Feng, Peter Tran, Stephen Sireci, Andrew Lan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02875 2025-03-05 cs.CL 79%

The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models

Ke Ji, Jiahao Xu, Tian Liang, Qiuzhi Liu, Zhiwei He, Xingyu Chen, Xiaoyuan Liu, Zhijie Wang, Junying Chen, Benyou Wang, Zhaopeng Tu, Haitao Mi, Dong Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20379 2025-02-28 cs.AI 79%

Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers

Shalev Lifshitz, Sheila A. McIlraith, Yilun Du

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09955 2025-02-17 cs.AI 79%

Diverse Inference and Verification for Advanced Reasoning

Iddo Drori, Gaston Longhitano, Mao Mao, Seunghwan Hyun, Yuke Zhang, Sungjun Park, Zachary Meeks, Xin-Yu Zhang, Ben Segev, Howard Yong, Nakul Verma, Avi Shporer, Alon Amit, Madeleine Udell

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments 165 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13422 2025-02-11 cs.AI cs.SE 79%

Generating Diverse Hypotheses for Inductive Reasoning

Kang-il Lee, Hyukhun Koh, Dongryeol Lee, Seunghyun Yoon, Minsung Kim, Kyomin Jung

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14723 2025-02-04 cs.LG 79%

CodeMonkeys: Scaling Test-Time Compute for Software Engineering

Ryan Ehrlich, Bradley Brown, Jordan Juravsky, Ronald Clark, Christopher Ré, Azalia Mirhoseini

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07839 2025-01-29 cs.CL 79%

Semantic Self-Consistency: Enhancing Language Model Reasoning via Semantic Weighting

Tim Knappe, Ryan Li, Ayush Chauhan, Kaylee Chhua, Kevin Zhu, Sean O'Brien

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to MATH-AI at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20252 2024-10-29 cs.CV cs.AI 79%

Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning

Sullam Jeoung, Goeric Huybrechts, Bhavana Ganesh, Aram Galstyan, Sravan Bodapati

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19603 2024-10-01 cs.CV cs.AI 79%

One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos

Zechen Bai, Tong He, Haiyang Mei, Pichao Wang, Ziteng Gao, Joya Chen, Lei Liu, Zheng Zhang, Mike Zheng Shou

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by NeurlPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08841 2024-08-28 cs.CL 79%

FLEXTAF: Enhancing Table Reasoning with Flexible Tabular Formats

Xuanliang Zhang, Dingzirui Wang, Longxu Dou, Baoxin Wang, Dayong Wu, Qingfu Zhu, Wanxiang Che

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11860 2023-11-17 cs.CL 79%

Let's Sample Step by Step: Adaptive-Consistency for Efficient Reasoning and Coding with LLMs

Pranjal Aggarwal, Aman Madaan, Yiming Yang, Mausam

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Published at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13114 2022-06-28 cs.LG 79%

Dynamic-Group-Aware Networks for Multi-Agent Trajectory Prediction with Relational Reasoning

Chenxin Xu, Yuxi Wei, Bohan Tang, Sheng Yin, Ya Zhang, Siheng Chen

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2204.08770

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.00331 2016-10-26 cs.AI cs.CR cs.SE 79%

Verifier Theory and Unverifiability

Roman V. Yampolskiy

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23128 2026-03-25 cs.IT math.IT 79%

Agentic Verifier-in-the-Loop Solver Orchestration for Cell-Free Massive MIMO Downlink Power Control

代理验证在回路求解器协调 for 无细胞大规模MIMO下行功率控制

Zhichao Gao

专题命中 测试时计算 :verifier(title,abstract)

AI总结 本文提出VISO-PC框架,通过代理在求解器间路由以优化无细胞大规模MIMO下行功率控制,提升公平性并减少运行时间。

Comments This is the version 1. 6 pages, 5 figures, 4 tables. This paper presents a agentic verifier-aware orchestration formulation for cell-free massive MIMO power control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14629 2026-08-18 cs.CL cs.AI 新提交 79%

Inference-Time Mitigation of Adversarial Political Bias in Large Language Models

大语言模型推理时的对抗性政治偏见缓解

Tejaswi V. Panchagnula, Bruce Coburn, Bryce J. Dietrich, Robert X. Browning, Edward J. Delp, Fengqing Zhu

专题命中 测试时计算 :CoT(abstract,abstract_cn);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05810 2026-08-07 cs.AI cs.CL 新提交 79%

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制

Linfang Shang, Ming Xu, Yiding Sun, Tianle Xia, Lingxiang Hu, Lan Xu, Ning Zheng

专题命中 测试时计算 :verifier(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27255 2026-06-01 cs.CL cs.AI 79%

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

Pair-In, Pair-Out: 面向高效LLM的潜在多令牌预测

Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Platform, Xiaohongshu Inc.(小红书人工智能平台) University of Electronic Science and Technology of China(电子科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出Pair-In, Pair-Out (PIPO)方法,通过统一潜在压缩和多令牌预测,并训练轻量级置信度头消除验证器开销,在保持可靠性的同时实现推理加速。

Comments Project Page: GitHub.com/RedAI-Infra/PIPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19262 2026-06-01 cs.CL cs.AI 79%

Empirical Characterization of Inference-Time Elicited Probability Transformations in Large Language Models

大型语言模型中推理时引发的概率变换的经验表征

Mike Farmer, Abhinav Kochar, Yugyung Lee

机构 * Bloch School of Management, Regnier Institute for Entrepreneurship & Innovation, University of Missouri–Kansas City(布洛赫管理学院、雷尼创业与创新研究所、密苏里大学堪萨斯城分校) Department of Computer Science, School of Science and Engineering, University of Missouri–Kansas City(计算机科学系、科学与工程学院、密苏里大学堪萨斯城分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过经验观察发现,在多种推理时流程(如思维链、自我细化、检索增强和验证器引导修订)下,候选答案的概率变换遵循近似的对数比率关系,并分析了其系数变化和鲁棒性。

Comments 22 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13775 2026-05-27 cs.LG cs.AI 79%

Beyond Semantics: The Unreasonable Effectiveness of Reasonless Intermediate Tokens

超越语义:无理由中间标记的不合理有效性

Karthik Valmeekam, Vardhan Palod, Kaya Stechly, Atharva Gundawar, Subbarao Kambhampati

机构 * School of Computing and AI(计算与人工智能学院) Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊人工通用智能) Yale University(耶鲁大学)

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过从零训练Transformer模型于形式可验证推理轨迹,发现模型在正确与损坏轨迹上表现相似,且损坏轨迹在分布外任务上泛化更好,挑战了中间标记反映或诱导可预测推理行为的假设。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04842 2026-04-14 cs.LG cs.AI 79%

Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers

为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展

Kusha Sareen, Morgane M Moss, Alessandro Sordoni, Rishabh Agarwal, Arian Hosseini

机构 * Mila, McGill University(Mila,麦吉尔大学) Mila, Université de Montréal(Mila,蒙特利尔大学) Microsoft Research, Mila(微软研究院,Mila) Google DeepMind, Mila(谷歌DeepMind,Mila)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 79%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏