arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2037 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2037 篇

2305.09781 2024-04-02 cs.CL cs.DC cs.LG 62%

SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification

Xupeng Miao, Gabriele Oliaro, Zhihao Zhang, Xinhao Cheng, Zeyu Wang, Zhengxin Zhang, Rae Ying Yee Wong, Alan Zhu, Lijie Yang, Xiaoxiang Shi, Chunan Shi, Zhuoming Chen, Daiyaan Arfeen, Reyna Abhyankar, Zhihao Jia

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

Comments ASPLOS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18284 2024-03-05 cs.CL cs.AI 62%

Is Crowdsourcing Breaking Your Bank? Cost-Effective Fine-Tuning of Pre-trained Language Models with Proximal Policy Optimization

Shuo Yang, Gjergji Kasneci

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19475 2024-03-01 cs.SE cs.AI cs.LG 62%

The Counterfeit Conundrum: Can Code Language Models Grasp the Nuances of Their Incorrect Generations?

Alex Gu, Wen-Ding Li, Naman Jain, Theo X. Olausson, Celine Lee, Koushik Sen, Armando Solar-Lezama

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19371 2024-03-01 cs.CL cs.AI cs.IR 62%

OpenMedLM: Prompt engineering can out-perform fine-tuning in medical question-answering with open-source large language models

Jenish Maharjan, Anurag Garikipati, Navan Preet Singh, Leo Cyrus, Mayank Sharma, Madalina Ciobanu, Gina Barnes, Rahul Thapa, Qingqing Mao, Ritankar Das

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09342 2024-02-14 cs.PL cs.AI cs.CL cs.SE 62%

Ranking LLM-Generated Loop Invariants for Program Verification

Saikat Chakraborty, Shuvendu K. Lahiri, Sarah Fakhoury, Madanlal Musuvathi, Akash Lal, Aseem Rastogi, Aditya Senthilnathan, Rahul Sharma, Nikhil Swamy

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

Comments Findings of The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP-findings 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13426 2024-01-18 cs.CL cs.AI 62%

A Chat About Boring Problems: Studying GPT-based text normalization

Yang Zhang, Travis M. Bartley, Mariana Graterol-Fuenmayor, Vitaly Lavrukhin, Evelina Bakhturina, Boris Ginsburg

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08398 2023-11-17 cs.CL cs.AI 62%

Are Large Language Models Temporally Grounded?

Yifu Qiu, Zheng Zhao, Yftah Ziser, Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12836 2023-10-20 cs.CL cs.LG 62%

Knowledge-Augmented Language Model Verification

Jinheon Baek, Soyeong Jeong, Minki Kang, Jong C. Park, Sung Ju Hwang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10403 2023-09-15 cs.CL cs.AI 62%

PaLM 2 Technical Report

Rohan Anil, Andrew M. Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H. Clark, Laurent El Shafey, Yanping Huang, Kathy Meier-Hellstern, Gaurav Mishra, Erica Moreira, Mark Omernick, Kevin Robinson, Sebastian Ruder, Yi Tay, Kefan Xiao, Yuanzhong Xu, Yujing Zhang, Gustavo Hernandez Abrego, Junwhan Ahn, Jacob Austin, Paul Barham, Jan Botha, James Bradbury, Siddhartha Brahma, Kevin Brooks, Michele Catasta, Yong Cheng, Colin Cherry, Christopher A. Choquette-Choo, Aakanksha Chowdhery, Clément Crepy, Shachi Dave, Mostafa Dehghani, Sunipa Dev, Jacob Devlin, Mark Díaz, Nan Du, Ethan Dyer, Vlad Feinberg, Fangxiaoyu Feng, Vlad Fienber, Markus Freitag, Xavier Garcia, Sebastian Gehrmann, Lucas Gonzalez, Guy Gur-Ari, Steven Hand, Hadi Hashemi, Le Hou, Joshua Howland, Andrea Hu, Jeffrey Hui, Jeremy Hurwitz, Michael Isard, Abe Ittycheriah, Matthew Jagielski, Wenhao Jia, Kathleen Kenealy, Maxim Krikun, Sneha Kudugunta, Chang Lan, Katherine Lee, Benjamin Lee, Eric Li, Music Li, Wei Li, YaGuang Li, Jian Li, Hyeontaek Lim, Hanzhao Lin, Zhongtao Liu, Frederick Liu, Marcello Maggioni, Aroma Mahendru, Joshua Maynez, Vedant Misra, Maysam Moussalem, Zachary Nado, John Nham, Eric Ni, Andrew Nystrom, Alicia Parrish, Marie Pellat, Martin Polacek, Alex Polozov, Reiner Pope, Siyuan Qiao, Emily Reif, Bryan Richter, Parker Riley, Alex Castro Ros, Aurko Roy, Brennan Saeta, Rajkumar Samuel, Renee Shelby, Ambrose Slone, Daniel Smilkov, David R. So, Daniel Sohn, Simon Tokumine, Dasha Valter, Vijay Vasudevan, Kiran Vodrahalli, Xuezhi Wang, Pidong Wang, Zirui Wang, Tao Wang, John Wieting, Yuhuai Wu, Kelvin Xu, Yunhan Xu, Linting Xue, Pengcheng Yin, Jiahui Yu, Qiao Zhang, Steven Zheng, Ce Zheng, Weikang Zhou, Denny Zhou, Slav Petrov, Yonghui Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00667 2023-09-06 cs.CL cs.LG 62%

Taken out of context: On measuring situational awareness in LLMs

Lukas Berglund, Asa Cooper Stickland, Mikita Balesni, Max Kaufmann, Meg Tong, Tomasz Korbak, Daniel Kokotajlo, Owain Evans

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07968 2023-06-14 cs.CL cs.AI 62%

arXiVeri: Automatic table verification with GPT

Gyungin Shin, Weidi Xie, Samuel Albanie

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01447 2023-04-05 cs.MA cs.AI cs.LG 62%

Off-Policy Action Anticipation in Multi-Agent Reinforcement Learning

Ariyan Bighashdel, Daan de Geus, Pavol Jancura, Gijs Dubbelman

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10661 2022-05-24 cs.CL cs.AI 62%

An Empirical Investigation of Commonsense Self-Supervision with Knowledge Graphs

Jiarui Zhang, Filip Ilievski, Kaixin Ma, Jonathan Francis, Alessandro Oltramari

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.04000 2021-08-19 cs.AI cs.LG 62%

Off-Belief Learning

Hengyuan Hu, Adam Lerer, Brandon Cui, David Wu, Luis Pineda, Noam Brown, Jakob Foerster

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.09694 2020-12-14 cs.CL cs.AI cs.IR 62%

Retrospective Reader for Machine Reading Comprehension

Zhuosheng Zhang, Junjie Yang, Hai Zhao

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.09443 2020-04-20 cs.LG cs.AI stat.ML 62%

Deep Sets for Generalization in RL

Tristan Karch, Cédric Colas, Laetitia Teodorescu, Clément Moulin-Frier, Pierre-Yves Oudeyer

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 10 figures, published as a workshop Paper at ICLR: Beyond tabula rasa in RL (BeTR-RL). arXiv admin note: substantial text overlap with arXiv:2002.09253

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.03911 2018-02-13 cs.CL cs.IR cs.LG stat.ML 62%

Stochastic Learning of Nonstationary Kernels for Natural Language Modeling

Sahil Garg, Greg Ver Steeg, Aram Galstyan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10827 2026-06-17 cs.AI 版本更新 61%

Know Thy Reasoner: Not All Language Models Explore Alike

你的模型多样性,而非方法,决定推理策略

Moulik Choraria, Argyrios Gerogiannis, Anirban Das, Supriyo Chakraborty, Sourya Basu, Sambit Sahu, Lav R. Varshney

机构 * UIUC(伊利诺伊大学香槟分校) Capital One

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。

Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02603 2026-06-10 cs.CL 版本更新 61%

CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency

CGES:面向高效准确自一致性的置信引导早停方法

Ehsan Aghazadeh, Ahmad Ghasemi, Hedyeh Beyhaghi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL

AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。

Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17417 2026-01-07 cs.LG 61%

Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?

顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?

Mingyuan Wu, Meitang Li, Jingcheng Yang, Jize Jiang, Kaizhuo Yan, Zhaoheng Li, Hanchao Yu, Minjia Zhang, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Meta

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG

AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。

Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15986 2025-11-25 cs.CV cs.CY cs.LG 61%

Fairness in Multi-modal Medical Diagnosis with Demonstration Selection

多模态医学诊断中的公平性与演示选择

Dawei Li, Zijian Gu, Peng Wang, Chuhan Song, Zhen Tan, Mohan Zhang, Tianlong Chen, Yu Tian, Song Wang

机构 * Arizona State University(亚利桑那州立大学) University of Rochester(罗切斯特大学) University of Virginia(弗吉尼亚大学) UCL(伦敦大学学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG

AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。

Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24571 2026-08-26 cs.AI cs.SE 新提交 57%

Joint Optimization of Tool Creation and Use for Large Language Model Agents

大型语言模型智能体的工具创建与使用联合优化

Zhi Rui Tam, Chieh-Yen Lin, Yun-Nung Chen, Shao-Hua Sun, Hung-yi Lee

机构 * Appier AI Research(沛星人工智能研究院) National Taiwan University(台湾大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出SMITH框架联合训练工具创建与使用,4B Qwen3经训练在多任务上取得最优表现,其编写的工具还提升了其他模型的推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24136 2026-08-26 cs.LG 新提交 57%

Steering Recurrent Reasoners at Inference Time with Readout Feedback

在推理阶段通过读出反馈引导循环推理器

Shunsuke Kamiya, Masanori Koyama, Seongcheol Jeong, Fumiya Uchiyama, Kenji Kubo, Kohei Hayashi, Masahiro Suzuki, Yutaka Matsuo

机构 * Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出测试时干预方法RoFB,将中间预测转为耦合力注入循环模型隐动态,在数独、迷宫任务的三类循环模型上提升性能,且计算成本相当或更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22196 2026-08-25 eess.AS cs.CL 新提交 57%

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏

Hermann Yepdjio Nkouanga, Minwei Luo, Maggie Wigness, Suresh Singh

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23541 2026-08-25 cs.MA cs.AI 新提交 57%

The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams

交互税:当多智能体团队中的沟通消除多样性时

Summer Eunhyung Ann, Haokun Liu, Chenhao Tan

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究提出“交互税”概念,发现多智能体LLM的完整方案交互会消除多样性,独立提议生成可避免收敛崩溃,交互仅在共享恰当信息时才有益。

Comments 14 pages, 3 figures. Accepted at ICML 2026 (PMLR 306)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23375 2026-08-25 cs.CR cs.AI 新提交 57%

Adversarial Entropy Inflation Against Gumbel-Based Inference Verification

针对基于Gumbel推理验证的对抗性熵膨胀

Nikita Kezins

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究针对基于Gumbel的LLM推理验证防御,发现控制提示分布的攻击者可扩大容许token集合,使隐蔽信道泄露能力提升,建议动态校准抖动宽恕阈值。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22533 2026-08-25 cs.AI 新提交 57%

CONTRAMEM: Learning Self-Evolving Procedural Memory from Contrasting Multi-Model Trajectories

CONTRAMEM:通过对比多模型轨迹学习自演进的过程记忆

Zheyuan Deng, Binghang Lu, Hanqi Feng, Shirley Huang, Dianzhuo Wang, Yuanda Xu, Zhiwei Zhang, Yige Sun, Changhong Mou, Runyu Zhang, Yuexing Hao, Barnabas Poczos, Xiaomin Li

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 CONTRAMEM是无需训练的自演进过程记忆框架,通过对比多模型轨迹提炼功能卡与技能卡,在GAIA2/ARE等任务上大幅提升计算机使用智能体成功率,且具备跨模型迁移性。

Comments 35 pages, 7 figures; includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-25 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18884 2026-08-20 cs.AI 新提交 57%

Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models

面向大语言模型的无训练推理时自我反思与成本受限早停机制

Wei Yu, Suxing Liu, Minjie Yu, Jiahao Wang, Zhijian Zheng, Haocheng Deng, Bing Li

机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18580 2026-08-20 cs.AI cs.PL 新提交 57%

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

FACET:在终端任务合成中保留源意图与可执行状态

Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan Ren, Jin Liu, Yu Zeng, Yiming Zhao, Lin Chen, Zehui Chen, Feng Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。

Comments https://stokou.github.io/FACET-Terminal/

详情

展开后加载摘要…

URL PDF HTML 收藏