arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2037 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2037 篇

2509.11686 2025-09-25 cs.SE cs.AI 57%

Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Yi Li

机构 * Singapore Management University(新加坡国立管理学院) Nanyang Technological University(南洋理工大学) Tianjin University(天津大学) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments EMNLP2025-findings https://openreview.net/forum?id=d4ICISW2T4

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15044 2025-09-24 cs.CL 57%

Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligner

Bolian Li, Yanran Wu, Xinyu Luo, Ruqi Zhang

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17570 2025-09-23 cs.CL 57%

Asking a Language Model for Diverse Responses

Sergey Troshin, Irina Saparina, Antske Fokkens, Vlad Niculae

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments UncertaiNLP workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18216 2025-09-18 cs.SE cs.CR cs.LG 57%

Evaluating and Improving the Robustness of Security Attack Detectors Generated by LLMs

Samuele Pasini, Jinhan Kim, Tommaso Aiello, Rocio Cabrera Lozoya, Antonino Sabetta, Paolo Tonella

机构 * Samuele Pasini Universit\`a della Svizzera italiana, Switzerland Jinhan Kim Universit\`a della Svizzera italiana, Switzerland Tommaso Aiello SAP Labs France, France Rocio Cabrera Lozoya SAP Labs France, France Antonino Sabetta SAP Labs France, France Paolo Tonella Universit\`a della Svizzera italiana, Switzerland

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13154 2025-09-17 cs.CL 57%

LLM Hallucination Detection: A Fast Fourier Transform Method Based on Hidden Layer Temporal Signals

Jinxin Li, Gang Tu, ShengYu Cheng, Junjie Hu, Jinting Wang, Rui Chen, Zhilong Zhou, Dongbo Shan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08721 2025-09-11 cs.LG cs.MA 57%

Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing

Jeffrey Amico, Gabriel Passamani Andrade, John Donaghy, Ben Fielding, Tristin Forbus, Harry Grieve, Semih Kara, Jari Kolehmainen, Yihua Lou, Christopher Nies, Edward Phillip Flores Nuño, Diogo Ortega, Shikhar Rastogi, Austin Virts, Matthew J. Wright

机构 * Gensyn AI Team(Gensyn AI团队)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17656 2025-09-09 cs.CL 57%

Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs

Hexiang Tan, Fei Sun, Sha Liu, Du Su, Qi Cao, Xin Chen, Jingang Wang, Xunliang Cai, Yuanzhuo Wang, Huawei Shen, Xueqi Cheng

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12583 2025-09-09 cs.CL 57%

Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise

Hanyin Wang, Chufan Gao, Qiping Xu, Bolun Liu, Guleid Hussein, Hariprasad Korsapati, Mohamad El Labban, Kingsley Iheasirim, Mohamed Hassan, Gokhan Anil, Brian Bartlett, Jimeng Sun

机构 * Mayo Clinic Health System(梅奥诊所健康系统) School of Computing and Data Science, UIUC(UIUC计算与数据科学学院) Carle Illinois College of Medicine, UIUC(UIUC卡勒医学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02133 2025-09-03 cs.CL 57%

AMBEDKAR-A Multi-level Bias Elimination through a Decoding Approach with Knowledge Augmentation for Robust Constitutional Alignment of Language Models

Snehasis Mukhopadhyay, Aryan Kasat, Shivam Dubey, Rahul Karthikeyan, Dhruv Sood, Vinija Jain, Aman Chadha, Amitava Das

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡里尼) BITS Pilani Goa(比尔·斯图尔特学院,果阿) IIT Madras(马德拉斯理工学院) DTU(达丁理工大学) Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Meta AI Amazon GenAI(亚马逊生成人工智能)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02033 2025-09-03 cs.CL 57%

StructCoh: Structured Contrastive Learning for Context-Aware Text Semantic Matching

Chao Xue, Ziyuan Gao

机构 * Beihang University, Beijing, China(北京航空航天大学) University College London, London, UK(伦敦大学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments Accepted by PRICAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20587 2025-08-29 cs.IR cs.LG 57%

SemSR: Semantics aware robust Session-based Recommendations

Jyoti Narwariya, Priyanka Gupta, Muskan Gupta, Jyotsana Khatri, Lovekesh Vig

机构 * TCS Research(TCS研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments Accepted at EARL workshop @RecSys'25, Prague, Czech Republic

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17250 2025-08-26 cs.CL cs.IR 57%

Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Generation

Kaidong Feng, Zhu Sun, Hui Fang, Jie Yang, Wenyuan Liu, Yew-Soon Ong

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15260 2025-08-22 cs.LG 57%

Deep Think with Confidence

Yichao Fu, Xuewei Wang, Yuandong Tian, Jiawei Zhao

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07441 2025-08-22 cs.CL 57%

SAND: Boosting LLM Agents with Self-Taught Action Deliberation

Yu Xia, Yiran Shen, Junda Wu, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Julian McAuley

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14784 2025-08-19 cs.CV cs.AI 57%

LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering

Xinxin Dong, Baoyun Peng, Haokai Ma, Yufei Wang, Zixuan Dong, Fei Hu, Xiaodong Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22648 2025-08-12 cs.CL 57%

WebDancer: Towards Autonomous Information Seeking Agency

Jialong Wu, Baixuan Li, Runnan Fang, Wenbiao Yin, Liwen Zhang, Zhengwei Tao, Dingchu Zhang, Zekun Xi, Gang Fu, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06124 2025-08-11 cs.CL 57%

AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models

Sayantan Adak, Pratyush Chatterjee, Somnath Banerjee, Rima Hazra, Somak Aditya, Animesh Mukherjee

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08567 2025-08-08 cs.LG 57%

AbbIE: Autoregressive Block-Based Iterative Encoder for Efficient Sequence Modeling

Preslav Aleksandrov, Meghdad Kurmanji, Fernando Garcia Redondo, David O'Shea, William Shen, Alex Iacob, Lorenzo Sani, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 14 pages and 6 figures. Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14448 2025-08-07 cs.CL 57%

How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison

Jiayin Wang, Zhiquang Guo, Weizhi Ma, Min Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15299 2025-08-07 cs.CL 57%

Inside-Out: Hidden Factual Knowledge in LLMs

Zorik Gekhman, Eyal Ben David, Hadas Orgad, Eran Ofek, Yonatan Belinkov, Idan Szpektor, Jonathan Herzig, Roi Reichart

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19679 2025-07-29 cs.CV cs.AI 57%

Efficient Learning for Product Attributes with Compact Multimodal Models

Mandar Kulkarni

机构 * Flipkart Data Science(Flipkart数据科学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15974 2025-07-23 cs.AI 57%

Does More Inference-Time Compute Really Help Robustness?

Tong Wu, Chong Xiang, Jiachen T. Wang, Weichen Yu, Chawin Sitawarin, Vikash Sehwag, Prateek Mittal

机构 * Princeton University(普林斯顿大学) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11476 2025-07-22 cs.CL 57%

FastMCTS: A Simple Sampling Strategy for Data Synthesis

Peiji Li, Kai Lv, Yunfan Shao, Yichuan Ma, Linyang Li, Xiaoqing Zheng, Xipeng Qiu, Qipeng Guo

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14202 2025-07-22 cs.CR cs.AI 57%

PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training

Pengfei Du

机构 * Pengfei Du(独立研究者)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18439 2025-07-15 cs.AI 57%

MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning

Chanwoo Park, Seungju Han, Xingzhi Guo, Asuman Ozdaglar, Kaiqing Zhang, Joo-Kyung Kim

机构 * MIT(麻省理工学院) Stanford(斯坦福大学) Amazon(亚马逊) UMD(大学公园大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

Comments version for ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04557 2025-07-09 cs.LG cs.IT math.IT 57%

Speeding up Speculative Decoding via Sequential Approximate Verification

Meiyu Zhong, Noel Teku, Ravi Tandon

机构 * Department of Electrical and Computer Engineering, University of Arizona, Tucson, US(电气与计算机工程系,亚利桑那大学,图森,美国)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

Comments ICML 2025, Workshop on Efficient Systems for Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17811 2025-07-08 cs.RO cs.AI cs.SY eess.SY 57%

RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models

Jacky Kwok, Christopher Agia, Rohan Sinha, Matt Foutter, Shulu Li, Ion Stoica, Azalia Mirhoseini, Marco Pavone

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(NVIDIA研究)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12446 2025-07-01 cs.CL 57%

From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment

Bin Xie, Bingbing Xu, Yige Yuan, Shengmao Zhu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室、计算技术研究所、中国科学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13271 2025-07-01 cs.CL 57%

CSC-SQL: Corrective Self-Consistency in Text-to-SQL via Reinforcement Learning

Lei Sheng, Shuai-Shuai Xu

机构 * Wuhan University of Technology(武汉理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20112 2025-06-26 cs.CL 57%

A Multi-Pass Large Language Model Framework for Precise and Efficient Radiology Report Error Detection

Songsoo Kim, Seungtae Lee, See Young Lee, Joonho Kim, Keechan Kan, Dukyong Yoon

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments 29 pages, 5 figures, 4 tables. Code available at https://github.com/radssk/mp-rred

详情

展开后加载摘要…

URL PDF HTML 收藏