arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2037 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2037 篇

2506.19724 2025-06-25 cs.AI 57%

From Reproduction to Replication: Evaluating Research Agents with Progressive Code Masking

Gyeongwon James Kim, Alex Wilf, Louis-Philippe Morency, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18781 2025-06-24 cs.CL 57%

Existing LLMs Are Not Self-Consistent For Simple Tasks

Zhenru Lin, Jiawen Tao, Yang Yuan, Andrew Chi-Chih Yao

机构 * IIIS, Tsinghua University(清华大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Qizhi Institute(上海启智研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16507 2025-06-23 cs.LG 57%

Robust Reward Modeling via Causal Rubrics

Pragya Srivastava, Harman Singh, Rahul Madhavan, Gandharv Patil, Sravanti Addepalli, Arun Suggala, Rengarajan Aravamudhan, Soumya Sharma, Anirban Laha, Aravindan Raghuveer, Karthikeyan Shanmugam, Doina Precup

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13363 2025-06-17 cs.CL 57%

Efficient Medical VIE via Reinforcement Learning

Lijun Liu, Ruiyang Li, Zhaocheng Liu, Chenglin Zhu, Chong Li, Jiehan Cheng, Qiang Ju, Jian Xie

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11021 2025-06-16 cs.SE cs.AI 57%

Eliminating Hallucination-Induced Errors in LLM Code Generation with Functional Clustering

Chaitanya Ravuri, Saman Amarasinghe

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12372 2025-06-12 cs.DB cs.AI 57%

Is Long Context All You Need? Leveraging LLM's Extended Context for NL2SQL

Yeounoh Chung, Gaurav T. Kakkar, Yu Gan, Brenton Milne, Fatma Ozcan

机构 * Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 13 pages, 6 figures, VLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06982 2025-06-10 cs.CL 57%

Chain of Methodologies: Scaling Test Time Computation without Training

Cong Liu, Jie Wu, Weigang Wu, Xu Chen, Liang Lin, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Temple University

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20380 2025-05-28 cs.LG 57%

GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining

Simin Fan, Maria Ios Glarou, Martin Jaggi

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15508 2025-05-22 cs.CL 57%

Multilingual Test-Time Scaling via Initial Thought Transfer

Prasoon Bajpai, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments 14 pages, 9 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13672 2025-05-21 cs.AI 57%

A*-Decoding: Token-Efficient Inference Scaling

Giannis Chatziveroglou

机构 * MIT(麻省理工学院) Cohere

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13403 2025-05-20 cs.CL 57%

MR. Judge: Multimodal Reasoner as a Judge

Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiulong Shan, Kieran Liu, Meng Cao

机构 * HKUST(香港科技大学) Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08507 2025-05-14 cs.LG 57%

InfoPO: On Mutual Information Maximization for Large Language Model Alignment

Teng Xiao, Zhen Ge, Sujay Sanghavi, Tian Wang, Julian Katz-Samuels, Marc Versage, Qingjun Cui, Trishul Chilimbi

机构 * Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07680 2025-05-13 cs.LG cs.DC 57%

SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models

Hang Wu, Jianian Zhu, Yinghui Li, Haojie Wang, Biao Hou, Jidong Zhai

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01954 2025-05-06 cs.LG 57%

Semantic Probabilistic Control of Language Models

Kareem Ahmed, Catarina G Belem, Padhraic Smyth, Sameer Singh

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19898 2025-04-29 cs.CL 57%

GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets

Mingqian He, Fei Zhao, Chonggang Lu, Ziyan Liu, Yue Wang, Haofu Qian

机构 * Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01840 2025-04-24 cs.CL 57%

EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test

Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14148 2025-04-22 cs.CV cs.CL 57%

Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment

Chenhang Cui, An Zhang, Yiyang Zhou, Zhaorun Chen, Gelei Deng, Huaxiu Yao, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments 23 pages; Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13145 2025-04-22 cs.AI 57%

Exploring Expert Failures Improves LLM Agent Tuning

Li-Cheng Lan, Andrew Bai, Minhao Cheng, Cho-Jui Hsieh, Tianyi Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07958 2025-04-07 cs.AI 57%

PAFFA: Premeditated Actions For Fast Agents

Shambhavi Krishna, Zheng Chen, Yuan Ling, Xiaojiang Huang, Yingjie Li, Fan Yang, Xiang Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18942 2025-04-02 cs.CV cs.AI 57%

Video-T1: Test-Time Scaling for Video Generation

Fangfu Liu, Hanyang Wang, Yimo Cai, Kaiyan Zhang, Xiaohang Zhan, Yueqi Duan

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

Comments Project page: https://liuff19.github.io/Video-T1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22731 2025-04-01 cs.LG 57%

MoRE-LLM: Mixture of Rule Experts Guided by a Large Language Model

Alexander Koebler, Ingo Thon, Florian Buettner

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 2024 IEEE International Conference on Data Mining (ICDM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16893 2025-03-24 cs.DC cs.LG 57%

Improving the End-to-End Efficiency of Offline Inference for Multi-LLM Applications Based on Sampling and Simulation

Jingzhi Fang, Yanyan Shen, Yue Wang, Lei Chen

专题命中 测试时计算 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15886 2025-03-24 cs.CV cs.LG 57%

Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance

Hui Liu, Wenya Wang, Kecheng Chen, Jie Liu, Yibing Liu, Tiexin Qin, Peisong He, Xinghao Jiang, Haoliang Li

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments 21 pages, 7 figures 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04618 2025-03-07 cs.CL 57%

Better Process Supervision with Bi-directional Rewarding Signals

Wenxiang Chen, Wei He, Zhiheng Xi, Honglin Guo, Boyang Hong, Jiazheng Zhang, Rui Zheng, Nijun Li, Tao Gui, Yun Li, Qi Zhang, Xuanjing Huang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04343 2025-03-04 cs.CL 57%

Inference Scaling for Long-Context Retrieval Augmented Generation

Zhenrui Yue, Honglei Zhuang, Aijun Bai, Kai Hui, Rolf Jagerman, Hansi Zeng, Zhen Qin, Dong Wang, Xuanhui Wang, Michael Bendersky

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17172 2025-02-26 cs.HC cs.AI cs.CY q-bio.NC 57%

Teleology-Driven Affective Computing: A Causal Framework for Sustained Well-Being

Bin Yin, Chong-Yi Liu, Liya Fu, Jinkun Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15719 2025-02-25 cs.CY cs.AI 57%

Governing AI Beyond the Pretraining Frontier

Nicholas A. Caputo

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12700 2025-02-19 cs.CL 57%

Multi-Novelty: Improve the Diversity and Novelty of Contents Generated by Large Language Models via inference-time Multi-Views Brainstorming

Arash Lagzian, Srinivas Anumasa, Dianbo Liu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10851 2025-02-18 cs.LG physics.chem-ph q-bio.QM 57%

To Bin or not to Bin: Alternative Representations of Mass Spectra

Niek de Jonge, Justin J. J. van der Hooft, Daniel Probst

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments This manuscript has been submitted to the tiny paper track at the LMRL workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15847 2025-02-12 cs.CR cs.AI 57%

LLMmap: Fingerprinting For Large Language Models

Dario Pasquini, Evgenios M. Kornaropoulos, Giuseppe Ateniese

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.AI

Comments Appearing in the proceedings of the 34th USENIX Security Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏