arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2508.16697 2025-08-26 cs.CL cs.AI cs.LG 67%

QueryBandits for Hallucination Mitigation: Exploiting Semantic Features for No-Regret Rewriting

Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

机构 * JP Morgan AI Research(摩根大通人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01619 2025-08-22 cs.SE cs.AI cs.CL cs.LG 67%

Learning to Generate Unit Tests for Automated Debugging

Archiki Prasad, Elias Stengel-Eskin, Justin Chih-Yao Chen, Zaid Khan, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to COLM 2025. Dataset and Code: https://github.com/archiki/UTGenDebug

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20840 2025-08-07 cs.AI cs.CL cs.LG cs.SE 67%

CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision

Yifei Lu, Fanghua Ye, Jian Li, Qiang Gao, Cheng Liu, Haibo Luo, Nan Du, Xiaolong Li, Feiliang Ren

机构 * Northeastern University(东北大学) Hunyuan AI Digital Human(文英AI数字人)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08088 2025-07-28 cs.CR cs.IR 67%

KGV: Integrating Large Language Models with Knowledge Graphs for Cyber Threat Intelligence Credibility Assessment

Zongzong Wu, Fengxiao Tang, Ming Zhao, Yufeng Li

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02092 2025-07-04 cs.LG cs.AI cs.CL cs.CV 67%

Energy-Based Transformers are Scalable Learners and Thinkers

Alexi Gladstone, Ganesh Nanduru, Md Mofijul Islam, Peixuan Han, Hyeonjeong Ha, Aman Chadha, Yilun Du, Heng Ji, Jundong Li, Tariq Iqbal

机构 * UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) Amazon GenAI(亚马逊人工智能) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14557 2025-07-04 quant-ph cs.MA 67%

Enhancing LLM-based Quantum Code Generation with Multi-Agent Optimization and Quantum Error Correction

Charlie Campbell, Hao Mark Chen, Wayne Luk, Hongxiang Fan

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract)

Comments Paper accepted by DAC'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15254 2025-06-12 cs.LG cs.AI cs.CL 67%

Archon: An Architecture Search Framework for Inference-Time Techniques

Jon Saad-Falcon, Adrian Gamarra Lafuente, Shlok Natarajan, Nahum Maru, Hristo Todorov, Etash Guha, E. Kelly Buchanan, Mayee Chen, Neel Guha, Christopher Ré, Azalia Mirhoseini

机构 * Stanford University, Stanford, CA, USA(斯坦福大学) University of Washington, Seattle, WA, USA(华盛顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18380 2025-06-10 cs.LG cs.AI cs.CL 67%

Outlier-weighed Layerwise Sampling for LLM Fine-tuning

Pengxiang Li, Lu Yin, Xiaowei Gao, Shiwei Liu

机构 * Dalian University of Technology(大连理工大学) University of Surrey(Surrey大学) Eindhoven University of Technology(埃因霍温理工大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15781 2025-06-04 cs.CL cs.AI cs.LG 67%

Large Language Models to Diffusion Finetuning

Edoardo Cetin, Tianyu Zhao, Yujin Tang

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Camera-ready version, presented at ICML 2025. Code available at: https://github.com/SakanaAI/L2D

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15771 2025-05-30 cs.LG cs.AI cs.CL 67%

Learning to Reason from Feedback at Test-Time

Yanyang Li, Michael Lyu, Liwei Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 Main; Project Page: https://github.com/LaVi-Lab/FTTT

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01662 2025-05-30 cs.CL cs.AI cs.LG 67%

Fast Large Language Model Collaborative Decoding via Speculation

Jiale Fu, Yuchu Jiang, Junkai Chen, Jiaming Fan, Xin Geng, Xu Yang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05522 2025-05-29 cs.IR 67%

User Feedback Alignment for LLM-powered Exploration in Large-scale Recommendation Systems

Jianling Wang, Yifan Liu, Yinghao Sun, Xuejian Ma, Yueqi Wang, He Ma, Zhengyang Su, Minmin Chen, Mingyan Gao, Onkar Dalal, Ed H. Chi, Lichan Hong, Ningren Han, Haokai Lu

专题命中 测试时计算 :reasoning(abstract);planning(abstract)

Comments ACL'25 (Industry) Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08725 2025-05-27 cs.SE cs.AI cs.CL cs.LG 67%

DocAgent: A Multi-Agent System for Automated Code Documentation Generation

Dayu Yang, Antoine Simoulin, Xin Qian, Xiaoyi Liu, Yuwei Cao, Zhaopu Teng, Grey Yang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2025. Code: github.com/facebookresearch/DocAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03799 2025-05-08 cs.LG cs.AI cs.CL 67%

Scalability Matters: Overcoming Challenges in InstructGLM with Similarity-Degree-Based Sampling

Hyun Lee, Chris Yi, Maminur Islam, B. D. S. Aritra

机构 * Dept. of Computer Science, Trinity College, Hartford, Connecticut, USA(计算机科学系,特里尼蒂学院,哈特福德,康涅狄格州,美国)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published in International Joint Conference on Neural Networks (IJCNN), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18624 2025-05-05 cs.CL cs.AI cs.CV cs.LG 67%

Do Vision & Language Decoders use Images and Text equally? How Self-consistent are their Explanations?

Letitia Parcalabescu, Anette Frank

机构 * Computational Linguistics Department(计算语言学系) Heidelberg University(海德堡大学)

专题命中 测试时计算 :CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06214 2025-04-09 cs.CL cs.AI cs.LG 67%

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13447 2025-03-18 cs.CL cs.AI cs.LG 67%

MetaScale: Test-Time Scaling with Evolving Meta-Thoughts

Qin Liu, Wenxuan Zhou, Nan Xu, James Y. Huang, Fei Wang, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07180 2025-03-07 cs.CL cs.AI cs.LG 67%

Gumbel Counterfactual Generation From Language Models

Shauli Ravfogel, Anej Svete, Vésteinn Snæbjarnarson, Ryan Cotterell

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00750 2025-02-24 cs.CL cs.AI cs.LG 67%

Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling

Yiwen Ding, Zhiheng Xi, Wei He, Zhuoyuan Li, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NAACL 2025 Main Conference. Codes are publicly available at https://github.com/Yiwen-Ding/Guided-Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21236 2025-02-17 cs.LG cs.AI cs.CL 67%

Flaming-hot Initiation with Regular Execution Sampling for Large Language Models

Weizhe Chen, Zhicheng Zhang, Guanlin Liu, Renjie Zheng, Wenlei Shi, Chen Dun, Zheng Wu, Xing Jin, Lin Yan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00663 2025-01-03 cs.LG cs.AI cs.CL 67%

Titans: Learning to Memorize at Test Time

Ali Behrouz, Peilin Zhong, Vahab Mirrokni

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01951 2024-12-05 cs.AI cs.CL cs.LG stat.ML 67%

Self-Improvement in Language Models: The Sharpening Mechanism

Audrey Huang, Adam Block, Dylan J. Foster, Dhruv Rohatgi, Cyril Zhang, Max Simchowitz, Jordan T. Ash, Akshay Krishnamurthy

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06590 2024-11-12 cs.LG cs.AI cs.CL 67%

CriticAL: Critic Automation with Language Models

Michael Y. Li, Vivek Vajipey, Noah D. Goodman, Emily B. Fox

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20974 2024-10-07 cs.CL cs.AI cs.LG 67%

SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales

Tianyang Xu, Shujin Wu, Shizhe Diao, Xiaoze Liu, Xingyao Wang, Yangyi Chen, Jing Gao

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02811 2024-10-07 cs.AI cs.CL cs.LG 67%

SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs

Hanzhu Chen, Xu Shen, Qitan Lv, Jie Wang, Xiaoqi Ni, Jieping Ye

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10938 2024-10-03 cs.LG cs.AI cs.CL stat.ML 67%

Observational Scaling Laws and the Predictability of Language Model Performance

Yangjun Ruan, Chris J. Maddison, Tatsunori Hashimoto

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024 as a spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18290 2024-07-31 cs.LG cs.AI cs.CL 67%

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19668 2024-05-31 cs.CV 67%

AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization

Jiawei Chen, Xiao Yang, Zhengwei Fang, Yu Tian, Yinpeng Dong, Zhaoxia Yin, Hang Su

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07927 2024-05-20 cs.CL cs.AI cs.LG 67%

Are self-explanations from Large Language Models faithful?

Andreas Madsen, Sarath Chandar, Siva Reddy

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The 62nd Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08373 2024-05-15 cs.CL cs.AI cs.LG 67%

PromptMind Team at MEDIQA-CORR 2024: Improving Clinical Text Correction with Error Categorization and LLM Ensembles

Satya Kesav Gundabathula, Sriram R Kolar

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper accepted for oral presentation at Clinical NLP workshop, NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏