arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2601.15816 2026-01-23 eess.SY cs.AI cs.SY 70%

Virtual Traffic Police: Large Language Model-Augmented Traffic Signal Control for Unforeseen Incidents

虚拟交通警察:基于大语言模型的交通信号控制用于突发事件

Shiqi Wei, Qiqing Wang, Kaidi Yang

机构 * Department of Civil and Environmental Engineering, National University of Singapore(环境与土木工程系,新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的交通信号控制框架,通过虚拟交通警察代理实时调整信号控制器参数,提升应对突发事件的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 70%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 测试时计算 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25014 2026-01-01 cs.LG cs.CC 70%

Diffusion Language Models are Provably Optimal Parallel Samplers

扩散语言模型是可证明最优的并行采样器

Haozhe Jiang, Nika Haghtalab, Lijie Chen

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文证明了通过链式思维和修订,扩散语言模型能够以最优步骤和空间复杂度模拟并行采样算法,从而提升其作为高效并行采样器的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12042 2025-12-16 cs.CL 70%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23436 2025-12-01 cs.AI 70%

Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent

迈向持续智能增长:在SuperIntelliAgent中实现自我训练、持续学习和双尺度记忆

Jianzhe Lin, Zeyu Pan, Yun Zhu, Ruiqi Song, Jining Yang

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 SuperIntelliAgent通过自我训练和双尺度记忆实现持续智能增长,利用可训练学习者与推理验证者配对,提升偏好对齐和学习效果。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2025-10-28 cs.CL cs.SE 70%

Scalable Supervising Software Agents with Patch Reasoner

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10264 2025-10-14 cs.CV cs.AI 70%

MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs

Haonan Ge, Yiwei Wang, Ming-Hsuan Yang, Yujun Cai

机构 * Department of Computer Science and Engineering, University of California at Merced(计算机科学与工程系,加州大学默塞德分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03149 2025-10-06 cs.LG cs.DS 70%

Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking

Dhruv Rohatgi, Abhishek Shetty, Donya Saless, Yuchen Li, Ankur Moitra, Andrej Risteski, Dylan J. Foster

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01591 2025-10-03 cs.CL 70%

CLUE: Non-parametric Verification from Experience via Hidden-State Clustering

Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Notre Dame(诺丁汉大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22558 2025-10-03 cs.AI 70%

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

Chenyu Zhou, Tianyi Xu, Jianghao Lin, Dongdong Ge

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01245 2025-10-01 cs.AI cs.MA cs.OS 70%

Towards Agentic OS: An LLM Agent Framework for Linux Schedulers

Yusheng Zheng, Yanpeng Hu, Wei Zhang, Andi Quinn

机构 * UC Santa Cruz, CA, USA(加州大学圣克ruz分校) University of Connecticut(康涅狄格大学) ShanghaiTech University(上海科技大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

Journal ref MLforSystem 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23152 2025-09-30 cs.LG 70%

Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) University of California, Merced(加州大学默塞德分校) Sun Yat-sen University(中山大学) MBZUAI(穆罕默德·本·拉希德·阿勒马克图姆智能研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06870 2025-09-09 cs.CL 70%

The Majority is not always right: RL training for solution aggregation

Wenting Zhao, Pranjal Aggarwal, Swarnadeep Saha, Asli Celikyilmaz, Jason Weston, Ilia Kulikov

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13465 2025-08-20 cs.AI 70%

LM Agents May Fail to Act on Their Own Risk Knowledge

Yuzhi Tang, Tianxiao Li, Elizabeth Li, Chris J. Maddison, Honghua Dong, Yangjun Ruan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11371 2025-07-16 cs.LG cs.MA 70%

Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs

Gabriel Bo, Koa Chang, Justin Gu

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12564 2025-06-25 cs.CL 70%

Evaluating Zero-Shot Multilingual Aspect-Based Sentiment Analysis with Large Language Models

Chengyan Wu, Bolei Ma, Zheyu Zhang, Ningyuan Deng, Yanqing He, Yun Xue

机构 * Guangdong Provincial Key Laboratory of Quantum Engineering and Quantum Materials, School of Electronic Science and Engineering (School of Microelectronics)(广东量子工程与材料重点实验室,电子科学与工程学院(微电子学院)) South China Normal University(华南师范大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东智能信息处理重点实验室) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Preprint; Paper accepted at International Journal of Machine Learning and Cybernetics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24857 2025-06-02 cs.LG 70%

Accelerated Sampling from Masked Diffusion Models via Entropy Bounded Unmasking

Heli Ben-Hamu, Itai Gat, Daniel Severo, Niklas Nolte, Brian Karrer

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03261 2025-05-20 cs.CL 70%

Can Frontier LLMs Replace Annotators in Biomedical Text Mining? Analyzing Challenges and Exploring Solutions

Yichong Zhao, Susumu Goto

机构 * The University of Tokyo(东京大学) Graduate School of Frontier Sciences(前沿科学研究生院) Department of Computational Biology and Medical Sciences(计算生物学与医学科学系) Database Center for Life Science(生命科学数据库中心) Joint Support-Center for Data Science Research(数据科学研究联合支持中心)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10772 2025-05-19 cs.CL 70%

Ranked Voting based Self-Consistency of Large Language Models

Weiqin Wang, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01828 2025-05-05 cs.RO cs.LG 70%

From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment

Yilin Wu, Ran Tian, Gokul Swamy, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06251 2025-04-29 cs.AI 70%

Quasi-random Multi-Sample Inference for Large Language Models

Aditya Parashar, Aditya Vikram Singh, Avinash Amballa, Jinlin Lai, Benjamin Rozonoyer

机构 * College of Information & Computer Sciences, University of Massachusetts Amherst(信息与计算机科学学院,马萨诸塞大学阿默斯特分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16760 2025-04-24 cs.AI 70%

Lightweight Latent Verifiers for Efficient Meta-Generation Strategies

Bartosz Piotrowski, Witold Drzewakowski, Konrad Staniszewski, Piotr Miłoś

机构 * IDEAS NCBR &Witold Drzewakowski University of Warsaw(IDEAS NCBR与华沙大学) IDEAS NCBR &Konrad Staniszewski University of Warsaw(IDEAS NCBR与华沙大学) IDEAS NCBR NVIDIA &Piotr Miłoś IMPAN(IDEAS NCBR NVIDIA与波兰科学院)

专题命中 测试时计算 :reasoning(abstract);self-correction(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13592 2025-04-22 cs.CL 70%

Improving Generalization in Intent Detection: GRPO with Reward-Based Curriculum Sampling

Zihao Feng, Xiaoxue Wang, Ziwei Bai, Donghang Su, Bowen Wu, Qun Yu, Baoxun Wang

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13007 2025-02-20 cs.CL 70%

PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament

Yantao Liu, Zijun Yao, Rui Min, Yixin Cao, Lei Hou, Juanzi Li

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments in progress work

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18585 2025-02-19 cs.CL 70%

Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs

Yue Wang, Qiuzhi Liu, Jiahao Xu, Tian Liang, Xingyu Chen, Zhiwei He, Linfeng Song, Dian Yu, Juntao Li, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, Dong Yu

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

Comments 1. We have updated the results for DeepSeek-R1, and all of our original conclusions remain valid. 2. Our proposed Tip approach remains effective in Best-of-N scenarios (e.g., self-consistency and Laconic Decoding) when built on DeepSeek-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11157 2025-02-18 cs.AI 70%

Dyve: Thinking Fast and Slow for Dynamic Process Verification

Jianyuan Zhong, Zeju Li, Zhijian Xu, Xiangyu Wen, Qiang Xu

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14427 2025-02-13 cs.LG 70%

GraphSOS: Graph Sampling and Order Selection to Help LLMs Understand Graphs Better

Xu Chu, Hanlin Xue, Zhijie Tan, Bingce Wang, Tong Mo, Weiping Li

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18841 2025-02-03 cs.LG cs.CR 70%

Trading Inference-Time Compute for Adversarial Robustness

Wojciech Zaremba, Evgenia Nitishinskaya, Boaz Barak, Stephanie Lin, Sam Toyer, Yaodong Yu, Rachel Dias, Eric Wallace, Kai Xiao, Johannes Heidecke, Amelia Glaese

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11514 2025-01-16 cs.CL 70%

Counterfactual Debating with Preset Stances for Hallucination Elimination of LLMs

Yi Fang, Moxin Li, Wenjie Wang, Hui Lin, Fuli Feng

专题命中 测试时计算 :reasoning(abstract);self-correction(abstract);分类 cs.CL

Comments accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08523 2024-09-17 cs.CL 70%

Eir: Thai Medical Large Language Models

Yutthakorn Thiprak, Rungtam Ngodngamthaweesuk, Songtam Ngodngamtaweesuk

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments typos corrected, and references added

详情

展开后加载摘要…

URL PDF HTML 收藏