arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2506.04559 2026-03-24 cs.CV 78%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV 78%

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 测试时计算 :verifier(title,abstract)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07887 2026-03-10 cs.LG cs.AI cs.CL math.ST stat.ML stat.TH 78%

Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference

拒绝、重采样、重复:理解语言模型推理中的并行推理

Noah Golowich, Fan Chen, Dhruv Rohatgi, Raghav Singhal, Carles Domingo-Enrich, Dylan J. Foster, Akshay Krishnamurthy

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过粒子过滤算法研究语言模型推理中采样误差的理论与实践,揭示SMC方法的非渐近保证及采样误差的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08192 2026-03-10 cs.CV 78%

Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging

路由、检索、反思、修复:一种自改进的代理框架,用于医学影像中的视觉检测和语言推理

Md. Faiyaz Abdullah Sayeedi, Rashedur Rahman, Siam Tahsin Bhuiyan, Sefatul Wasi, Ashraful Islam, Saadia Binte Alam, AKM Mahbubur Rahman

机构 * 1 Center for Computational \& Data Sciences (CCDS), Independent University, Bangladesh (IUB)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 R^4框架通过路由、检索、反思和修复四个代理提升医学影像分析的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12987 2026-03-04 cs.MA 78%

Reuse, Don't Recompute: Efficient Large Reasoning Model Inference via Memory Orchestration

重用,而非重新计算:通过内存 orchestration 实现高效的大型推理模型推理

Daivik Patel, Shrenik Patel

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 ENGRAM-R 通过重用结构化内存提升大型推理模型的效率,减少令牌消耗并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08346 2026-02-10 cs.CV 78%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14442 2025-12-17 cs.CV cs.RO 78%

A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning

A4-Agent: 一种用于零样本 affordance 推理的代理框架

Zixin Zhang, Kanghao Chen, Hanqing Wang, Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) Knowin

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00086 2025-11-04 cs.LG cs.AI cs.CL 78%

Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph

Fali Wang, Jihai Chen, Shuhua Yang, Runxue Bao, Tianxiang Zhao, Zhiwei Zhang, Xianfeng Tang, Hui Liu, Qi He, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Pittsburgh(匹兹堡大学) Amazon(亚马逊) Microsoft(微软)

专题命中 测试时计算 :test-time compute(title);分类 cs.CL、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19003 2025-09-24 cs.CV 78%

Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards

Honghao Chen, Xingzhou Lou, Xiaokun Feng, Kaiqi Huang, Xinlong Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 测试时计算 :reasoning(title,abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01794 2025-08-21 cs.CR cs.GT 78%

It Takes Two: A Peer-Prediction Solution for Blockchain Verifier's Dilemma

Zishuo Zhao, Xi Chen, Yuan Zhou

专题命中 测试时计算 :verifier(title,abstract)

Comments 63 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18669 2025-06-24 cs.CV 78%

MedSeg-R: Medical Image Segmentation with Clinical Reasoning

Hao Shao, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 测试时计算 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00304 2025-06-04 cs.CV 78%

StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models

Yuxiang Guo, Faizan Siddiqui, Yang Zhao, Rama Chellappa, Shao-Yuan Lo

机构 * Johns Hopkins University(约翰霍普金斯大学) Honda Research Institute USA(本田研究院美国)

专题命中 测试时计算 :reasoning(title,abstract)

Comments Paper is accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07065 2025-03-11 cs.CV 78%

Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Huilin Deng, Ding Zou, Rui Ma, Hongchen Luo, Yang Cao, Yu Kang

专题命中 测试时计算 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08281 2024-12-12 cs.SE 78%

Lachesis: Predicting LLM Inference Accuracy using Structural Properties of Reasoning Paths

Naryeong Kim, Sungmin Kang, Gabin An, Shin Yoo

专题命中 测试时计算 :reasoning(title,abstract)

Comments To appear at DeepTest 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11190 2022-11-22 cs.CV 78%

Cross-Modal Contrastive Learning for Robust Reasoning in VQA

Qi Zheng, Chaoyue Wang, Daqing Liu, Dadong Wang, Dacheng Tao

专题命中 测试时计算 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 77%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :verifier(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03077 2026-08-05 cs.CL 新提交 77%

PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

PAMT:面向多领域机器翻译的过程对齐强化学习

Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 针对多领域机器翻译中显式推理的偏差问题,提出过程对齐强化学习框架PAMT,结合长思维链监督与多维度奖励机制,在多种场景下表现优于基线模型。

Comments 23 pages, 10 figures, and 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23771 2026-07-28 cs.AI 新提交 77%

Training Language Models to Cooperate with Inference-Time Controllers

训练语言模型以与推理时控制器协作

Moumita Choudhury, Vanshaj Khattar, Jing Liu, Toshiaki Koike-Akino, Ankush Chakrabarty, Shlomo Zilberstein, Ye Wang

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 77%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25702 2026-06-19 cs.CL 版本更新 77%

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

S2D2:通过免训练自我推测实现扩散LLM的快速解码

Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Iowa State University(爱荷华州立大学) Core AI, IBM(IBM核心AI)

专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。

Comments Code is available at https://github.com/phymhan/S2D2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02919 2026-06-01 cs.CL 77%

Self-Reflective Generation at Test Time

测试时的自反生成

Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出SRGen框架,通过动态熵阈值识别高不确定性token并训练校正向量,在测试时进行自反生成以纠正概率分布,提升大模型推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11657 2026-05-26 cs.CL 77%

Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving

扩展基于自然语言图结构的测试时计算用于自动定理证明

Vincent Li, Tim Knappe, Yule Fu, Kevin Han, Kevin Zhu

机构 * Boston University Provadis School of International Management \& Technology Duke University Algoverse AI Research

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 提出KG-prover框架,利用从权威数学文本挖掘的知识图谱增强通用大语言模型,通过扩展图结构的测试时计算显著提升自动定理证明性能。

Comments Accepted to ICML AI4Math Workshop 2025, NAACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00136 2026-05-04 cs.AI 77%

Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

工具是否足够?揭示LLM代理中的工具使用税

Kaituo Zhang, Zhen Xiong, Mingyu Zhong, Zhimeng Jiang, Zhouyuan Yuan, Zhecheng Li, Ying Lin

机构 * University of Houston(休斯顿大学) University of Southern California(南加州大学) New York University(纽约大学) Texas A&M University(德克萨斯农工大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 本文研究了工具增强推理在LLM代理中的有效性,发现语义干扰下工具性能可能下降,提出Factorized Intervention Framework分析工具使用成本,并引入G-STEP缓解协议误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19395 2026-04-22 cs.CL 77%

Does Self-Consistency Improve the Recall of Encyclopedic Knowledge?

自洽性是否能提升百科知识的回忆能力?

Sho Hoshino, Ukyo Honda, Peinan Zhang

机构 * CyberAgent

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本文通过建立MMLU基准的百科知识回忆分割,验证了自洽性在符号推理和百科知识回忆中的提升效果,使用GPT-4o达到MMLU 89%的准确率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02315 2026-04-06 cs.AI 77%

Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models

超越助手回合:用户回合生成作为语言模型交互意识的探测器

Sarath Shekkizhar, Romain Cosentino, Adam Earle

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出通过用户回合生成探测语言模型的交互意识,发现交互意识与任务准确性无关,且通过温度采样可提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07223 2026-03-10 cs.LG 77%

Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training

解锁金融数据价值:关于蒸馏和难度感知训练的研究

Chuxue Cao, Honglin Lin, Zhanping Zhong, Xin Gao, Mengzhang Cai, Conghui He, Sirui Han, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出ODA-Fin-SFT-318k和ODA-Fin-RL-12k数据集,通过多阶段蒸馏和难度感知训练提升金融领域模型性能,实现高质量的链式思维监督和任务多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01350 2026-02-26 cs.AI 77%

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

通过视觉-语言模型实现无训练的3DCAD装配体部件检索:基于错误笔记本的引导

Yunqing Liu, Nan Zhang, Zhiming Tan

机构 * Fujitsu Research & Development Center Shanghai, China(富士通研发中心上海)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract);分类 cs.AI

AI总结 本研究提出一种无训练的3D CAD部件检索方法,通过结合错误笔记本与RAG技术,显著提升基于VLM的推理性能,实验显示在专有模型和开源模型上均取得显著效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20408 2026-02-25 cs.CY cs.AI cs.HC 77%

Examining and Addressing Barriers to Diversity in LLM-Generated Ideas

检验和解决大语言模型生成想法中的多样性障碍

Yuting Deng, Melanie Brucks, Olivier Toubia

机构 * Deng, Brucks, and Toubia(邓, 布鲁克斯和托比亚)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究了LLM生成想法的多样性问题,通过四种研究发现,通过链式推理提示和普通人物提示可分别减少固定现象和改善知识分区,从而提升想法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21604 2025-10-27 cs.CL 77%

RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models

Xueyuan Lin, Cehao Yang, Ye Ma, Ming Li, Rongjunchen Zhang, Yang Ni, Xiaojun Wu, Chengjin Xu, Jian Guo, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research(IDEA研究院) Hithink RoyalFlush Information Network Co., Ltd(慧思皇家Flush信息网络有限公司) DataArc Tech Ltd(DataArc科技有限公司)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22101 2025-09-29 cs.CL 77%

Think Right, Not More: Test-Time Scaling for Numerical Claim Verification

Primakov Chungkham, V Venktesh, Vinay Setty, Avishek Anand

机构 * TU Delft(代尔夫特理工大学) Stockholm University(斯德哥尔摩大学) University of Stavanger(斯塔万内尔大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏