Compute Allocation for Reasoning-Intensive Retrieval Agents
为推理密集型检索代理进行计算分配
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究通过BRIGHT基准和Gemini 2.5模型家族,探讨推理密集型检索管道中的计算分配,发现重排阶段受益于更强模型和更深候选池,而查询扩展在轻量模型后效果递减。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
为推理密集型检索代理进行计算分配
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究通过BRIGHT基准和Gemini 2.5模型家族,探讨推理密集型检索管道中的计算分配,发现重排阶段受益于更强模型和更深候选池,而查询扩展在轻量模型后效果递减。
推理缓存:通过短期限强化学习实现长周期的持续改进
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出RC算法,通过利用LLM的响应生成与总结能力差异,实现长周期的持续改进,实验显示其在HMMT 2025任务中性能显著提升。
Comments preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)
CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。
∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UC San Diego(圣地亚哥大学) ; TTIC ; Georgia Tech(佐治亚理工学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。
Comments ICLR 2026
SPEED-RL: 通过在线课程学习加速推理模型训练
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 SPEED-RL通过在线课程学习方法,提升推理模型训练效率,实现2-6倍的加速,同时保持准确性。
Comments There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us
基于语义槽聚合的token压缩:用于十亿像素病理推理
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; University of Nottingham NingBo(诺丁汉大学宁波学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 TC-SSA通过语义槽聚合实现token压缩,提升十亿像素病理推理的效率与诊断性能
Comments 8 pages, 4 figures, 2 tables
用于LLM代理的验证器绑定通信:对隐蔽信号的认证界限
机构 * umd(马里兰大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 本文提出CLBC协议,通过验证器绑定通信限制LLM代理的隐蔽信号,确保安全性和可验证性。
将过程与结果联系起来:用于大语言模型推理的条件奖励建模
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出条件奖励建模(CRM),通过将LLM推理视为时间过程,解决奖励分配模糊性和奖励黑客问题,提升推理性能。
离线推理用于高效推荐:基于LLM的个性化-属性化物品索引
机构 * Yonsei University(延世大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 Persona4Rec通过离线推理构建物品个性化表示,实现高效且可解释的推荐系统,减少推理时间并提供直观解释。
Comments Under review
共享本质,独特培养:通过上下文结构建模实现多元推理的PRISM
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Yale University(耶鲁大学) ; University of California Santa Cruz(加州大学圣克鲁兹分校)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 PRISM通过上下文结构建模实现多元推理,提升创造力和科学发现能力,展现独特认知轨迹的多元AI新范式。
推进移动GUI代理:一种以验证器驱动的方法用于实际部署
机构 * Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率
Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026
基于大语言模型的知识蒸馏的时序知识图谱推理
机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) ; School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。
APR:通过基于锚点的过程奖励惩罚大型推理模型中的结构冗余
机构 * NiuTrans Research(尼utoff研究)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 APR通过基于锚点的过程奖励方法,有效惩罚大型推理模型中的结构冗余,提升推理效率与性能。
Comments Under Review
推理时的推理选择性减少大语言模型中的隐性社会偏见
机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。
为竞争编程设计的扩展代理验证器
机构 * Renmin University of China(中国人民大学) ; Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL
AI总结 本文提出Agentic Verifier,通过主动推理和高效测试输入生成,提升竞争编程问题解决的准确性与效率。
Grad2Reward: 从稀疏判断到密集奖励以提升开放性大语言模型推理
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 Grad2Reward通过从判断者模型推理过程中提取密集过程奖励,提升开放性大语言模型推理的效率和质量。
ReasoningBomb: 通过诱导病态长推理实现隐蔽的拒绝服务攻击
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Nanyang Technological University(南洋理工大学) ; NVIDIA(NVIDIA公司) ; University of California, Davis(加州大学戴维斯分校) ; Cornell University(康奈尔大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 ReasoningBomb通过生成短自然提示诱导大型推理模型进入病态长推理,实现隐蔽的拒绝服务攻击,具有高放大率、隐蔽性和可优化性。
Comments Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb
ALIGN: 多智能体LLM推理中的对齐委托与性能保证
机构 * Department of Biostatistics, UCLA(生物统计学系,加州大学洛杉矶分校) ; Department of Statistics and Data Science, UCLA(统计学与数据科学系,加州大学洛杉矶分校) ; Department of Computer Science, UCLA(计算机科学系,加州大学洛杉矶分校) ; Departments of Statistics and Data Science, and of Biostatistics, UCLA(统计学与数据科学系和生物统计学系,加州大学洛杉矶分校)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 ALIGN通过多智能体对齐委托机制,提升大语言模型在复杂推理任务中的性能保障与表现。
JEPA-Reasoner:将潜在推理与标记生成解耦
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 JEPA-Reasoner通过解耦潜在推理与标记生成,提升模型在复杂推理任务中的准确率和鲁棒性。
识别并转移推理关键神经元:通过激活引导提升LLM推理可靠性
机构 * Shandong University(山东大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出AdaRAS,通过识别并引导推理关键神经元提升LLM推理可靠性,实验显示在数学和编程基准测试中取得显著改进。
思维强化学习:通过推理时间强化学习导航大语言模型推理
机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 RL-of-Thoughts通过强化学习训练轻量级导航模型,提升大语言模型推理能力,实现多任务适应性和参数高效性。
面向PDE基础模型的推理:一种基于奖励模型的推理时扩展算法
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出了一种基于奖励模型的推理时扩展算法,用于提升PDE基础模型在分布外情况下的预测准确性,减少对训练样本和模型规模的依赖。
推理扩展是否能提升推理的可靠性?对多模型自一致性权衡的分析
机构 * Adobe Inc(Adobe公司)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究探讨推理扩展对推理可靠性的影响,发现不同模型表现各异,自一致性并非普遍有效,需根据具体模型进行测试。
Comments 24 pages, 3 figures, 9 tables
DiVA: 基于代理-判别验证器的细粒度事实性验证
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Institute of Science Tokyo(东京科学研究所)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL
AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。
面向开放世界设置的零样本息肉检测自适应检测-验证框架
机构 * College of Computer Science, Sichuan University(四川大学计算机学院) ; Columbia University(哥伦比亚大学) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Apon AI and Brain-Computer Engineering Research Institute(Apon人工智能与脑机工程研究院) ; Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) ; Faculty of Applied Science and Engineering, University of Toronto(多伦多大学应用科学与工程学院) ; Faculty of Computer Science and Information Technology, University of Malaya(马来亚大学计算机科学与信息技术学院) ; Zhaolong Technology(智龙科技) ; Purdue University(普渡大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL
AI总结 本文提出AdaptiveDetector,通过自适应阈值调整和成本敏感强化学习,实现开放世界中零样本息肉检测,提升召回率并减少假阴性。
QwenLong-L1.5: 长上下文推理与内存管理的训练配方
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 QwenLong-L1.5通过长上下文数据合成、稳定强化学习和内存增强架构,提升长上下文推理能力及超长任务处理性能。
在测试时间计算的极限:用于更好推理的顺序奖励过滤
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG
AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。
Comments 45 pages, 6 figures, 3 tables
基于光子贝叶斯机器的不确定性推理
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。
为大语言模型扩展推理时的计算艺术
机构 * Microsoft Research(微软研究院) ; Indian Institute of Technology Delhi(印度德里理工学院)
专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.CL
AI总结 本文研究了大语言模型推理时计算扩展策略的优化,发现不同模型类型和问题难度对性能有显著影响,并提出了基于计算预算的选择策略。
像人类一样适应:具有测试时推理的元认知代理
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Oxford(牛津大学) ; Tsinghua University(清华大学) ; University of Liverpool(利物浦大学) ; University College London(伦敦大学学院)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出元认知测试时推理框架,通过元认知自我更新实现模型在测试时的高效适应,实验表明其在Atari游戏中表现出优于基线的适应能力。