Recursive Agentic Reasoning
递归智能体推理
机构 * Google(谷歌) ; University of Maryland(马里兰大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文将测试时推理方法统一为递归算子,通过共享框架对比发现BRANCH算子在多场景下提升准确率,且配对评估是测试时计算评估的标准协议。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
递归智能体推理
机构 * Google(谷歌) ; University of Maryland(马里兰大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文将测试时推理方法统一为递归算子,通过共享框架对比发现BRANCH算子在多场景下提升准确率,且配对评估是测试时计算评估的标准协议。
选择性再生解码:推理时推理的轨迹级干预
机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) ; Netflix(网飞公司) ; Amazon Science(亚马逊科学研究院) ; Meta
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出选择性再生解码(SRD),通过对候选轨迹做片段级干预,在低计算量下以更少生成代币达到Best-of-N准确率,提升样本效率,开辟了推理时推理的准确率-计算权衡新领域。
Comments Large Language Model, Test-Time Decoding Technique, Reasoning, 20 pages; Submitted to ARR
何时请求帮助:分层大语言模型智能体中的贝叶斯自我升级
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM智能体提出贝叶斯自我升级策略,将生成中委派建模为贝叶斯最优停止问题,经模拟和真实代码级联验证,其升级机制在同等成本下优于事后路由,能力信念区分度随生成提升。
Comments 21 pages, 5 figures. Code and data: this https URL (https://github.com/nadeem-shaikh/llm-self-escalation). Associated record: this https URL (https://doi.org/10.5281/zenodo.21330787)
PinSieve:面向企业内容质量分类的生产级选择性VLM服务及受控内存飞轮
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG
AI总结 本文提出PinSieve,即面向企业内容质量分类的选择性VLM服务智能体,结合受控内存飞轮维护机制,提升审核效率、降低成本并改善信号交付,具有任务可迁移性。
Comments Accepted at the KDD 2026 workshop "Enterprise AI Agents: From Prototypes to Production."
编辑1个神经元能修复LLM中的重复循环吗?
机构 * Edgerunner AI
专题命中 测试时计算 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 本文发现Gemma 4模型在长事实列举任务中高达95%的概率陷入重复循环,通过逐层消融和逐神经元归因定位到少量MLP神经元,并用静态权重编辑(小至单个神经元符号反转)消除循环,但无法解决因知识缺失导致的“末日循环”。
SaliMory: 为对话代理编排认知记忆
机构 * Meta Reality Labs(Meta现实实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。
大型语言模型智能体的工具创建与使用联合优化
机构 * Appier AI Research(沛星人工智能研究院) ; National Taiwan University(台湾大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出SMITH框架联合训练工具创建与使用,4B Qwen3经训练在多任务上取得最优表现,其编写的工具还提升了其他模型的推理性能
在推理阶段通过读出反馈引导循环推理器
机构 * Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 该研究提出测试时干预方法RoFB,将中间预测转为耦合力注入循环模型隐动态,在数独、迷宫任务的三类循环模型上提升性能,且计算成本相当或更低。
EviGraph:面向信息检索智能体的可验证证据构建
专题命中 测试时计算 :verifier(abstract)
AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。