PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Kyoto University(京都大学) ; Tsinghua University(清华大学) ; East China Normal University(华东师范大学) ; Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) ; Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) ; GenBio AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。
Comments Accepted by Npj Digital Medicine
DemoPSD: 分歧调节的策略自蒸馏
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。
MUGEN:评估和改进大型音频-语言模型的多音频理解
机构 * National Taiwan University(国立台湾大学)
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 MUGEN通过评估多音频理解能力,揭示了大型音频-语言模型在多音频输入下的性能瓶颈,并通过排列自一致性策略提升了模型的预测准确性。
Comments Interspeech 2026. Project page: https://github.com/danielqwer/MUGEN
HeaPA:用于大语言模型强化学习的难度感知堆采样和策略内查询增强
机构 * Stores Foundational AI, Amazon Inc.(亚马逊公司基础人工智能部) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 研究大语言模型强化学习中提示采样问题,提出HeaPA方法,通过难度感知堆采样和策略内查询增强,维持动态提示池,跟踪能力前沿,在多数据集和基准测试中提升准确率,减少计算量,尤其在中大型模型规模下效果显著。
Comments COLM 2026
基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成
机构 * Vanderbilt University(范德比大学) ; Vanderbilt University Medical Center(范德比大学医学中心) ; Lirio ; Virginia Tech(弗吉尼亚理工大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。
Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list
不确定时验证:超越黑盒幻觉检测中的自一致性
机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。
PCBSchemaGen: 奖励引导的LLM代码合成用于印刷电路板(PCB)原理图设计及结构化验证
机构 * Semiconductor Power Electronics Center (SPEC)(半导体功率电子中心) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Arizona State University(亚利桑那州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出PCBSchemaGen框架,通过结构化验证器引导冻结的LLM生成可修复的PCB原理图,在无单元测试的领域实现高准确率。
DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块
机构 * City University of Hong Kong(香港城市大学) ; The Institute of Statistical Mathematics(统计数学研究所) ; University of Sydney(悉尼大学) ; Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。
Position: 模块化记忆是持续学习智能体的关键
机构 * University of Bremen(不莱梅大学) ; Seoul National University(首尔国立大学) ; Computer Vision Center Barcelona(巴塞罗那计算机视觉中心) ; University of Florence(佛罗伦萨大学) ; Microsoft Research(微软研究院) ; HEC Montreal, Mila--Quebec AI Institute, Canada CIFAR AI Chair(蒙特利尔HEC学院、魁北克人工智能研究所、加拿大CIFAR人工智能 chair) ; Bielefeld University(比勒海姆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Rochester(罗切斯特大学) ; University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) ; Nankai University(南开大学) ; LUISS University(卢西亚诺大学) ; Stony Brook University(石溪大学) ; University of Tübingen(图宾根大学) ; University of Trento, FBK(特伦托大学,FBK) ; Tsinghua University(清华大学) ; University of Groningen(Groningen大学)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过模块化记忆结合权重内学习与上下文学习,解决持续学习中的灾难性遗忘问题,实现大规模持续适应。
Comments ICML 2026 Position Track Spotlight. This work stems from discussions held at the Dagstuhl seminar on Continual Learning in the Era of Foundation Models (October 2025)
模型知晓,解码器发现:未来价值引导的粒子力量采样
机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出APPS算法,通过块状粒子方法高效定位LLM的多步解,提升推理准确率与运行效率,减少对训练数据的依赖。
一个令牌就能欺骗LLM裁判
机构 * Princeton University(普林斯顿大学) ; University of Virginia(弗吉尼亚大学) ; Tencent AI Lab(腾讯人工智能实验室) ; Rutgers University(罗格斯大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。
基于去噪反馈的强化学习
机构 * Fudan University(复旦大学) ; Ant Group(蚂蚁集团) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。
一种动态自演化抽取系统
机构 * Megagon Labs(Megagon实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出DySECT系统,通过LLM抽取三元组构建知识库,结合概率知识和图推理丰富知识,再反馈优化抽取器,形成闭环持续提升。
你的模型多样性,而非方法,决定推理策略
机构 * UIUC(伊利诺伊大学香槟分校) ; Capital One
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI
AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。
Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning
CGES:面向高效准确自一致性的置信引导早停方法
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL
AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。
Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。
下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) ; Southeast University(东南大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。
DominoTree:使用Domino进行条件树结构草稿的推测性解码
机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程学系)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 研究提出DominoTree,一种无需训练的最佳优先草稿树,利用Domino的条件非因式分解校正评分。在Qwen3-4B等基准测试中,相比自回归解码加速显著,接受长度高,用GPU原生构建器保持低成本,在吞吐量上优于多种方法。
Comments 32 pages, 2 figures, 16 tables. Code: https://github.com/slin-zhq/Domino-Tree
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
自我进化临床系统之路:将医疗智能体从辅助扩展到自主
机构 * Hunan University(湖南大学) ; ByteDance(字节跳动) ; Duke University(杜克大学) ; Westlake University(西湖大学) ; The University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Macau(澳门大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI
AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。
Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents
为生产大语言模型代理选择和组合运行时架构模式的方法
机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) ; Stanford School of Engineering(斯坦福大学工程学院)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。
Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns
双温度的故事:从扩散语言模型中实现简单、高效且多样的采样
机构 * Massachusetts Institute of Technology(麻省理工学院) ; UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Irvine(加州大学尔湾分校)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG
AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。
Comments V2: accepted as a full conference paper at COLM
在LLM推理扩展中采样多样性的影响
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; The Chinese University of Hong Kong(香港中文大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; NEC Laboratories America(NEC美国实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。
Comments 31 pages
TokTier:面向智能体大语言模型服务的精确有状态分词方案
机构 * Arizona State University(亚利桑那州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。
Comments 26 pages. Code: https://github.com/asu-idi/toktier
临床输入引导前沿AI模型做出准确和有害的决策
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。
Role-Agent: 通过双角色演化引导LLM智能体
机构 * University of Science and Technology of China(中国科学技术大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。
Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress
双维度一致性:在适应性推理时间扩展中平衡预算与质量
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出双维度一致性框架,通过结合置信度加权贝叶斯协议与趋势感知分层剪枝,平衡推理预算与质量,减少10倍以上token消耗并保持高精度。
解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM
机构 * School of Cyber Science and Technology(网络安全科学与技术学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; University of Luxembourg(卢森堡大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。