Proteo-R1: Reasoning Foundation Models for De Novo Protein Design
Proteo-R1:用于从头蛋白质设计的推理基础模型
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
作者
Natural Language Processing
Proteo-R1:用于从头蛋白质设计的推理基础模型
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
多玩家纳什偏好优化
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所智能系统研究中心) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。
Journal ref ICLR 2026 Oral
DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱
机构 * NVIDIA Research(NVIDIA研究院)
AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。
多智能体系统中的潜在协作
机构 * University of Washington(华盛顿大学)
AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。
Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS
基于评估的科学发现扩展
机构 * Wizard Intelligence Learning Lab, Stanford University(智能巫师学习实验室,斯坦福大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出SimpleTES框架,通过并行探索、反馈驱动精炼和局部选择,提升评估驱动的发现循环效率,解决科学发现扩展问题,展示在21个科学问题上超越基线模型的性能。
太阳能开放2技术报告
AI总结 本文介绍为长期代理任务构建的太阳能开放2语言模型。通过混合注意力堆栈等技术扩大规模,利用更强起点和高价值数据实现高效训练,经多教师策略蒸馏构建代理技能,在多项基准测试中表现出色,展示了其在语言模型领域的优势。
用于有效规划和工具使用的流内智能体系统优化
机构 * Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯农工大学) ; UC San Diego(圣地亚哥大学) ; Lambda Website(Lambda网站)
AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。
Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/
棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力
机构 * NVIDIA Research(NVIDIA研究部) ; University of Washington(华盛顿大学) ; University of Southern California(南加州大学)
AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。
通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型
AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。
Comments ICML 2026 Poster
解读3D分子表面指纹以实现准确的表位预测
机构 * Stanford University(斯坦福大学) ; The University of Tokyo(东京大学) ; Amazon AWS(亚马逊AWS)
AI总结 提出SurfBind框架,直接基于分子表面表示,通过Transformer架构、补丁级表面建模、结合物感知交叉注意力和分层粗到细预测范式,实现表位预测,在SAbDab和DB5.5基准上达到最先进性能。
Journal ref KDD 2026 AI4Science
近端策略优化区域:教师存在于提示中,而非梯度中
机构 * NVIDIA(英伟达)
AI总结 提出ZPPO方法,通过将教师知识注入提示而非策略梯度,解决小模型知识蒸馏中教师梯度主导和强化学习策略漂移问题,在多种规模模型上超越现有方法。
Comments Project page: https://byungkwanlee.github.io/ZPPO-page/
ProCUA-SFT 技术报告
机构 * NVIDIA(英伟达) ; University of Washington(华盛顿大学) ; Allen Institute for AI(艾伦人工智能研究所)
AI总结 提出 ProCUA-SFT 数据集,通过自动化管道从 2484 个应用组合的合成轨迹中蒸馏出 310 万步级 SFT 样本,微调 UI-TARS 7B 在 OSWorld 上达到 45.0% 的成功率,比基线提升 18.7 个百分点。
Comments 15 pages, 5 figures
Spokes: 优化多样化预训练数据选择
机构 * DSO National Laboratories(DSO国家实验室) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 提出基于G-Vendi分数的概率多样化框架,通过指数梯度下降直接优化数据多样性,在FineWeb和DCLM上提升下游性能1.5和1.4个点。
Comments 9 pages, 4 figures
Nemotron 3 Ultra: 开放、高效的混合专家Mamba-Transformer模型用于智能体推理
机构 * NVIDIA(英伟达)
AI总结 提出550B总参数量、55B激活参数的混合专家Mamba-Attention语言模型Nemotron 3 Ultra,通过20T tokens预训练、1M上下文扩展及后训练,在推理吞吐量提升约6倍的同时保持与顶尖模型相当的精度。
MoReBench:评估语言模型中的程序性和多元道德推理,超越结果
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; Scale AI ; Harvard University(哈佛大学) ; University of Michigan(密歇根大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Center for AI Safety(人工智能安全中心) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; University of Oxford(牛津大学)
AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。
Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)
模块化AI系统中的参与扩展
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 提出参与扩展范式,通过多方贡献小模型构建模块化AI系统,在15项任务上比单体大语言模型提升高达15.4%,并展现涌现能力。
SurfDesign:基于分子表面的高效蛋白质设计
机构 * Stanford University(斯坦福大学) ; Wuhan University of Science and Technology(武汉科技大学) ; Yale University(耶鲁大学) ; School of Medicine, Yale University(耶鲁大学医学院) ; Hunan University(湖南大学) ; Yuelushan Laboratory(岳麓实验室) ; Kumo.AI ; Toyota Technological Institute at Chicago(芝加哥技术研究所)
AI总结 提出SurfDesign框架,将分子表面建模为连续几何流形并整合预训练蛋白质语言模型,通过表面等变消息传递捕捉几何特征,在从头设计结合子和酶设计基准上优于现有方法。
Journal ref KDD 2026 AI4Science
多模态用户界面/用户体验设计理解的基准测试:MLLMs能否捕捉界面如何引导用户行为?
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学) ; NC AI
AI总结 本文提出WiserUI-Bench基准测试,用于评估多模态UI/UX设计对用户行为的影响,通过300对真实世界UI图像对和专家解读,发现MLLMs在理解UI/UX设计行为影响方面存在局限。
Comments ACL 2026 Main. Our code and dataset: https://github.com/jeochris/wiserui-bench
RoboWits:机器人创造性问题解决中的意外挑战
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。
Comments The first two authors contributed equally
立场:具有可验证奖励的强化学习的隐藏成本与测量缺口
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Waseda University(早稻田大学) ; Georgia Tech(佐治亚理工学院) ; Northwestern University(西北大学) ; UCLA(加州大学洛杉矶分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Yale University(耶鲁大学) ; University of Waterloo(滑铁卢大学) ; Independent Researcher(独立研究者) ; CUHK(香港中文大学) ; UT Southwestern Medical Center(西南医学中心) ; National University of Singapore(新加坡国立大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Amazon AWS AI(亚马逊AWS人工智能)
AI总结 本文指出,具有可验证奖励的强化学习(RLVR)在提升大语言模型性能时,常因预算不匹配、尝试膨胀和基准数据污染等混淆因素导致收益被高估,并提出了预算匹配饱和曲线、校准跟踪、法官鲁棒性测试和污染筛查等最低标准。
ESI-Bench: 迈向闭环感知-动作的具身空间智能
机构 * Stanford University(斯坦福大学) ; UCLA(加州大学洛杉矶分校) ; Northwestern University(西北大学)
AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。
Comments https://esi-bench.github.io/
从试错中学习:具身大语言模型的反思式测试时规划
机构 * Stanford University(斯坦福大学) ; Northwestern University(西北大学)
AI总结 提出反思式测试时规划方法,通过行动中反思和行动后反思两种模式,结合回溯性反思,使具身智能体在测试时进行自我纠正和经验积累,显著提升长程任务性能。
Gated DeltaNet-2:解耦擦除与写入的线性注意力
机构 * NVIDIA
AI总结 本文提出Gated DeltaNet-2,通过引入通道级擦除门和写入门,解耦了线性注意力中擦除与写入的控制,从而在语言模型、常识推理和检索任务中取得了最佳性能,特别是在长上下文检索任务中表现突出。
Comments Gated DeltaNet-2 technical report; code at https://github.com/NVlabs/GatedDeltaNet-2
反思式X训练:反馈条件化提升跨所有LLM训练阶段的扩展性
机构 * NVIDIA ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; UC San Diego(南加州大学)
AI总结 本文提出反思式训练(IXT),通过利用后续阶段的动态来改进早期阶段,从而提高LLM训练的扩展效率,实验表明该方法在计算效率和性能上均有显著提升。
如何指导你的机器人:密集语言标注助力机器人策略学习
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; NVIDIA
AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。
ProfBench:需要专业知识回答和评判的多领域评分标准
机构 * NVIDIA
AI总结 ProfBench通过7000多个由专业领域专家评估的响应-评分对,评估大语言模型在处理专业文档、信息整合和生成综合报告方面的能力,揭示了即使顶级模型在专业任务上也面临挑战。
Comments Published at ICLR 2026, 30 pages
NoiseRater: 用于扩散模型训练的元学习噪声估值
机构 * Stanford University(斯坦福大学) ; UNSW(新南威尔士大学) ; UCL(伦敦大学学院) ; The University of Chicago(芝加哥大学) ; CUHK(香港中文大学) ; Nanjing University(南京大学) ; Brown University(布朗大学) ; Yale University(耶鲁大学) ; University of Notre Dame(Notre Dame 大学) ; University of Waterloo(滑铁卢大学) ; UCB(加州大学伯克利分校) ; Georgia Technology(佐治亚理工学院) ; Amazon(亚马逊)
AI总结 本文提出NoiseRater,通过元学习实现实例级噪声估值,提升扩散模型训练效率和生成质量。
超越语义相似性:通过直接语料交互重新思考代理搜索的检索
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Waterloo(滑铁卢大学) ; UC San Diego(圣地亚哥大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Verdent AI ; Lambda
AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。
基于简单n-gram覆盖的成员推断的惊人效果
机构 * University of Southern California(南加州大学) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 本文提出基于文本输出的成员推断攻击,通过n-gram重叠度评估模型生成文本与真实后缀的相似性,验证了其在黑盒模型上的有效性,并发现攻击成功率随计算预算增加而提升。
Comments CoLM 2025. v2: update citation
PoseX:人工智能击败物理方法在蛋白质-配体交叉对接
机构 * Microcyto ; Purdue University(普渡大学) ; State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) ; Anew Therapeutics ; Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Peking University(北京大学) ; Virginia Tech(弗吉尼亚理工大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 PoseX设计了一个开放源代码的基准测试,评估自我对接和交叉对接,通过23种方法和718/1312个数据集,发现AI方法在对接成功率上优于物理方法,并通过放松方法和结合口袋信息提升性能。