Proteo-R1: Reasoning Foundation Models for De Novo Protein Design
Proteo-R1:用于从头蛋白质设计的推理基础模型
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
作者
Natural Language Processing
Proteo-R1:用于从头蛋白质设计的推理基础模型
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
多玩家纳什偏好优化
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所智能系统研究中心) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。
Journal ref ICLR 2026 Oral
DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱
机构 * NVIDIA Research(NVIDIA研究院)
AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。
多智能体系统中的潜在协作
机构 * University of Washington(华盛顿大学)
AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。
Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS
基于评估的科学发现扩展
机构 * Wizard Intelligence Learning Lab, Stanford University(智能巫师学习实验室,斯坦福大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出SimpleTES框架,通过并行探索、反馈驱动精炼和局部选择,提升评估驱动的发现循环效率,解决科学发现扩展问题,展示在21个科学问题上超越基线模型的性能。
太阳能开放2技术报告
AI总结 本文介绍为长期代理任务构建的太阳能开放2语言模型。通过混合注意力堆栈等技术扩大规模,利用更强起点和高价值数据实现高效训练,经多教师策略蒸馏构建代理技能,在多项基准测试中表现出色,展示了其在语言模型领域的优势。
用于有效规划和工具使用的流内智能体系统优化
机构 * Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯农工大学) ; UC San Diego(圣地亚哥大学) ; Lambda Website(Lambda网站)
AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。
Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/
棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力
机构 * NVIDIA Research(NVIDIA研究部) ; University of Washington(华盛顿大学) ; University of Southern California(南加州大学)
AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。
通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型
AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。
Comments ICML 2026 Poster
MoReBench:评估语言模型中的程序性和多元道德推理,超越结果
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; Scale AI ; Harvard University(哈佛大学) ; University of Michigan(密歇根大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Center for AI Safety(人工智能安全中心) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; University of Oxford(牛津大学)
AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。
Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)