AI Safety: Not Optional, Not Later
AI 安全:并非可选,也非推迟
AI总结 针对多层面AI安全失效问题,提出结合模型级监督与系统级控制的安全设计保障架构,并辅以治理机制,以强化问责与证据互操作。
Comments To appear in the January 2027 issue of IEEE Software, as an invited article for the new AI and Software Engineering column
作者
Machine Learning
AI 安全:并非可选,也非推迟
AI总结 针对多层面AI安全失效问题,提出结合模型级监督与系统级控制的安全设计保障架构,并辅以治理机制,以强化问责与证据互操作。
Comments To appear in the January 2027 issue of IEEE Software, as an invited article for the new AI and Software Engineering column
如何验证概率断言的一致性
机构 * EPFL(洛桑联邦理工学院) ; Université de Montréal(蒙特利尔大学) ; Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所) ; LawZero ; MIT(麻省理工学院) ; UC Berkeley(加州大学伯克利分校)
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
物理人工智能治理:跨越生命周期从理论到实践
机构 * Case Western Reserve University(凯斯西储大学) ; Shanghai Jiao Tong University(上海交通大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Columbia University(哥伦比亚大学) ; University of California, Riverside(加州大学河滨分校) ; Nanyang Technological University(南洋理工大学) ; New York University(纽约大学) ; Salesforce(Salesforce公司) ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。
用于摊销采样的动作抽象
机构 * Mila - Québec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; University of Edinburgh(爱丁堡大学) ; Recursion(Recursion公司) ; CIFAR(加拿大高级研究院)
AI总结 本研究针对摊销序贯采样中长轨迹带来的探索与泛化难题,提出将动作抽象融入策略优化的方法,提升了高奖励对象发现的样本效率,实现了分层规划的首次演示。
Comments ICLR 2025. Code available at https://github.com/GFNOrg/Chunk-GFN
用于摊销采样器的自适应教师
AI总结 该研究针对摊销采样器的高效探索挑战,提出用自适应训练分布(教师)指导采样器(学生)训练,经多任务验证可提升样本效率与模式覆盖范围。
Comments ICLR 2025, 27 pages, 12 figures
针对大语言模型学习多样化攻击以用于鲁棒红队测试与安全调优
机构 * KAIST(韩国科学技术院) ; Mila – Québec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; National University of Singapore(新加坡国立大学) ; University of Edinburgh(爱丁堡大学) ; CIFAR(加拿大高级研究所)
AI总结 该研究针对现有红队测试方法存在的模式崩塌或攻击有效性不足问题,提出GFlowNet微调加二次平滑的方法生成多样化攻击提示,其攻击对各类LLM有效且可迁移,用该攻击提示调优的模型对其他攻击方法具有鲁棒性。
Comments ICLR 2025; code: https://github.com/GFNOrg/red-teaming
PhyloGFN:基于生成流网络的系统发育推断
机构 * McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; Mila(米拉研究所)
AI总结 本文提出PhyloGFN,将生成流网络(GFlowNets)框架用于系统发育推断,在真实基准数据集上产生多样高质量进化假设,边际似然估计具竞争力,贴合目标分布优于变分推断方法。
Comments ICLR 2024
摊销大型语言模型中难以处理的推理
机构 * Mila – Quebec AI Institute, Université de Montréal(米拉-魁北克人工智能研究所,蒙特利尔大学) ; University of Oxford(牛津大学)
AI总结 该研究针对大型语言模型的难以处理后验分布采样问题,提出用生成流网络(GFlowNets)的摊销贝叶斯推理方法微调LLM,可替代最大似然训练,还能高效适配需多步推理和工具使用的任务。
Comments ICLR 2024; 23 pages; code: https://github.com/GFNOrg/gfn-lm-tuning
随机环境及两人零和博弈中的期望流网络
机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学)
AI总结 本文提出期望流网络(EFlowNets)扩展GFlowNets至随机环境,又提出对抗流网络(AFlowNets)用于两人零和博弈,前者在蛋白质设计任务中表现更优,后者在四子棋中找到超80%最优走法且优于AlphaZero。
Comments ICLR 2024; code: https://github.com/GFNOrg/AdversarialFlowNetworks
Delta-AI:稀疏图模型中摊销推断的局部目标
机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学)
AI总结 研究人员提出Δ-AI算法,利用PGM稀疏性实现局部信用分配,基于GFlowNets风格损失实现离策略训练且加速,在合成PGM和稀疏因子结构隐变量模型上验证其有效性。
Comments ICLR 2024; 19 pages, code: https://github.com/GFNOrg/Delta-AI/
GFlowNets与变分推断
机构 * Mila(米拉计算研究所) ; Université de Montréal(蒙特利尔大学) ; Google Research(谷歌研究院) ; CIFAR(加拿大高级研究所)
AI总结 本文建立变分推断与生成流网络的联系,证明特定情形下VI等价于GFlowNets特例,指出GFlowNets更适合离策略训练且利于捕获多模态分布多样性。
Comments ICLR 2023 final version; code: https://github.com/GFNOrg/GFN_vs_HVI
将SAM提升至新高度:利用高程数据从无人机影像中进行树冠分割
机构 * Mila – Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; Rubisco AI(Rubisco人工智能)
AI总结 本研究针对无人机影像树冠实例分割任务,对比不同SAM方法,提出整合DSM的BALSAM模型,发现SAM端到端调优与DSM整合具应用潜力。
Journal ref Advances in Neural Information Processing Systems 38, 2025
扩散采样器的改进离策略训练
机构 * Mila, Université de Montréal(米拉-蒙特利尔大学) ; Jagiellonian University(雅盖隆大学) ; KAIST(韩国科学技术院) ; Ciela Institute(塞拉研究所) ; Dreamfold(德里姆福尔德公司) ; CIFAR(加拿大高级研究院) ; University of Edinburgh(爱丁堡大学)
AI总结 该研究针对扩散模型的离策略训练问题,提出结合重放缓冲区的目标空间局部搜索探索策略,提升了样本质量,同时阐明了现有算法的相对优势并质疑了过往部分结论,相关代码已公开。
Comments NeurIPS 2024; code: https://github.com/GFNOrg/gfn-diffusion
在视觉、语言与控制任务的扩散模型中分摊难解推理
AI总结 本文针对扩散模型用作下游任务先验时的难解后验推理问题,提出相对轨迹平衡方法,在视觉、语言、多模态及连续控制等任务上取得良好效果
Comments NeurIPS 2024; code: https://github.com/GFNOrg/diffusion-finetuning
让流来揭示:用GFlowNets解决图组合优化问题
AI总结 本文针对组合优化问题设计马尔可夫决策过程,训练条件GFlowNets采样解空间,经实验证明其能高效找到高质量解,相关实现已开源。
Comments NeurIPS 2023 (spotlight); code: https://github.com/zdhNarsil/GFlowNet-CombOpt
基于单个生成流网络的图结构与参数的联合贝叶斯推断
AI总结 本文提出名为JSP-GFN的方法,用单个生成流网络联合推断贝叶斯网络的图结构与参数,该方法在模拟和真实数据上的表现优于现有方法,可准确近似联合后验分布。
Comments NeurIPS 2023
轨迹平衡:改进GFlowNets中的信用分配
AI总结 针对GFlowNets现有学习目标在长动作序列中信用传播效率低的问题,提出轨迹平衡新目标,经理论证明其全局极小值可实现目标分布精确采样,且在多领域实验中展现出收敛性、样本多样性及鲁棒性优势。
Comments NeurIPS 2022; see footnotes for code
估计器的喜剧:关于在LLM训练中的KL正则化
机构 * McGill University(麦吉尔大学) ; LawZero(法零) ; LLNL(劳伦斯利弗莫尔国家实验室) ; University of Edinburgh(爱丁堡大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; CIFAR Fellow
AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。
2026年新加坡全球AI安全研究优先事项共识
AI总结 该研究基于第二届AI安全国际科学交流成果,发布2026年新加坡全球AI安全研究优先事项共识,聚焦技术AI安全、社会韧性及自主AI智能体风险管理,为全球AI安全研究提供方向。
Comments Available at https://aisafetypriorities.org/
基于熵强化学习的贝叶斯符号回归
AI总结 本研究提出ERRLESS方法,将最大熵强化学习与贝叶斯视角结合用于符号回归,在Feynman基准上表现具有竞争力,生成的表达式简短可解释,且后验预测均值的R²优于SMC基线。
Comments UAI 2026. Code available at https://github.com/jaggbow/ERRLESS
开放权重AI模型风险管理中的开放技术问题
AI总结 本文指出开放权重AI模型风险管理存在16项涉及多环节的技术挑战,强调相关研究需兼顾开放性,以实现其益处并减轻危害。
Comments Published in Transactions on Machine Learning Research (03/2026) Reviewed on OpenReview: https: // openreview. net/ forum? id= 8QyGLnFkzc
无兴趣AI预测器中的诚实安全性
机构 * LawZero ; Université de Montréal(蒙特利尔大学) ; Mila ; University of California Berkeley(加州大学伯克利分校) ; McGill University(麦吉尔大学) ; Arb Research ; Center for Theoretical Study Charles University in Prague(布拉格查理大学理论研究中心) ; University of Oxford(牛津大学) ; Sapien Institute(Sapien研究所)
AI总结 提出一种形式化安全论证,通过数据表示和训练过程确保预测器诚实预测而不成为追求目标的智能体,并证明危险预测器出现的概率可控。
通过循环语言模型扩展潜在推理
AI总结 提出Ouro系列循环语言模型,通过在潜在空间迭代计算、熵正则化深度分配和扩展至7.7T令牌,实现优于更大模型的推理性能,并展示其知识操控能力。
自回归玻尔兹曼生成器
AI总结 提出自回归玻尔兹曼生成器(ArBG),通过自回归建模替代基于流的模型,克服拓扑约束并提升可扩展性,在分子系统采样中显著优于现有方法,并在8残基系统上将零样本能量误差降低60%以上。
Comments ICML 2026 (Spotlight)
CIAware-Bench: 评估前沿大语言模型的控制干预感知能力
机构 * MATS ; Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Astra Fellowship ; ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center ; LawZero ; Google DeepMind(谷歌DeepMind)
AI总结 提出CIAware-Bench基准,通过四个任务域测试模型能否区分自身轨迹与被控制干预修改的轨迹,发现前沿模型在默认设置下感知能力低至中等,且因任务和模型对而异。
通过具有丰富化学先验的软约束GFlowNets生成可合成分子
机构 * University of Toronto(多伦多大学) ; DeepMind(深度思维) ; University of Montreal(蒙特利尔大学)
AI总结 提出S3-GFN方法,通过软正则化序列GFlowNet,利用大规模SMILES语料库的化学先验,生成高奖励且可合成的分子,实验表明可合成率≥95%。
当良性输入导致严重危害:引发计算机使用代理的不安全意外行为
机构 * DeepMind, London, UK(深度Mind,伦敦,英国) ; Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) ; UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)
AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。
Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/
沉默的思维:通过潜在推理建模全双工语音对话模型中的内部认知
机构 * DeepMind(深度Mind)
AI总结 本文提出了一种名为FLAIR的全双工语音对话模型,通过潜在推理同时进行语音感知和内部思考,以提高对话质量,该方法在多个语音基准测试中取得了竞争性的结果。
Comments Accepted by ICML 2026
非凸优化中的平衡自适应学习率
AI总结 本文提出ESGD算法,通过平衡预条件器改进非凸优化中的自适应学习率,实验显示其收敛速度优于RMSProp。
重新审视深度网络的自然梯度
AI总结 本文重新评估了自然梯度算法在深度模型学习中的应用,揭示了其与Hessian-Free、Krylov子空间下降和TONGA方法的联系,并提出了利用无标签数据改进泛化误差、评估对训练集顺序的鲁棒性以及结合二阶信息的扩展算法。