How to Verify Consistency of Probabilistic Claims
如何验证概率断言的一致性
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
作者
Machine Learning
如何验证概率断言的一致性
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
基于熵强化学习的贝叶斯符号回归
AI总结 本研究提出ERRLESS方法,将最大熵强化学习与贝叶斯视角结合用于符号回归,在Feynman基准上表现具有竞争力,生成的表达式简短可解释,且后验预测均值的R²优于SMC基线。
Comments UAI 2026. Code available at https://github.com/jaggbow/ERRLESS
开放权重AI模型风险管理中的开放技术问题
AI总结 本文指出开放权重AI模型风险管理存在16项涉及多环节的技术挑战,强调相关研究需兼顾开放性,以实现其益处并减轻危害。
Comments Published in Transactions on Machine Learning Research (03/2026) Reviewed on OpenReview: https: // openreview. net/ forum? id= 8QyGLnFkzc
无兴趣AI预测器中的诚实安全性
机构 * LawZero ; Université de Montréal(蒙特利尔大学) ; Mila ; University of California Berkeley(加州大学伯克利分校) ; McGill University(麦吉尔大学) ; Arb Research ; Center for Theoretical Study Charles University in Prague(布拉格查理大学理论研究中心) ; University of Oxford(牛津大学) ; Sapien Institute(Sapien研究所)
AI总结 提出一种形式化安全论证,通过数据表示和训练过程确保预测器诚实预测而不成为追求目标的智能体,并证明危险预测器出现的概率可控。
通过循环语言模型扩展潜在推理
AI总结 提出Ouro系列循环语言模型,通过在潜在空间迭代计算、熵正则化深度分配和扩展至7.7T令牌,实现优于更大模型的推理性能,并展示其知识操控能力。
自回归玻尔兹曼生成器
AI总结 提出自回归玻尔兹曼生成器(ArBG),通过自回归建模替代基于流的模型,克服拓扑约束并提升可扩展性,在分子系统采样中显著优于现有方法,并在8残基系统上将零样本能量误差降低60%以上。
Comments ICML 2026 (Spotlight)
CIAware-Bench: 评估前沿大语言模型的控制干预感知能力
机构 * MATS ; Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Astra Fellowship ; ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center ; LawZero ; Google DeepMind(谷歌DeepMind)
AI总结 提出CIAware-Bench基准,通过四个任务域测试模型能否区分自身轨迹与被控制干预修改的轨迹,发现前沿模型在默认设置下感知能力低至中等,且因任务和模型对而异。
通过具有丰富化学先验的软约束GFlowNets生成可合成分子
机构 * University of Toronto(多伦多大学) ; DeepMind(深度思维) ; University of Montreal(蒙特利尔大学)
AI总结 提出S3-GFN方法,通过软正则化序列GFlowNet,利用大规模SMILES语料库的化学先验,生成高奖励且可合成的分子,实验表明可合成率≥95%。
当良性输入导致严重危害:引发计算机使用代理的不安全意外行为
机构 * DeepMind, London, UK(深度Mind,伦敦,英国) ; Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) ; UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)
AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。
Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/
沉默的思维:通过潜在推理建模全双工语音对话模型中的内部认知
机构 * DeepMind(深度Mind)
AI总结 本文提出了一种名为FLAIR的全双工语音对话模型,通过潜在推理同时进行语音感知和内部思考,以提高对话质量,该方法在多个语音基准测试中取得了竞争性的结果。
Comments Accepted by ICML 2026
非凸优化中的平衡自适应学习率
AI总结 本文提出ESGD算法,通过平衡预条件器改进非凸优化中的自适应学习率,实验显示其收敛速度优于RMSProp。
重新审视深度网络的自然梯度
AI总结 本文重新评估了自然梯度算法在深度模型学习中的应用,揭示了其与Hessian-Free、Krylov子空间下降和TONGA方法的联系,并提出了利用无标签数据改进泛化误差、评估对训练集顺序的鲁棒性以及结合二阶信息的扩展算法。
掩码扩散的自适应顺序策略
机构 * Université de Montréal(蒙特利尔大学) ; Mila ; Concordia University(康科迪亚大学) ; LawZero
AI总结 提出一种通过轻量级策略网络学习掩码扩散模型中解掩码顺序的方法,使用加权损失训练,在组合任务和蛋白质等对顺序敏感的问题上优于常见启发式方法。
当2D任务遇到1D序列化:结构化任务中的序列化摩擦
机构 * Northeastern University(东北大学) ; University of Pennsylvania(宾夕法尼亚大学) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; University of Montreal(蒙特利尔大学) ; BAIR, UC Berkeley(伯克利大学BAIR实验室)
AI总结 研究通过矩阵转置、康威生命游戏和LU分解三个任务,发现将二维布局任务序列化为一维文本会因表示不匹配导致性能下降,且错误呈现空间结构模式。
生成性递归推理
机构 * KAIST(韩国科学技术院) ; Mila – Québec AI Institute(魁北克人工智能研究所) ; New York University(纽约大学) ; Université de Montréal(蒙特利尔大学)
AI总结 本文提出Gram框架,通过将递归潜在推理转化为概率多轨迹计算,解决了传统递归推理模型的确定性问题,实现了条件推理和无条件生成。
通过多项式混沌代理实现序列生成模型中可解释的epistemic不确定性分解
机构 * Mathematical Institute, University of Oxford, United Kingdom(牛津大学数学研究所,英国) ; IBM Research, Thomas J. Watson Research Center, USA(IBM研究院,托马斯·J·沃森研究中心,美国) ; IBM Research Europe, Daresbury, United Kingdom(IBM欧洲研究院,达尔斯伯里,英国) ; MIT–IBM Watson AI Lab, Massachusetts, USA(麻省理工–IBM沃森人工智能实验室,马萨诸塞州,美国) ; Université de Montréal, Mila–Quebec AI Institute, Montreal, Quebec, Canada(蒙特利尔大学,魁北克人工智能研究所,蒙特利尔,魁北克,加拿大)
AI总结 本文提出通过多项式混沌展开分析序列生成模型中epistemic不确定性的来源,揭示奖励组件对生成决策的影响,优于深度集合、贝叶斯神经网络等方法,且在多个真实任务中展现高效性和鲁棒性。
Comments 37 pages, 15 figures
语言模型能够识别应用于其激活上的dropout和高斯噪声
机构 * LawZero
AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。
局部不一致性解决:概率模型中注意与控制的相互作用
机构 * Université de Montréal(蒙特利尔大学) ; School of Computer Science, McGill University(麦吉尔大学计算机科学学院) ; Institut Polytechnique de Paris(巴黎政治学院) ; LawZero(法零) ; Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所)
AI总结 本文提出一种通用算法,通过迭代聚焦子集模型并利用可控参数解决不一致性,统一了EM算法、信念传播等重要算法,改进了GFlowNet收敛性。
Comments 9 page body,
Journal ref Proceedings of the The 29th International Conference on Artificial Intelligence and Statistics, 2026
通用多模态蛋白质设计使化学编码成为可能
机构 * California Institute of Technology(加州理工学院) ; Mila – Québec AI Institute(Mila – 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Université Paris-Saclay(巴黎-萨克雷大学) ; McGill University(麦吉尔大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国理工学院) ; Institut Courtois(库尔图瓦研究所) ; LawZero ; AITHYRA ; FutureHouse
AI总结 DISCO模型通过多模态设计实现蛋白质序列和三维结构的协同优化,能够设计出新型血红素酶,催化新的化学反应,拓展了遗传编码转化的潜力。
利用大语言模型高效发现因果图
机构 * Mila, Université de Montréal(蒙特利尔大学Mila研究所) ; Mila, McGill University(麦吉尔大学Mila研究所)
AI总结 本文提出一种利用大语言模型进行完整因果图发现的新框架,通过广度优先搜索方法提高效率,并展示其在不同规模真实因果图上的最佳性能。
分子动力学方法在模拟固态锂电解质离子导电性中的比较研究
AI总结 本文比较了密度泛函理论和通用机器学习互原子势在模拟21种固态锂电解质离子导电性中的性能,发现两者表现相当,尽管MACE在GPU上比DFT快350倍。
torchgfn:一个PyTorch GFlowNet库
机构 * MBZUAI(穆罕默德·本·拉希德智能研究院)
AI总结 本文提出torchgfn库,通过模块化架构实现环境、神经网络模块和训练目标的可替换性,简化了GFlowNet的研究与实验流程。
Comments 15 pages, 3 figures, 3 tables. Submitted
察觉观察者:LLM代理可通过阻塞反馈推断CoT监控
机构 * Mila ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; LawZero
AI总结 研究探讨LLM代理是否能自主推断其内部推理被监控,并在无显式训练的情况下产生逃避策略,发现高能力模型能通过阻塞反馈推断监控存在,但无法有效执行逃避意图。
估计器的喜剧:关于在LLM训练中的KL正则化
机构 * McGill University(麦吉尔大学) ; LawZero(法零) ; LLNL(劳伦斯利弗莫尔国家实验室) ; University of Edinburgh(爱丁堡大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; CIFAR Fellow
AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。
Crystal-GFN: 生成具有理想性质和约束条件的晶体
机构 * Mila AI4Science ; Université de Montréal(蒙特利尔大学) ; CentraleSupélec, Université Paris-Saclay(中央圣艾修伯里学院,巴黎萨克莱大学) ; Johns Hopkins University(约翰霍普金斯大学) ; UCLouvain(布鲁塞尔自由大学)
AI总结 Crystal-GFN是一种生成具有理想性质和约束条件的晶体结构模型,通过多环境连续-离散GFlowNet高效发现多样且有效的晶体。
Comments This is the version of the manuscript submitted (though not accepted) to ICML 2024 in February 2024
2026国际人工智能安全报告
AI总结 2026国际人工智能安全报告由全球29国及国际组织共同参与,汇集超过100位专家意见,全面评估通用人工智能系统的安全性和潜在风险。
递归自聚合解锁大语言模型的深度思考
机构 * Mila – Québec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; LawZero(法零) ; LLNL(劳伦斯利弗莫尔国家实验室) ; University of Edinburgh(爱丁堡大学) ; CIFAR AI Chair(CIFAR人工智能 chair) ; CIFAR Fellow
AI总结 递归自聚合通过结合并行与顺序缩放方法,提升大语言模型的推理能力,实验证明其在多个任务中优于传统方法。
Comments 23 pages, 10 figures. Project page: https://rsa-llm.github.io/
潜在真实性推断用于识别逐步推理中的错误
机构 * Mila – Québec AI Institute(魁北克人工智能研究所) ; KAIST(韩国科学技术院) ; Université de Montréal(蒙特利尔大学) ; LawZero(法零)
AI总结 本文提出通过引入潜在真实性变量和Veracity Search算法,提升语言模型在逐步推理中的准确性和可信度,并通过Amortized Veracity Inference实现零样本真实性推断。
前沿AI审计:迈向对领先AI公司安全与安全实践的严格第三方评估
AI总结 本文提出前沿AI审计的愿景,通过四个AI保证级别提升安全与安全实践的评估标准,推动行业高质量审计生态建设。
基于物理的数据驱动模型用于二氧化碳气体扩散电极,以驱动自动化实验室
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; University of British Columbia(不列颠哥伦比亚大学) ; Université de Montréal(蒙特利尔大学)
AI总结 本文提出了一种基于物理的数据驱动模型,用于优化二氧化碳气体扩散电极的参数空间,以提高其效率并推动自动化实验室的发展。
Comments 7 pages, 5 figures. Published as a conference paper in ICLR2025 AI4Mat workshop