Robust Bayes-Assisted Conformal Prediction
鲁棒贝叶斯辅助共形预测
AI总结 针对贝叶斯辅助共形预测在先验与数据失配时预测集过大的问题,提出RoBAS框架构造鲁棒非一致性得分,分布偏移下可缩窄预测区间且无偏移时性能有竞争力。
Comments Accepted to ICML 2026. 44 pages, 8 figures, 7 tables
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
鲁棒贝叶斯辅助共形预测
AI总结 针对贝叶斯辅助共形预测在先验与数据失配时预测集过大的问题,提出RoBAS框架构造鲁棒非一致性得分,分布偏移下可缩窄预测区间且无偏移时性能有竞争力。
Comments Accepted to ICML 2026. 44 pages, 8 figures, 7 tables
智能体何时撒谎:重复博弈中的预谋、持续性与可利用性研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Vector Institute(向量研究所) ; University of Toronto(多伦多大学) ; EuroSafeAI
AI总结 本文针对大语言模型智能体行动前公示意图的诚信问题,设计三阶段n人重复博弈协议,评测前沿模型,发现其偏离公示行为多属预谋,不同模型对公示的语义理解不兼容。
Comments Best Paper Award at ICML NExT-Game Workshop
量化目标,量化草稿生成器:使用Qwen3.5 - 4B进行高效推理
机构 * Nota Inc.(Nota公司)
AI总结 研究旨在在资源受限的NVIDIA A10G GPU上实现Qwen3.5 - 4B的低延迟服务。核心方法是结合量化目标模型与推测性解码,通过量化感知蒸馏恢复精度,训练专用草稿生成器加速解码,还用量化等减少开销。贡献是实现加速并满足质量阈值,排名第三。
Comments All authors contributed equally. Our submission to Efficient Qwen Competition, ICML 2026 Workshop on AdaptFM
通过专家乘积桥接的扩散语言模型并行解码
机构 * Stanford University(斯坦福大学)
AI总结 提出PoE-Bridge框架,通过专家乘积构建中间分布,结合扩散语言模型并行解码和自回归模型质量,实现5倍加速并恢复至少95%的AR性能。
Comments ICML 2026
TabPack:面向表格深度学习的高效超参数集成方法
机构 * Yandex ; HSE University(俄罗斯高等经济大学)
AI总结 针对现有表格数据MLP集成需超参数调优的问题,提出TabPack可并行采样训练多超参数MLP并动态选集成成员,开箱性能优异,大幅降低调优成本与计算资源消耗。
Comments ICML 2026. Code: https://github.com/yandex-research/tabpack
几何互易性:解锁立体视频生成的自监督能力
机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)
AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。
Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/
面向大语言模型的选择性披露水印技术
机构 * Xuyang Chen 1(陈绪阳 1) ; Xiang Li 1(李翔 1) ; Yangxinyu Xie 1(谢洋新宇 1) ; Qi Long 1(龙启 1)
AI总结 针对现有多比特LLM水印无法部分披露引发隐私泄露问题,提出分层词汇路由框架,实现细粒度水印访问控制,保障文本质量且检测精度高、延迟低。
Comments Accepted at ICML 2026
GeoFlow:用于起讫点流预测与生成的区域间关系地理感知建模
机构 * Zherui Huang(黄泽睿) ; Guanjie Zheng(郑冠杰) ; Hao Xue(徐浩) ; Linghe Kong(孔令和)
AI总结 针对现有OD流建模忽略地理属性的缺陷,提出GeoFlow框架融合多类地理特征与定制编解码器,提升OD流预测精度与生成样本的真实性多样性。
Comments Accepted by ICML 2026
FUSE:用于高效基于模拟后验估计的费曼-卡茨引导多模态流匹配
机构 * ShanghaiTech University(上海科技大学) ; Cellverse, Co., Ltd.(Cellverse公司)
AI总结 针对现有基于模拟推理方法多模态建模效果差的问题,提出双架构FUSE结合FK引导采样,提升后验估计精度,在基准测试和系外行星任务上性能优于现有方法。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 5 figures
AI事件治理中的开放问题
机构 * Independent(独立) ; Sorbonne University(索邦大学) ; Rice University(里奇大学) ; Columbia University(哥伦比亚大学) ; AI Standards Lab(人工智能标准实验室) ; Vilnius University(维尔纽斯大学)
AI总结 针对部署后AI系统的未预期故障,该研究梳理现有AI事件治理框架,发现其在定义、分类等方面缺乏一致性,为后续相关规范完善提供参考。
Comments Accepted to ICML Technical AI Governance Research workshop 2026
KinEMbed:通过跨模态对比学习从肌电图中解码运动学
机构 * Department of Statistics, University of Oxford(牛津大学统计学系) ; School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
AI总结 研究从表面肌电图解码手部运动学这一挑战,提出跨模态对比学习框架KinEMbed训练双编码器,用于手部运动学回归,在NinaPro DB8数据集上优于基线方法。
Comments ICML 2026 Workshop on Structured Data for Health, Seoul, South Korea
ToolFailBench:诊断大语言模型智能体中的工具使用失败
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。
Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026
FormalRx:纠正和检查自动形式化中的语义错误
机构 * LARK Lab, HKUST(GZ)(香港科技大学(广州)LARK实验室) ; ETH Zurich(苏黎世联邦理工学院) ; UCLA(加州大学洛杉矶分校) ; SJTU(上海交通大学) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; HKUST(香港科技大学)
AI总结 研究自动形式化中语义对齐问题,提出FormalRx框架,核心是SCI错误分类法,能实现对齐判定、错误分类、定位及纠正,通过实例验证性能优于基线,助力自动形式化系统诊断与改进。
Comments 44 pages, 5 figures. Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益
机构 * Stanford University(斯坦福大学) ; New York University(纽约大学)
AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。
Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback
政府人工智能使用作为一种监测原语:一项公共文件试点研究
AI总结 研究提出以测量政府公共文件中语言模型辅助痕迹来监测政府人工智能使用,此方法轻量且可外部重现。通过对中美政府相关的十个公共文件流试点研究,发现2026年部分数据源有显著人工智能辅助写作迹象,并探讨了该信号的作用与不足。
Comments 34 pages, 4 figures, 2 tables. Accepted at the ICML 2026 Workshop on Technical AI Governance Research (TAIGR)
压缩验证瓶颈:用于科学发现的智能自动驾驶实验室
AI总结 针对智能科学发现中自动驾驶实验室的验证瓶颈,提出先验感知的智能实验设计循环和成本感知代理,通过利用领域知识和预测测量,减少实验循环次数和每次实验成本来加速实验循环。
Comments Accepted at ICML 2026 AI for Science Workshop ; AI Scientist Competition
NKI-Agent:用于神经元内核生成的特定领域微调与智能体工具使用
机构 * AWS Neuron Team(亚马逊云科技神经元团队) ; Amazon Web Services(亚马逊云科技)
AI总结 针对新兴AI加速器,介绍NKI-Agent系统,结合特定领域监督微调与编译验证修复智能体循环生成NKI内核,适配框架、构建基准并评估,显示工具使用关键及不同模型表现,为强化学习奖励设计提供指导。
Comments 7 pages. Accepted at DL4C @ ICML 2026 Workshop
贝叶斯优化需要多少初始点?
机构 * Korea Advanced Institute of Science & Technology (KAIST)(韩国科学技术院) ; HayanMind Inc.(哈扬思维公司) ; Technical University of Nuremberg (UTN)(纽伦堡工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Helmholtz Munich(亥姆霍兹慕尼黑中心) ; Imperial College London(伦敦帝国理工学院)
AI总结 研究贝叶斯优化初始点数量选择问题,发现初始点数量与总成本呈U型关系,不同超参数和采集函数都存在此权衡,汤普森采样是例外,还给出实用建议。
Comments 4 pages. Accepted at the ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation
SAD-LoRA:低秩知识蒸馏的谱对齐
AI总结 提出SAD-LoRA方法用于低秩知识蒸馏,从数据加权学生空间参考更新中选择权重子空间,通过可微主角度损失训练,减少子空间错位,提升对齐效果,提高秩效率。
Comments ICML'26 workshop on CoLoRAI - The 2nd Workshop on Connecting Low-rank Representations in AI, 15 pages
因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Hong Kong Baptist University(香港浸会大学) ; University of Oxford(牛津大学) ; New York University, Abu Dhabi(纽约大学阿布扎比分校)
AI总结 研究旨在通过因果游戏基准测试大语言模型智能体的因果思维能力,让智能体设计实验、收集数据并给出解决方案。设计含多种挑战的场景,发现当前智能体因果思维能力欠佳,为评估提供了测试平台。
Comments Zhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/
通过激活几何进行无监督特征挖掘
AI总结 介绍通过激活几何挖掘(MAG)的无监督框架,在输入前加指令Q,用m(Q∣p)-m(p)衡量其对模型内部表征的影响,探索多种MAG,所提取特征可预测模型理解与判断,还用于选择最佳训练数据集。
Journal ref ICML 2026, workshop on Failure Modes in Agentic AI (FAGEN)
语言模型中序数表示的几何结构
机构 * Gemma Team(杰玛团队) ; Qwen Team(文生团队)
AI总结 研究在多个语言模型中测试序数任务,发现当序数变量可从令牌身份局部计算时会出现具有位置细胞特征平铺的一维流形,几何计算与架构有关,激活修补证实流形子空间集中任务相关信息。
Journal ref Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
DynaVieW:用于理解分层视觉动态的模式引导世界建模
机构 * EPFL, Switzerland(瑞士联邦理工学院) ; Harvard University(哈佛大学) ; Sony Group Corporation(索尼集团) ; ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)
AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。
Comments ICML 2026
望远镜:通过测量令牌重复概率改进大语言模型生成内容的零样本检测
AI总结 研究区分大语言模型生成文本与人类写作的难题,提出用望远镜困惑度衡量模型令牌重复,揭示该特征在预训练早期出现,能有效进行零样本检测,性能优于其他方法。
Comments 50 pages, ICML, 20 figures, Equal contribution
USE:一种用于测试时提示调整的统一自集成框架
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) ; Nanjing University(南京大学)
AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。
Comments ICML 2026
使用确定性真实数据评估长文本生成中语言模型的不确定性
机构 * Technion(技术学院) ; Nvidia(英伟达)
AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT
G$^2$TAM:几何基础的轨迹任意模型
机构 * HKU(香港大学) ; Shanghai AI Lab(上海人工智能实验室) ; BUAA(北京航空航天大学) ; SJTU(上海交通大学) ; UCLA(加州大学洛杉矶分校) ; ZJU(浙江大学)
AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。
Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/
RADIO1D:用于压缩视觉建模的弹性表示
机构 * NVIDIA(英伟达)
AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。
Comments Published as main conference paper at ICML 2026
如何避免辩论:通过双高效交互式证明实现可扩展的人工智能安全
机构 * MIT(麻省理工学院)
AI总结 研究如何避免人工智能模型间的辩论来实现安全验证,提出单证明者交互式证明,给出双高效单证明者交互式证明及论证,用于神谕辅助计算,表明无辩论时交互式验证也可行。
Comments ICML 2026
WeightCLIP:为权重空间学习对齐数据集和模型
机构 * School of Computer Science, University of St.Gallen(圣加尔登大学计算机科学学院)
AI总结 提出WeightCLIP方法,通过自动编码器和数据集编码器对神经网络及数据集样本编码,用对比目标对齐二者表征,学习数据集对齐的潜在空间,用于不同下游任务,还引入潜在细化过程。
Comments Accepted at ICML 2026