Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡
机构 * Ritzz-AI
AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。
Comments ICML 2026 Poster
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡
机构 * Ritzz-AI
AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。
Comments ICML 2026 Poster
稀疏自编码器是LLM劫持攻击缓解器
AI总结 本文提出基于SAE的CC-Delta方法,通过比较带有和无劫持上下文的有害请求的token级表示,识别劫持相关的稀疏特征,从而在稀疏SAE特征空间中实现更优的安全-效用权衡。
Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026. 31 pages, 20 figures, 7 tables
通用且高效的扩散模型操控
机构 * Halıcıoğlu Data Science Institute, University of California San Diego(哈利奇奥格数据科学研究所,加州大学圣地亚哥分校)
AI总结 本文提出NA-RFM方法,通过噪声对齐和递归特征机激活操控实现无需梯度指导的高效扩散模型操控,提升生成速度和准确性。
Comments ICML 2026
ImprovEvolve:盆地跳跃与LLM引导的进化搜索
AI总结 ImprovEvolve通过进化三个专用算子(初始化、局部改进、扰动)降低LLM认知负担,通过迭代局部改进和扰动实现盆地跳跃搜索,在六边形堆叠和球面码问题中取得新成果。
Comments 40 pages, 14 figures, AI for Math Workshop at ICML 2026
无需训练或学习的测试时去毒化
AI总结 本文提出一种无需训练或学习的测试时去毒化方法,通过零阶优化调整输入嵌入以减少生成文本的毒性,实现安全高效的文本生成。
Comments ICML 2026
SPARKLING:平衡信号保留与对称性破坏以实现宽度渐进学习
AI总结 SPARKLING通过信号保留和对称性破坏技术,实现中间阶段宽度扩展,提升模型训练效率并减少计算成本。
Comments ICML 2026 camera-ready version
在鲁棒风格对齐下高质量行为的离线强化学习
机构 * Ubisoft La Forge, Bordeaux, France(育碧La Forge,法国波尔多)
AI总结 本文提出SCIQL方法,通过结合离线目标条件RL技术与新的门控优势加权回归机制,在保持风格对齐的同时提升任务性能。
Comments ICML 2026 Spotlight
Diff-MN: 基于扩散参数化的MoE-NCDE连续时间序列生成方法用于不规则观测
机构 * Microsoft Research(微软研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 Diff-MN通过引入MoE动态函数和解耦架构设计,提升NCDE在不规则时间序列生成中的性能,实验表明其在不规则到规则及不规则到连续生成任务中优于基线模型。
Comments This paper is accepted by ICML 2026
具有混合情景-程序记忆的经验演化多轮工具使用智能体
AI总结 本文提出混合情景-程序记忆策略,通过动态重用部分重叠的成功经验,使多轮工具使用策略实现经验驱动的自我演化,提升多轮任务中的推理与执行效率。
Journal ref ICML 2026
知晓偏见,表现更好:通过Know-Bias神经元增强减轻大语言模型中的社会偏见
AI总结 本文提出KnowBias框架,通过增强而非压制编码偏见知识的神经元来减轻LLM中的社会偏见,实现高效且通用的去偏方法。
Comments ICML 2026
神经最小权重完美匹配用于量子纠错码
AI总结 本文提出神经最小权重完美匹配解码器,结合图神经网络和Transformer预测动态边权重,提升量子纠错性能,实验显示在去极化噪声下阈值达到17.9%和10.95%。
Comments Accepted to ICML 2026
SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; Google(谷歌)
AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。
Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/
在视频生成模型中评估牛顿力学
AI总结 本文提出Morpheus框架,通过真实物理系统评估视频生成模型对牛顿力学的理解能力,揭示当前模型在物理原理编码上的不足。
Comments Forty-Third International Conference on Machine Learning (ICML 2026)
通过基于查询的模型协作进行专家指导的临床文本增强
AI总结 本文提出基于查询的模型协作框架,利用专家知识指导文本增强,提升医疗信息保留并减少幻觉,实验显示在临床预测任务中表现优于传统方法。
Comments 18 pages, 6 figures, Accepted at ICML 2026
具有保证的等价推理表示学习
机构 * CSML, Italian Institute of Technology(意大利技术研究院 CSML) ; University College London(伦敦大学学院)
AI总结 本文提出一种等价表示学习框架,同时解决回归、条件概率估计和不确定性量化,并提供非渐近的统计学习保证。
Comments 67 pages, 22 figures, accepted to International Conference on Machine Learning (ICML-2026)
具有人类反馈的分布鲁棒强化学习
AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。
Comments Accepted at ICML 2026
CASE-Bench:面向大语言模型的上下文感知安全基准
AI总结 本文提出CASE-Bench,通过整合上下文信息评估大语言模型的安全性,揭示上下文对人类判断的显著影响,并发现商业模型在安全情境下的响应与人类判断存在明显偏差。
Comments 24 pages. This paper has been accepted at ICML 2025
Transformer训练动态的机制研究
AI总结 本文通过可控实验研究Transformer训练动态,发现梯度下降可实现聚类头解决稀疏模块加法任务,并揭示训练过程中两阶段学习及归一化层高曲率导致的损失尖峰现象。
Comments Accepted at ICML 2026 Mechanistic Interpretability workshop
多级联邦学习中的个性化加法建模
机构 * University of Technology Sydney(悉尼科技大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文提出FeMAM,通过多级共享模型和加法组合构建个性化预测器,有效处理复杂非独立同分布数据,优于传统联邦学习基线。
Comments Accepted at the International Conference on Machine Learning (ICML), 2026