Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs
从错误中学习:面向安全代码LLM的树状自博弈
AI总结 提出树状自博弈(TSP)框架,将安全代码生成建模为细粒度序列决策过程,通过构建决策树探索安全与脆弱路径,使模型在关键决策节点自我纠正,显著提升代码安全性并实现跨语言泛化。
Comments 18 pages, 3 figures, Accepted by ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
从错误中学习:面向安全代码LLM的树状自博弈
AI总结 提出树状自博弈(TSP)框架,将安全代码生成建模为细粒度序列决策过程,通过构建决策树探索安全与脆弱路径,使模型在关键决策节点自我纠正,显著提升代码安全性并实现跨语言泛化。
Comments 18 pages, 3 figures, Accepted by ICML 2026
贝叶斯张量分解与扩散模型先验
机构 * Zerui Tao(泽瑞·陶) ; Qibin Zhao(赵启斌)
AI总结 提出DiffBCP框架,结合累积收缩过程先验和预训练扩散模型,通过分裂吉布斯采样实现贝叶斯CP分解,在图像修复和去噪任务中优于现有方法。
Comments ICML 2026
Fast-dLLM++: 用于更快扩散LLM推理的Fréchet轮廓解码
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 针对扩散大语言模型推理中并行令牌生成的瓶颈,提出Fréchet轮廓解码方法,通过利用异构置信度轮廓选择并行提交集,在保持模型和缓存不变的情况下提升吞吐量。
Comments Initial version accepted at Workshop on Structured Probabilistic Inference & Generative Modeling, ICML 2026. Project Page: https://ringo-star.github.io/projectpage_frechet/
半监督噪声适应:从噪声域迁移知识
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东人工智能与数字经济实验室) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; Beijing Jiaotong University(北京交通大学) ; Beijing University of Technology(北京工业大学) ; Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 提出半监督噪声适应(SSNA)问题,利用合成噪声域作为源域,通过噪声适应框架(NAF)改善目标域的泛化性能。
Comments Accepted by ICML 2026
AdamW风格Shampoo的收敛率分析:统一单侧与双侧预处理
机构 * Huan Li(李焕) ; Yiming Dong(董怡铭) ; Zhouchen Lin(林周辰)
AI总结 本文研究AdamW风格Shampoo优化器,统一单侧与双侧预处理,并建立了以核范数度量的收敛率,该收敛率在理想情况下与SGD的最优收敛率类似。
Comments V3:ICML Camera-Ready. V4 v.s. V3: extend to the more general setting where the exponents of the two preconditioners do not sum to 1/2
Proact-VL:用于实时AI伴侣的主动式视频大语言模型
机构 * Tsinghua University(清华大学)
AI总结 本文提出Proact-VL框架,通过游戏场景中的评论和引导任务,解决实时AI伴侣在低延迟推理、自主响应决策和内容质量控制方面的挑战,实现了主动式实时交互。
Comments ICML 2026
熵感知的在线策略蒸馏语言模型
机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) ; University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) ; Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)
AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。
Comments 18 pages, 11 figures, ICML 2026
GradPower: 通过梯度加速更快的语言模型预训练
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出GradPower,一种轻量级的梯度变换技术,用于加速语言模型预训练。通过元素级符号幂变换,将梯度输入基础优化器,无需修改优化器内部逻辑或超参数,从而在多种架构、参数规模、数据集和学习率调度方案中均取得更低的终端损失。
Comments 24 pages, accepted by ICML 2026
NanoQuant: 大型语言模型高效子1位量化
机构 * KAIST(韩国科学技术院)
AI总结 本文提出NanoQuant,一种新型后训练量化方法,能够将大型语言模型压缩到二进制和子1位水平,通过低秩二进制分解问题实现高效压缩,并在消费者硬件上实现大规模部署。
Comments Accepted to ICML 2026. Hyochan Chong and Dongkyu Kim contributed equally to this work
RaBiT:基于残差的二值化训练用于准确且高效的LLM
机构 * KAIST(韩国科学技术院)
AI总结 RaBiT通过算法强制残差层级解决二值化中的特征共适应问题,提升2位精度-效率边界,实现超越VQ的性能和4.49倍的推理加速。
Comments Accepted to ICML 2026
E-mem:基于多智能体的事件上下文重建用于LLM智能体记忆
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学)
AI总结 E-mem通过多智能体协同重建事件上下文,提升LLM在长时序任务中的推理能力,实现54%的F1分数,优于现有方法7.75%,并降低70%的token成本。
Comments This paper has been accepted by ICML 2026. If you find our project helpful, please consider giving it a star: https://github.com/dog-last/E-mem
红队代理执行上下文:OpenClaw上的开放世界安全评估
机构 * National University of Singapore(新加坡国立大学)
AI总结 本文提出DeepTrap框架,通过黑盒轨迹优化发现OpenClaw中的上下文漏洞,展示上下文妥协可引发安全风险,强调需执行中心的安全评估。
Comments Accepted to ICML 2026 Workshop
动力学模型中的平滑误差及如何避免
AI总结 本文研究了不同GNN在动力学建模中的平滑效应,证明了单位ary卷积对这类任务有害,并提出放松的单位ary卷积以平衡平滑性保留与物理系统需求。
Comments Ecstatic to share relaxed unitary mesh convolutions with the community :D! This version contains the camera ready for ICML 2026. Send me an email with your thoughts! I love getting mail :^)
CRC-Screen:分类偏移下认证的DNA合成危害筛查
机构 * Najmul Hasan(纳杰姆·哈桑)
AI总结 针对DNA合成订单中危害序列因分类偏移导致基线筛查100%误报的问题,提出基于k-mer Jaccard相似度、五LLM评委修剪均值和嵌入聚类质心余弦相似度的融合信号,经单调逻辑聚合器和共形风险控制校准,在保证假阴性率受控的同时实现零漏检和低误报。
Comments Accepted at the 6th Muslims in ML (MusIML) Workshop at ICML 2026
Think-at-Hard: 选择性潜在迭代以改进推理语言模型
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。
Comments Accepted by ICML'26
从噪声到意图:基于残差桥的生成式VLA策略锚定
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。
Comments Accepted to ICML 2026
超越预定义模式:TRACE-KG 用于上下文增强的知识图谱生成
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出 TRACE-KG 框架,通过数据驱动模式联合构建上下文增强的知识图谱和归纳模式,无需预定义本体,解决长技术文档中图谱碎片化问题。
Comments Accepted at Graph Foundation Models at ICML 2026
通过秩上的反射扩散学习排列分布
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Soft-Rank Diffusion框架,通过将排列松弛为软秩实现平滑扩散,并引入上下文广义Plackett-Luce去噪器,在排序和组合优化任务上优于现有扩散方法。
Comments 18 pages including the appendix, 7 figures, 9 tables, Accepted at ICML 2026
马尔可夫数据的渐近最优序贯检验
机构 * Indian Institute of Science, Bangalore(班加罗尔印度科学学院) ; Indian Institute of Technology, Hyderabad(海得拉巴印度理工学院) ; Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 – CRIStAL(里尔大学、法国国家科学研究中心、中央里尔学院、UMR 9189 – CRIStAL)
AI总结 针对遍历有限状态马尔可夫链生成的数据,提出一种渐近最优的序贯假设检验方法,其期望停止时间与实例相关的下界渐近匹配,并应用于马尔可夫链蒙特卡洛模型误设检测和马尔可夫决策过程结构性质检验。
Comments ICML 2026
ToaSt: 面向高效ViT的令牌通道选择与结构化剪枝
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出ToaSt框架,对多头自注意力模块进行耦合头结构化剪枝,对前馈网络采用训练无关的令牌通道选择方法,在多种ViT模型上实现精度与效率的优越平衡。
Comments Accepted at ICML 2026
从费曼图看有限宽神经正切核
机构 * Department of Mathematical Sciences, Chalmers University of Technology(楚德大学技术学院数学科学系) ; the University of Gothenburg(哥德堡大学)
AI总结 引入费曼图计算有限宽神经正切核修正,简化代数运算并推导递归关系,证明ReLU等尺度不变非线性在Gram矩阵对角线上无有限宽修正。
Comments Published at the ICML 2026; 12 pages + appendices
学习共享:面向高效并行智能体系统的选择性记忆
机构 * Institute of Artificial Intelligence, University of Central Florida, Orlando, United States(人工智能研究所,中央佛罗里达大学,奥兰多,美国)
AI总结 提出LTS机制,通过强化学习训练控制器选择性共享跨团队中间信息,在减少并行智能体系统计算开销的同时保持或提升任务性能。
Comments ICML 2026
为什么树状分支对GRPO中的思维优势估计至关重要
机构 * Hongcheng Wang(王宏城) ; Yinuo Huang(黄炎诺) ; Sukai Wang(王苏凯) ; Guanghui Ren(任广辉) ; Hao Dong(董浩)
AI总结 本文从方差角度理论证明,在GRPO中增加思维采样数无法消除估计方差,而增加每个思维的延续分支数能以1/M速率降低方差,从而阐明树状分支的必要性。
Comments Accepted by ICML 2026, code are available at https://github.com/whcpumpkin/GRPO-MA
从所见中采样:基于观测嵌入随机微分方程的扩散桥视觉运动策略学习
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出BridgePolicy,通过扩散桥公式将观测直接集成到随机动力学中,利用语义对齐器处理异构观测,在模拟和真实任务中超越现有生成式策略。
Comments Accepted by ICML 2026
幻觉的统一定义:是世界模型的问题,笨蛋!
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出幻觉的统一定义,即用户可观察到的错误内部世界建模,并连接至HalluWorld基准测试,以区分真实幻觉与规划或奖励错误。
Comments ICML 2026. HalluWorld benchmark at https://github.com/DegenAI-Labs/HalluWorld
EffGen: 使小型语言模型成为能干的自主智能体
机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) ; Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) ; Google DeepMind, USA(谷歌DeepMind)
AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。
Comments Accepted to ICML 2026 Conference
面向LLM监督微调的效用-多样性感知在线批次选择
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出UDS框架,利用logits矩阵核范数和轻量记忆缓冲实现高效在线批次选择,兼顾数据效用与多样性,无需外部资源,在多个基准上优于现有方法并降低训练时间。
Comments ICML 2026 accepted paper
AREAL-DTA:用于大语言模型高效强化学习的动态树注意力机制
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对RL后训练中rollout序列共享前缀导致计算冗余的问题,提出基于深度优先搜索的动态树注意力机制,结合负载均衡分布式批处理,实现高效前缀共享,训练吞吐量提升最高8.31倍。
Comments Accepted at ICML 2026. Camera-ready version. Code: https://github.com/areal-project/AReaL/tree/feat/dta
突破自然推理的边界:来自形式逻辑验证的交错奖励
AI总结 提出形式逻辑验证引导框架,通过交错验证与生成过程实时纠正推理错误,结合两阶段训练,在数学、逻辑和通用推理基准上显著提升大模型性能。
Comments Accepted by ICML 26
FrameOracle: 学习在视频中看什么以及看多少
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出FrameOracle轻量模块,预测相关帧及其数量,通过课程学习从弱代理信号到强监督,在多个VLM和基准上以更少帧数保持或提升精度。
Comments ICML 2026. Project page: https://people-robots.github.io/frameoracle/