Symbal: Detecting Systematic Misalignments in Model-Generated Captions
Symbal:检测模型生成字幕中的系统性对齐错误
AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。
Comments ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
Symbal:检测模型生成字幕中的系统性对齐错误
AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。
Comments ICML 2026
停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化
AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。
Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)
使智能体部署安全民主化:一种结构监测方法
AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。
Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD
写时复制评分:特定应用代理评估
AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。
Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond
ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突
机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA
AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。
Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026
立场:可解释性研究必须优先考虑基础而非临时方法
AI总结 该论文指出可解释人工智能技术虽多但未有效影响实际工作流程,原因是存在基础缺陷。主张机器学习社区从临时方法转向解决基础和结构挑战,通过分析论文和调查从业者揭示问题,最后给出清单推动XAI走向以人为本、行动导向范式。
Comments Accepted to ICML 2026 Position Paper Track
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
L-MARS:具有协调推理和代理搜索的法律多智能体工作流
机构 * University of Southern California(南加州大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校)
AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。
Comments Accepted at the AI4Law Workshop at ICML 2026
语言作为波的现象:神经网络中的语义相位锁定与干涉
机构 * Independent Researcher, Türkiye(土耳其独立研究者) ; Department of Computer Engineering, Düzce University, Düzce, Türkiye(杜泽大学计算机工程系)
AI总结 本文探讨神经序列模型中相位的作用,提出PRISM模型通过复值编码和相位锁定实现语义信息编码,发现相位结构能有效区分同义词对,并展示相位表示在对抗噪声时的鲁棒性。
Comments ICML 2026
InfoFlow KV:面向长上下文的信息流感知KV重计算
机构 * New York University(纽约大学) ; Duke University(杜克大学)
AI总结 提出将选择性KV重计算建模为信息流问题,利用查询的注意力范数信号识别语义相关且结构上能传播信息的token,并引入信息流引导的块重排序策略,在LLM和VLM基准上优于现有方法。
Comments In proceedings of the 43rd International Conference on Machine Learning (ICML 2026). Project page: https://infoflow-kv.github.io
PhotoAgent: 带探索性视觉审美规划的代理照片编辑
机构 * MMLab, CUHK(CUHK媒体实验室) ; Shanghai AI Lab(上海AI实验室) ; USTC(中国科学技术大学) ; Institute of Science Tokyo(东京科学研究所) ; CPII under InnoHK(创新香港下的CPII)
AI总结 PhotoAgent通过探索性视觉审美规划实现自主照片编辑,无需用户逐步提示,提升图像质量和指令遵循度。
Comments ICML 2026 Oral. A fully automated, intelligent photo-editing agent that autonomously plans multi-step aesthetic enhancements, smartly chooses diverse editing tools, and enables everyday users to achieve professional-looking results without crafting complex prompts. Project page: https://mdyao.github.io/PhotoAgent/
通过片段选择的自适应时间序列推理
机构 * harvard(哈佛大学) ; mit(麻省理工学院) ; mitll(MIT林肯实验室) ; hongkong(香港科学与技术大学)
AI总结 提出ARTIST框架,将时间序列推理建模为序列决策问题,通过控制器-推理器架构和强化学习自适应选择信息片段,提升推理准确率。
Comments ICML 2026
稳定原生低秩大语言模型预训练
机构 * Concordia University, Montreal, Canada(Concordia 大学) ; Mila Quebec AI Institute, Montreal, Canada(Quebec AI 研究院) ; Sorbonne University, CNRS , Paris , France(Sorbonne 大学)
AI总结 本文提出Spectron方法,通过谱归一化实现稳定原生低秩大语言模型预训练,显著提升推理效率并优化计算资源使用。
Comments Accepted at ICML 2026
理解Grokking:岭回归中可证明的Grokking现象
机构 * Department of Computer Science, Purdue University, West Lafayette, IN, USA(普渡大学计算机科学系) ; Department of Computer Science(计算机科学系) ; Applied Mathematics, Weizmann Institute of Science, Israel(科学应用数学系,魏茨曼研究院) ; Stein Faculty of Computer(斯坦因计算机科学学院) ; Information Science, Ben-Gurion University of the Negev, Israel(信息科学系,本· Gurion 军事大学)
AI总结 本文在经典岭回归设置中研究grokking现象,证明使用带权重衰减的梯度下降学习过参数化线性回归模型时,存在过拟合、泛化延迟和最终泛化误差任意小的三个阶段,并首次给出泛化延迟(grokking时间)的严格定量界,同时通过实验表明该界也适用于非线性神经网络。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
步骤标记:通过步骤监控控制语言推理模型的生成
机构 * IBM Research Europe(IBM欧洲研究院) ; Trinity College Dublin(都柏林信任学院) ; ADAPT Research Centre(ADAPT研究中心)
AI总结 针对语言推理模型效率低、过度生成推理步骤的问题,提出步骤标记框架,引入ReasonType分类法,可在线监控特定步骤计数以产生早期停止标准,经实验在保持准确性时减少令牌数,为控制模型生成及研究其行为提供新途径和工具。
Comments ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM), Seoul, South Korea
位置尺度噪声模型中的偏度稳健因果发现
AI总结 研究双变量因果发现问题,提出基于似然的SkewD算法,在位置尺度噪声模型下处理偏态噪声分布,结合启发式搜索和期望条件最大化算法估计参数,在新合成数据集和基准数据集上表现强劲且高偏度下稳健。
Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)