Symbal: Detecting Systematic Misalignments in Model-Generated Captions
Symbal:检测模型生成字幕中的系统性对齐错误
AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。
Comments ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
Symbal:检测模型生成字幕中的系统性对齐错误
AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。
Comments ICML 2026
停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化
AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。
Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)
使智能体部署安全民主化:一种结构监测方法
AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。
Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD
写时复制评分:特定应用代理评估
AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。
Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond
ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突
机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA
AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。
Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026
立场:可解释性研究必须优先考虑基础而非临时方法
AI总结 该论文指出可解释人工智能技术虽多但未有效影响实际工作流程,原因是存在基础缺陷。主张机器学习社区从临时方法转向解决基础和结构挑战,通过分析论文和调查从业者揭示问题,最后给出清单推动XAI走向以人为本、行动导向范式。
Comments Accepted to ICML 2026 Position Paper Track
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026