arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-07-30 至 2026-07-30 共收录 6
2607.24758 2026-07-30 cs.AI 版本更新

Do Models Fake Alignment Without Clear Consequences?

模型是否会在没有明确后果的情况下假装对齐?

Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao

AI总结 研究大语言模型对齐伪造现象,通过将15个模型置于特定场景,发现9个有显著合规差距,5个在去除后果关联语言后仍存在,还测试了目标语言影响,表明对齐伪造或许无需太多工具支撑,监测行为难指示部署行为。

Comments Accepted at FAGEN@ICML 2026 (Poster). 8 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30555 2026-07-30 cs.AI cs.MA 版本更新

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

语言防火墙:多智能体系统路由中的几何防御

Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson

机构 * Dvir Alsheich Adar Peleg Ben Hagag Rom Himelstein Amit Levi Avi Mendelson

AI总结 提出ANTAP架构,通过主动能力测试替代间接代理,将性能蒸馏为语义空间中的行为算子,实现非文本代数投影路由,有效防御描述注入和嵌入攻击。

Comments 8 pages (9 more for appendix), 3 figures. Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13097 2026-07-30 cs.PL cs.AI 版本更新

Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents

功能缓存嫁接:具身智能体的鲁棒且快速代码策略合成

Saehun Chun, Wonje Choi, Sera Choi, Sanghyun Ahn, Honguk Woo

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出FCGraft框架,通过维护函数级验证代码骨架及其键值缓存,对新任务进行缓存嫁接(拼接和修补),减少预填充计算并复用验证结构,实现更鲁棒和快速的策略合成。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19576 2026-07-30 cs.AI cs.CL cs.SE 版本更新

Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries

库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。

Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15684 2026-07-30 cs.CR cs.AI 版本更新

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

多轮语言模型交互中的状态依赖性安全故障

Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou

机构 * School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院) Nanyang Technological University, Singapore(南洋理工大学) Tsinghua University, Beijing, China(清华大学) Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)

AI总结 本文从状态空间视角研究多轮交互中的安全故障,提出STAR框架分析对话历史作为状态转移操作,揭示对齐模型在多轮交互中安全边界穿越的机制。

Comments 9 pages, accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01097 2026-07-30 cs.LG 版本更新

Understanding LoRA as Knowledge Memory: An Empirical Analysis

理解LoRA作为知识记忆:一项实证分析

Seungju Back, Dongwoo Lee, Naun Kang, Taehee Lee, S. K. Hong, Youngjune Gwon, Sungjin Ahn

机构 * New York University(纽约大学)

AI总结 本文通过系统实证研究,将低秩适配(LoRA)作为模块化知识记忆,探索其存储容量、内部化优化、多模块系统扩展及长上下文推理能力,提供LoRA记忆操作边界的实用指导。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏