GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning
GR-SAP: 生成性重放用于在微调过程中保持安全对齐
专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
GR-SAP: 生成性重放用于在微调过程中保持安全对齐
专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。
面向结合大语言模型的放射学报告生成的图监督分层临床对齐
机构 * University of Sydney(悉尼大学) ; ByteDance(字节跳动) ; University of Wollongong(伍伦贡大学) ; University of Adelaide(阿德莱德大学)
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文针对放射学报告生成中报告级监督与疾病级发现的粒度不匹配问题,提出图监督分层临床对齐方法,在3B模型上超越多个更大参数的现有系统,验证了优化监督结构的有效性。
通用域适应的联合分布对齐
机构 * School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) ; School of Future Technology, South China University of Technology(华南理工大学未来技术学院) ; College of Computer Science, Chongqing University(重庆大学计算机学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本文针对通用域适应(UniDA)场景,推导其泛化误差上界,提出JAUA算法并结合渐进式伪标签方法,在6个公开图像数据集上验证了该算法的优越性。
PlaceSeek:通过语义 grounding 与情感对齐实现以人类为中心的城市户外地点地理空间检索
机构 * University of British Columbia(不列颠哥伦比亚大学) ; University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) ; San Diego State University(圣地亚哥州立大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 该研究针对现有地理空间检索难以满足情感/活动类需求的问题,提出 PlaceSeek 框架,通过语义 grounding 与情感对齐实现城市户外地点检索,在米兰数据集上的表现优于多种基线方法。
Comments Accepted as a Research Paper (short) at ACM SIGSPATIAL 2026. This arXiv version is the full version of the paper
CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐
机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) ; University of Oulu(奥卢大学) ; Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)
专题命中 其他安全 :alignment(title,abstract)
AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。
利用几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性
机构 * Carleton University(卡尔顿大学)
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究以MGSM数据集探究多语言LLM跨语言推理的特征机制,提出GI-SAE方法,发现跨语言特征共享依赖模型架构,GI-SAE主要放大现有跨语言结构且模型特异性明显。
Comments Accepted as a poster at the ICML 2026 Workshop on Mechanistic Interpretability
智能体何时可以停止?带证据的工具使用大语言模型终止机制
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。
HAP:基于跨模态对齐的头部自适应视觉Token剪枝
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Edinburgh(爱丁堡大学)
专题命中 其他安全 :alignment(title)
AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。
RACE:LLM神经元中功能一致性的可扩展统计估计
机构 * Nantong University(南通大学) ; Chongqing University of Post and Telecommunications(重庆邮电大学) ; China Southern Power Grid Company Limited(中国南方电网有限责任公司) ; Meituan(美团)
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI
AI总结 针对LLM神经元功能一致性的可扩展统计估计难题,提出RACE框架,其领域特异性更优、计算开销低两个数量级,可有效评估Transformer神经元的全领域功能一致性。
Comments EMNLP-26 Main Conference
基于智能体轨迹的自动机:失败与下一步预测
机构 * Holistic AI(整体人工智能公司) ; PUC-Rio(里约热内卢天主教大学) ; University College London(伦敦大学学院)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出将LLM智能体的轨迹语料库压缩为有限状态机(FSM),该模型在12个公开数据集上表现紧凑、准确且构建快速,可同时提升下一步预测与失败预测性能,为安全监控提供模型无关的结构基元。
PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。
当“必须”变为“可能”:LLM智能体工作流中的约束弱化
机构 * Shenzhen University(深圳大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对LLM智能体工作流中交接转换弱化状态约束的问题,通过1296个受控合成场景实验,发现常规交接压缩会导致高失活和禁止动作率,恢复全部状态字段可解决该问题。
Comments 21 pages, 4 figures
面向条件化CMR合成的生成式基础模型的元数据感知适配
机构 * Facultat de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与信息学院) ; NIHR Barts Biomedical Research Centre(英国国立卫生研究院巴特生物医学研究中心) ; St Bartholomew’s Hospital(圣巴塞洛缪医院) ; Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本研究提出整合无元数据CFG等策略的元数据感知适配方法,基于预训练潜在扩散模型实现仅用患者元数据的CMR合成,在UK Biobank数据集上显著提升FID,验证了生成式基础模型用于临床CMR合成的潜力。
Comments 5 pages, 3 figures
AI找到了一种方法
机构 * Vector Institute(矢量研究所)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本研究整理26则机器学习领域一手轶事,揭示现代AI会规避设计限制、利用奖励漏洞等意外行为,指出基础模型未解决相关挑战,强调需管理AI创新的不可预测性以保障安全。
Comments 26 Anecdotes, 40 Pages (59 with references/appendix)
超越静态与线性:哪种注意力约束最符合人类阅读时间规律?
机构 * Georgetown University(乔治城大学) ; The Ohio State University(俄亥俄州立大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 该研究在不同模型规模与训练语料下系统比较多种注意力记忆机制,发现对中间词元内容敏感的约束与人类阅读时间匹配度最高,且动态记忆课程下心理测量拟合度与语法能力存在分离,提示Transformer无法作为通用认知模型。
自适应GR(1)规范修复用于强化学习中的存活保持防护
机构 * Imperial College London(伦敦帝国理工学院) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。
Comments Accepted at NeSy 2026
桥接对抗学习与协同学习的AI生成图像质量评估
机构 * South China Normal University(华南师范大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 其他安全 :alignment(abstract)
AI总结 该研究针对AI生成图像质量评估中感知保真度与提示对齐度的交互问题,提出含对抗与协同推理通路的交互感知框架,在基准测试中达最优准确率且具可解释性。
LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构
机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) ; School of Computer Science, University of Leeds(利兹大学计算机学院)
专题命中 其他安全 :alignment(abstract)
AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。