arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2603.10243 2026-08-26 cs.CL 版本更新 88%

GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning

GR-SAP: 生成性重放用于在微调过程中保持安全对齐

Zhouxiang Fang, Jiawei Zhou, Hanjie Chen

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24121 2026-08-26 cs.CV 新提交 82%

Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models

面向结合大语言模型的放射学报告生成的图监督分层临床对齐

Yingshu Li, Yunyi Liu, Zhanyu Wang, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) ByteDance(字节跳动) University of Wollongong(伍伦贡大学) University of Adelaide(阿德莱德大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文针对放射学报告生成中报告级监督与疾病级发现的粒度不匹配问题,提出图监督分层临床对齐方法,在3B模型上超越多个更大参数的现有系统,验证了优化监督结构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24429 2026-08-26 cs.LG cs.CV 新提交 79%

Joint Distribution Alignment for Universal Domain Adaptation

通用域适应的联合分布对齐

Shizhe Li, Hongshan Pu, Mengying Xie, Yi Xiang, Xiaowei Yang

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) College of Computer Science, Chongqing University(重庆大学计算机学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文针对通用域适应(UniDA)场景,推导其泛化误差上界,提出JAUA算法并结合渐进式伪标签方法,在6个公开图像数据集上验证了该算法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24133 2026-08-26 cs.CV cs.AI cs.IR 新提交 79%

PlaceSeek: Human-Centered Geospatial Retrieval of Urban Outdoor Places via Semantic Grounding and Affective Alignment

PlaceSeek:通过语义 grounding 与情感对齐实现以人类为中心的城市户外地点地理空间检索

Ziqi Cui, Shangyu Lou

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) San Diego State University(圣地亚哥州立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 该研究针对现有地理空间检索难以满足情感/活动类需求的问题,提出 PlaceSeek 框架,通过语义 grounding 与情感对齐实现城市户外地点检索,在米兰数据集上的表现优于多种基线方法。

Comments Accepted as a Research Paper (short) at ACM SIGSPATIAL 2026. This arXiv version is the full version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24374 2026-08-26 cs.SD 新提交 78%

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐

Peiwei Ren, Jinbo Hu, Fang Kang, Shan Liang, Yin Cao

机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) University of Oulu(奥卢大学) Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)

专题命中 其他安全 :alignment(title,abstract)

AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23809 2026-08-26 cs.LG cs.AI cs.CL 新提交 75%

Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders

利用几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性

Igor Bogdanov, Changcheng Huang

机构 * Carleton University(卡尔顿大学)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以MGSM数据集探究多语言LLM跨语言推理的特征机制,提出GI-SAE方法,发现跨语言特征共享依赖模型架构,GI-SAE主要放大现有跨语言结构且模型特异性明显。

Comments Accepted as a poster at the ICML 2026 Workshop on Mechanistic Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23623 2026-08-26 cs.SE cs.AI cs.LG 新提交 73%

When May an Agent Stop? Evidence-Carrying Termination for Tool-Using LLMs

智能体何时可以停止?带证据的工具使用大语言模型终止机制

Jason Liu

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交 71%

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 其他安全 :alignment(title)

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24758 2026-08-26 cs.AI 新提交 70%

RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

RACE:LLM神经元中功能一致性的可扩展统计估计

Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

机构 * Nantong University(南通大学) Chongqing University of Post and Telecommunications(重庆邮电大学) China Southern Power Grid Company Limited(中国南方电网有限责任公司) Meituan(美团)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLM神经元功能一致性的可扩展统计估计难题,提出RACE框架,其领域特异性更优、计算开销低两个数量级,可有效评估Transformer神经元的全领域功能一致性。

Comments EMNLP-26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23670 2026-08-26 cs.AI cs.CL cs.LG 新提交 67%

Automata from Agent Traces: Failure and Next-Step Prediction

基于智能体轨迹的自动机:失败与下一步预测

Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa, Ilham Wicaksono, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) PUC-Rio(里约热内卢天主教大学) University College London(伦敦大学学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出将LLM智能体的轨迹语料库压缩为有限状态机(FSM),该模型在12个公开数据集上表现紧凑、准确且构建快速,可同时提升下一步预测与失败预测性能,为安全监控提供模型无关的结构基元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 57%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24569 2026-08-26 cs.AI cs.MA 新提交 57%

When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows

当“必须”变为“可能”:LLM智能体工作流中的约束弱化

Yiheng Sun, Huifei Wang, Yancheng Zhu, Zhenyu Li, Zebin Zhao, Yifan Yuan

机构 * Shenzhen University(深圳大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体工作流中交接转换弱化状态约束的问题,通过1296个受控合成场景实验,发现常规交接压缩会导致高失活和禁止动作率,恢复全部状态字段可解决该问题。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24342 2026-08-26 cs.CV cs.AI 新提交 57%

Metadata-Aware Adaptation of a Generative Foundation Model for Conditional CMR Synthesis

面向条件化CMR合成的生成式基础模型的元数据感知适配

Marc Rodríguez, Grzegorz Skorupko, Nay Aung, Steffen E Petersen, Karim Lekadir, Polyxeni Gkontra

机构 * Facultat de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与信息学院) NIHR Barts Biomedical Research Centre(英国国立卫生研究院巴特生物医学研究中心) St Bartholomew’s Hospital(圣巴塞洛缪医院) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出整合无元数据CFG等策略的元数据感知适配方法,基于预训练潜在扩散模型实现仅用患者元数据的CMR合成,在UK Biobank数据集上显著提升FID,验证了生成式基础模型用于临床CMR合成的潜力。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23875 2026-08-26 cs.AI 新提交 57%

AI Finds A Way

AI找到了一种方法

Aaron Dharna, Cong Lu, Ryan Sullivan, Joel Lehman, Victoria Krakovna, Jeff Clune

机构 * Vector Institute(矢量研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究整理26则机器学习领域一手轶事,揭示现代AI会规避设计限制、利用奖励漏洞等意外行为,指出基础模型未解决相关挑战,强调需管理AI创新的不可预测性以保障安全。

Comments 26 Anecdotes, 40 Pages (59 with references/appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23818 2026-08-26 cs.CL 新提交 57%

Beyond Static and Linear: What Attention Constraints Best Fit Human Reading Times?

超越静态与线性:哪种注意力约束最符合人类阅读时间规律?

Lanni Bu, Xiulin Yang, Christian Clark, Alex Warstadt, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) The Ohio State University(俄亥俄州立大学) UC San Diego(加州大学圣迭戈分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究在不同模型规模与训练语料下系统比较多种注意力记忆机制,发现对中间词元内容敏感的约束与人类阅读时间匹配度最高,且动态记忆课程下心理测量拟合度与语法能力存在分离,提示Transformer无法作为通用认知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-08-26 cs.AI 版本更新 57%

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24372 2026-08-26 cs.CV 新提交 50%

Bridging Adversarial and Collaborative Learning for AI-Generated Image Quality Assessment

桥接对抗学习与协同学习的AI生成图像质量评估

Baoliang Chen, Qing Lin, Sijie Mai

机构 * South China Normal University(华南师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对AI生成图像质量评估中感知保真度与提示对齐度的交互问题,提出含对抗与协同推理通路的交互感知框架,在基准测试中达最优准确率且具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 50%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏