arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 85 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 31 篇

2608.24541 2026-08-26 cs.CV 新提交 50%

Hierarchical Prototype-Memory Adaptation of SAM for Surgical Instrument Segmentation

用于手术器械分割的SAM分层原型-记忆适应方法

Xinning Yao, Jingjing Wang, Jinghua Yue, Xiaoyan Luo, Fugen Zhou, Bo Liu

机构 * Beihang University(北京航空航天大学) Image Processing Center(图像处理中心)

专题命中 安全评测 :alignment(abstract)

AI总结 针对SAM适配手术器械分割时的鲁棒性与尺度耦合问题,本文提出HPMA框架,通过分层原型记忆与尺度匹配耦合机制,在EndoVis2017/2018数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24094 2026-08-26 cs.RO 新提交 50%

SIREN-Bench: Behavior-Driven Generation and Evaluation of Emergency-Vehicle Interactions

SIREN-Bench:行为驱动的应急车辆交互生成与评估

Yicheng Zhu, Tianmu Zhao, Haoxin Leng, Fan Zuo, Tao Li, Zilin Bian

机构 * Rochester Institute of Technology(罗切斯特理工学院) CVS Health(CVS健康公司) City University of Hong Kong(香港城市大学) New York University(纽约大学)

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出行为驱动的SIREN协同仿真平台,构建SIREN-Bench-v1基准,经3类任务评估揭示不同行为模式下的失效特性,为自动驾驶与交通安全研究提供可扩展平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-26 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15160 2026-08-26 eess.SY math.DS 版本更新 50%

Multi-Scale Control of Large Agent Populations: From Density Dynamics to Individual Actuation

多尺度控制大规模群体:从密度动力学到个体驱动

Mario di Bernardo

专题命中 安全评测 :safety(abstract)

AI总结 本文综述了作者与合作者在多尺度控制大规模群体方面的最新研究,探讨了从微观动态到宏观密度描述的系统性桥梁,以及直接控制与间接控制的统一方法。

Comments v2: adds Remark 1 introducing the agent-to-density (A/D) and density-to-agent (D/A) scale-converter terminology; Fig. 1 relabelled; conclusions revised

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2608.23870 2026-08-26 cs.AI 新提交 70%

Granite.Trust Policy Tools: Shareable, Actionable Policies for Generative AI Applications

Granite.Trust 策略工具:面向生成式 AI 应用的可共享、可执行策略

Nathalie Baracaldo, Nicolas Mello, Kush R. Varshney, Heiko Ludwig, Kate Soule, David Cox

机构 * IBM Research(IBM研究院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对现有策略无法适配 GenAI 内容约束执行的问题,提出 Actionable Policy 模式与合成数据流水线等工具,实现 GenAI 全生命周期的策略规范与执行,相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24662 2026-08-26 cs.AI cs.CL cs.CY 新提交 67%

The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models

隐形编辑层:形式化部署语言模型中未公开的推理时调控、概率置放与归因问题

Augusto Camargo

机构 * Bluecore Consulting(蓝芯咨询)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文针对部署语言模型提出隐形编辑层概念,形式化推理归因问题、概率置放等核心概念,探讨其与相关监管框架的关联,揭示未公开推理调控的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19668 2026-08-26 cs.CL 版本更新 57%

Code-Switching Reveals Language Anchoring in Multilingual LLMs

代码切换揭示多语言大模型中的语言锚定

Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(中央大学) Adobe Research(Adobe研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2603.10243 2026-08-26 cs.CL 版本更新 88%

GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning

GR-SAP: 生成性重放用于在微调过程中保持安全对齐

Zhouxiang Fang, Jiawei Zhou, Hanjie Chen

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24121 2026-08-26 cs.CV 新提交 82%

Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models

面向结合大语言模型的放射学报告生成的图监督分层临床对齐

Yingshu Li, Yunyi Liu, Zhanyu Wang, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) ByteDance(字节跳动) University of Wollongong(伍伦贡大学) University of Adelaide(阿德莱德大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文针对放射学报告生成中报告级监督与疾病级发现的粒度不匹配问题,提出图监督分层临床对齐方法,在3B模型上超越多个更大参数的现有系统,验证了优化监督结构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24429 2026-08-26 cs.LG cs.CV 新提交 79%

Joint Distribution Alignment for Universal Domain Adaptation

通用域适应的联合分布对齐

Shizhe Li, Hongshan Pu, Mengying Xie, Yi Xiang, Xiaowei Yang

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) College of Computer Science, Chongqing University(重庆大学计算机学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文针对通用域适应(UniDA)场景,推导其泛化误差上界,提出JAUA算法并结合渐进式伪标签方法,在6个公开图像数据集上验证了该算法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24133 2026-08-26 cs.CV cs.AI cs.IR 新提交 79%

PlaceSeek: Human-Centered Geospatial Retrieval of Urban Outdoor Places via Semantic Grounding and Affective Alignment

PlaceSeek:通过语义 grounding 与情感对齐实现以人类为中心的城市户外地点地理空间检索

Ziqi Cui, Shangyu Lou

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) San Diego State University(圣地亚哥州立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 该研究针对现有地理空间检索难以满足情感/活动类需求的问题,提出 PlaceSeek 框架,通过语义 grounding 与情感对齐实现城市户外地点检索,在米兰数据集上的表现优于多种基线方法。

Comments Accepted as a Research Paper (short) at ACM SIGSPATIAL 2026. This arXiv version is the full version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24374 2026-08-26 cs.SD 新提交 78%

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐

Peiwei Ren, Jinbo Hu, Fang Kang, Shan Liang, Yin Cao

机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) University of Oulu(奥卢大学) Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)

专题命中 其他安全 :alignment(title,abstract)

AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23809 2026-08-26 cs.LG cs.AI cs.CL 新提交 75%

Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders

利用几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性

Igor Bogdanov, Changcheng Huang

机构 * Carleton University(卡尔顿大学)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以MGSM数据集探究多语言LLM跨语言推理的特征机制,提出GI-SAE方法,发现跨语言特征共享依赖模型架构,GI-SAE主要放大现有跨语言结构且模型特异性明显。

Comments Accepted as a poster at the ICML 2026 Workshop on Mechanistic Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23623 2026-08-26 cs.SE cs.AI cs.LG 新提交 73%

When May an Agent Stop? Evidence-Carrying Termination for Tool-Using LLMs

智能体何时可以停止?带证据的工具使用大语言模型终止机制

Jason Liu

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交 71%

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 其他安全 :alignment(title)

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24758 2026-08-26 cs.AI 新提交 70%

RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

RACE:LLM神经元中功能一致性的可扩展统计估计

Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

机构 * Nantong University(南通大学) Chongqing University of Post and Telecommunications(重庆邮电大学) China Southern Power Grid Company Limited(中国南方电网有限责任公司) Meituan(美团)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLM神经元功能一致性的可扩展统计估计难题,提出RACE框架,其领域特异性更优、计算开销低两个数量级,可有效评估Transformer神经元的全领域功能一致性。

Comments EMNLP-26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23670 2026-08-26 cs.AI cs.CL cs.LG 新提交 67%

Automata from Agent Traces: Failure and Next-Step Prediction

基于智能体轨迹的自动机:失败与下一步预测

Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa, Ilham Wicaksono, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) PUC-Rio(里约热内卢天主教大学) University College London(伦敦大学学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出将LLM智能体的轨迹语料库压缩为有限状态机(FSM),该模型在12个公开数据集上表现紧凑、准确且构建快速,可同时提升下一步预测与失败预测性能,为安全监控提供模型无关的结构基元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 57%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24569 2026-08-26 cs.AI cs.MA 新提交 57%

When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows

当“必须”变为“可能”:LLM智能体工作流中的约束弱化

Yiheng Sun, Huifei Wang, Yancheng Zhu, Zhenyu Li, Zebin Zhao, Yifan Yuan

机构 * Shenzhen University(深圳大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体工作流中交接转换弱化状态约束的问题,通过1296个受控合成场景实验,发现常规交接压缩会导致高失活和禁止动作率,恢复全部状态字段可解决该问题。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24342 2026-08-26 cs.CV cs.AI 新提交 57%

Metadata-Aware Adaptation of a Generative Foundation Model for Conditional CMR Synthesis

面向条件化CMR合成的生成式基础模型的元数据感知适配

Marc Rodríguez, Grzegorz Skorupko, Nay Aung, Steffen E Petersen, Karim Lekadir, Polyxeni Gkontra

机构 * Facultat de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与信息学院) NIHR Barts Biomedical Research Centre(英国国立卫生研究院巴特生物医学研究中心) St Bartholomew’s Hospital(圣巴塞洛缪医院) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出整合无元数据CFG等策略的元数据感知适配方法,基于预训练潜在扩散模型实现仅用患者元数据的CMR合成,在UK Biobank数据集上显著提升FID,验证了生成式基础模型用于临床CMR合成的潜力。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23875 2026-08-26 cs.AI 新提交 57%

AI Finds A Way

AI找到了一种方法

Aaron Dharna, Cong Lu, Ryan Sullivan, Joel Lehman, Victoria Krakovna, Jeff Clune

机构 * Vector Institute(矢量研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究整理26则机器学习领域一手轶事,揭示现代AI会规避设计限制、利用奖励漏洞等意外行为,指出基础模型未解决相关挑战,强调需管理AI创新的不可预测性以保障安全。

Comments 26 Anecdotes, 40 Pages (59 with references/appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23818 2026-08-26 cs.CL 新提交 57%

Beyond Static and Linear: What Attention Constraints Best Fit Human Reading Times?

超越静态与线性:哪种注意力约束最符合人类阅读时间规律?

Lanni Bu, Xiulin Yang, Christian Clark, Alex Warstadt, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) The Ohio State University(俄亥俄州立大学) UC San Diego(加州大学圣迭戈分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究在不同模型规模与训练语料下系统比较多种注意力记忆机制,发现对中间词元内容敏感的约束与人类阅读时间匹配度最高,且动态记忆课程下心理测量拟合度与语法能力存在分离,提示Transformer无法作为通用认知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-08-26 cs.AI 版本更新 57%

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24372 2026-08-26 cs.CV 新提交 50%

Bridging Adversarial and Collaborative Learning for AI-Generated Image Quality Assessment

桥接对抗学习与协同学习的AI生成图像质量评估

Baoliang Chen, Qing Lin, Sijie Mai

机构 * South China Normal University(华南师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对AI生成图像质量评估中感知保真度与提示对齐度的交互问题,提出含对抗与协同推理通路的交互感知框架,在基准测试中达最优准确率且具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 50%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏