arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 12 篇

2608.20999 2026-08-24 cs.CV 新提交 87%

Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs

潜在有序证据与未对齐输出:多模态大语言模型的推理时有序视角对齐

Haiming Li, Yingsheng Liu, Jingmin Zhu, Siyuan Yan, Xieji Li, Jiajun Sun, Zhen Yu, Zongyuan Ge

机构 * Monash University(莫纳什大学) Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)

专题命中 其他安全 :alignment(title,summary_cn)

AI总结 针对多模态大语言模型有序输出未对齐问题,本文提出推理时的Ordinal Lens Alignment方法,提升有序回归任务性能且优于现有基线。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28881 2026-08-24 cs.AI 版本更新 85%

Fragility of Value under Imperfect Alignment

不完美对齐下价值的脆弱性

Winter Cross, Léo Cymbalista, Alfred Harwood, Jose Faustino

专题命中 其他安全 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。

Comments 25 pages, 7 figures. Expanded the contribution statements and added three researchers as coauthors. Made small text improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20864 2026-08-24 cs.AI 新提交 79%

Coverage-Driven Verification for Safety-by-Design in AI-Based Collision Avoidance Systems

基于覆盖率的AI防撞系统设计安全验证

Thomas Stefani, Johann Maximilian Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对AI防撞系统的ODD代表性评估问题,提出采用Kullback-Leibler散度和Cramér's V的覆盖率驱动验证方法,契合EASA安全标准,为安全关键AI应用的设计安全提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20906 2026-08-24 eess.SY cs.MA cs.RO 新提交 78%

A Safety-Driven Architectural Framework for Fail-Operational Drone Swarms in Critical Missions

面向关键任务中故障可运行无人机集群的安全驱动架构框架

Luiz Giacomossi, Zafer Yigit, Marwan Shakarna, Shoaib Saleemi, Ivan Tomasic, Baran Çurüklü, Håkan Forsberg

专题命中 其他安全 :safety(title,abstract)

AI总结 针对安全关键操作中无人机集群的认证需求,提出结合SAE ARP4754B方法的混合关键度架构框架,通过硬件隔离的安全监控器实现飞行关键核心与集群管理器解耦,经马尔可夫建模可满足危险故障要求。

Comments 10 pages, 7 figures. Accepted for presentation at the 45th AIAA/IEEE Digital Avionics Systems Conference (DASC), Orlando, FL, USA, 2026. \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-24 cs.CV cs.IR 版本更新 78%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Chunyi Peng, Zhipeng Xu, Yukun Yan, Zhenghao Liu, Shi Yu, Sen Mei, Yubo Sun, Yongheng Zhang, Jie Zhou, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21948 2026-08-24 cs.CV 版本更新 78%

Deep Models, Shallow Alignment: Uncovering the Granularity Mismatch in Neural Decoding

深度模型,浅层对齐:揭示神经解码中的粒度不匹配

Yang Du, Siyuan Dai, Yonghao Song, Paul M. Thompson, Haoteng Tang, Liang Zhan

机构 * Dept. of Electrical & Computer Engineering, University of Pittsburgh, USA(宾夕法尼亚大学电气与计算机工程系) Dept. of Biomedical Engineering, Tsinghua University, China(清华大学生物医学工程系) Dept. of Neurology, University of Southern California, USA(美国南加州大学神经病学系) Dept. of Computer Science, University of Texas Rio Grande Valley, USA(德克萨斯理工大学里奥格兰德谷分校计算机科学系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出浅层对齐方法,通过对比学习策略解决神经解码中的粒度不匹配问题,显著提升解码性能。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 71%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M.C

专题命中 其他安全 :alignment(title)

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17850 2026-08-24 cs.HC cs.AI cs.CL cs.CY 版本更新 67%

Mind the Style: Impact of Communication Style on Human-Chatbot Interaction

注意风格:沟通风格对人机交互的影响

Erik Derner, Dalibor Kučera, Aditya Gulati, Ayoub Bagheri, Nuria Oliver

机构 * Czech Technical University in Prague(捷克技术大学(布拉格)) University of South Bohemia(南波西米亚大学) Utrecht University(乌得勒支大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了沟通风格对人机交互的影响,发现友好风格提升女性用户满意度和任务完成率,且用户较少模仿聊天机器人风格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21325 2026-08-24 cs.CL 新提交 57%

Move by Move: Measuring and Steering How LLMs Conduct Psychotherapy

逐步推进:测量与引导大语言模型开展心理治疗的方式

Afonso Baldo, Hugo Pitorro, Areti Vassilopoulos, Anabela C. Areias, Maya D'Eon, Fabíola Costa, Ricardo Rei, Nuno M. Guerreiro

机构 * Sword Health Yale University(耶鲁大学) Instituto Superior Técnico(高等技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出基于MULTI-60清单的10种治疗动作本体,对比大语言模型与人类临床医生的心理治疗动作分布,发现模型过度使用询问、忽视心理教育,通过公开该本体可提升模型与人类治疗师的动作对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19621 2026-08-24 cs.CL 版本更新 57%

Mitigating Identity Essentialism in LLM Agents with Longitudinal Life Trajectories

通过纵向生活轨迹缓解大语言模型智能体中的本质主义身份偏差

Hexi Wang, Yujia Zhou, Bangde Du, Weihang Su, Xinyuan Cao, Qingyi Pan, Qingyao Ai, Yueyue Wu, Min Zhang, Yiqun Liu

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对现有LLM智能体存在的身份本质主义偏差导致组内反应同质化的问题,提出LifeMem纵向记忆框架,在Add Health等数据集上验证其可提升与人类数据的一致性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20929 2026-08-24 cs.CV 新提交 50%

GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization

GAP-SAM:用于通用AI生成图像篡改定位的全局伪影先验

Haozhen Yan, Siyuan Shan, Zijian Yu, Youqi Wang, Yan Hong, Jun Lan, Jianfu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 本研究针对AI生成图像篡改定位的分布外性能问题,提出GAP-SAM方法,通过构建COCO-ControlNet对齐语义与几何,利用全局伪影标记抑制语义边界捷径,在六个数据集上平均像素F1达79.8,优于现有方法且在各类图像退化下表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20916 2026-08-24 cs.CV 新提交 50%

Semantically Compatible Knowledge Distillation for Cross-Domain Object Detection with Vision Foundation Models

基于视觉基础模型的跨域目标检测的语义兼容知识蒸馏

Qifeng Zhang, Ting Xiang, Zeyuan Bai, Changjian Chen

机构 * National Supercomputing Center in Changsha, Hunan University(湖南大学长沙国家超级计算中心)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对跨域目标检测中VFM的语义不兼容问题,提出SLE-T框架,通过适配DINOv2实现高效知识迁移,在DAOD基准上达到SOTA性能,且训练成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏