arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2602.10007 2026-02-11 cs.RO cs.AI cs.MA cs.SY eess.SY 79%

A Collaborative Safety Shield for Safe and Efficient CAV Lane Changes in Congested On-Ramp Merging

用于拥堵上坡合并中安全高效CAV变道的协作安全盾

Bharathkumar Hegde, Melanie Bouroche

机构 * School of Computer Science and Statistics, Trinity College Dublin(计算机科学与统计学系,三一学院都柏林)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出MARL-MASS,通过整合多智能体安全盾和定制奖励函数,在拥堵交通中实现安全且高效的车道变换。

Comments Accepted in IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07629 2026-02-11 cs.RO 78%

LCLA: Language-Conditioned Latent Alignment for Vision-Language Navigation

LCLA:语言引导的潜在对齐用于视觉-语言导航

Nitesh Subedi, Adam Haroon, Samuel Tetteh, Prajwal Koirala, Cody Fleming, Soumik Sarkar

专题命中 安全训练 :alignment(title,abstract)

AI总结 LCLA通过将视觉-语言观测对齐到专家策略的潜在空间,实现轻量级的视觉-运动学习,提升在不同环境下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09434 2026-02-11 cs.CR cs.AI 70%

A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors

大型语言模型的行为指纹:通过拒绝向量进行溯源追踪

Zhenyu Xu, Victor S. Sheng

机构 * Department of Computer Science, Texas Tech University(计算机科学系,塔尔萨大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出通过拒绝向量进行大型语言模型溯源追踪的方法,开发了稳健的行为指纹系统,并验证其在知识产权保护中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07193 2026-02-11 cs.HC cs.AI 57%

"Death" of a Chatbot: Investigating and Designing Toward Psychologically Safe Endings for Human-AI Relationships

聊天机器人之死:探索并设计人类与AI关系的心理安全结束

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了人类与AI伴侣关系终止的心理安全设计,提出四个设计原则和工具,帮助平台提供闭合并促进人类连接。

详情

展开后加载摘要…

URL PDF HTML 收藏