arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-01 至 2025-12-01 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 12 篇

2511.21718 2025-12-01 cs.CL 85%

When Harmless Words Harm: A New Threat to LLM Safety via Conceptual Triggers

有害词语的危害:通过概念触发器对LLM安全性的新威胁

Zhaoxin Zhang, Borui Chen, Yiming Hu, Youyang Qu, Tianqing Zhu, Longxiang Gao

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出MICM方法,通过概念触发器针对LLM的价值结构进行劫持,揭示了现有安全机制对隐含价值观操控的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23174 2025-12-01 cs.CL 83%

Are LLMs Good Safety Agents or a Propaganda Engine?

LLMs是安全代理还是宣传引擎?

Neemesh Yadav, Francesco Ortu, Jiarui Liu, Joeun Yook, Bernhard Schölkopf, Rada Mihalcea, Alberto Cazzaniga, Zhijing Jin

机构 * SMU University of Trieste(特里este大学) AREA Science Park(AREA科学园) CMU(卡内基梅隆大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) MPI for Intelligent Systems(智能系统研究所) University of Michigan(密歇根大学)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文通过PSP数据集研究LLMs在政治敏感内容上的拒绝行为,发现大多数模型存在审查倾向,并分析了影响拒绝分布的关键因素。

Comments 15 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22738 2025-12-01 cs.LG cs.CR 79%

ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning

ShieldAgent: 通过可验证的安全策略推理实现安全代理

Zhaorun Chen, Mintong Kang, Bo Li

机构 * University of Chicago, Chicago IL, USA(芝加哥大学) University of Illinois at Urbana-Champaign, Champaign IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 ShieldAgent通过逻辑推理实现对代理动作轨迹的安全策略合规性,有效提升代理防护性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23300 2025-12-01 cs.RO 67%

SafeHumanoid: VLM-RAG-driven Control of Upper Body Impedance for Humanoid Robot

SafeHumanoid: 通过VLM-RAG驱动的人形机器人上半身阻抗控制

Yara Mahmoud, Jeffrin Sam, Nguyen Khang, Marcelino Fernando, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Artem Lykov, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛尔沃科学与技术研究所)

专题命中 安全训练 :safety(abstract);trustworthy(abstract)

AI总结 SafeHumanoid通过VLM-RAG结合自身视觉,实现人形机器人上半身阻抗控制,提升人机交互的安全性与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23311 2025-12-01 cs.CV cs.AI cs.CL 62%

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach

迈向自动安全驾驶指令:一种大规模视觉语言模型方法

Haruki Sakajo, Hiroshi Takato, Hiroshi Tsutsui, Komei Soda, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Teatis inc.(Teatis公司) Queensland university of technology(昆士兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。

Comments Accepted to MMLoSo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23315 2025-12-01 cs.LG 57%

Emergent Coordination and Phase Structure in Independent Multi-Agent Reinforcement Learning

独立多智能体强化学习中的涌现协调与相结构

Azusa Yamaguchi

机构 * School of Physics and Astronomy University of Edinburgh(物理与天文学学院 英格兰爱丁堡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究通过分析独立多智能体强化学习中的协调与相结构,揭示了规模、密度和内核漂移之间的相互作用对多智能体学习系统动态的影响。

Comments 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23193 2025-12-01 cs.RO cs.LG cs.SY eess.SY 57%

Fault-Tolerant MARL for CAVs under Observation Perturbations for Highway On-Ramp Merging

面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法

Yuchen Shi, Huaxin Pei, Yi Zhang, Danya Yao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法,通过对抗性扰动生成和故障容忍智能体设计,提升协同驾驶系统的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22737 2025-12-01 cs.AI cs.HC 57%

Agentic AI Framework for Individuals with Disabilities and Neurodivergence: A Multi-Agent System for Healthy Eating, Daily Routines, and Inclusive Well-Being

具有残疾和神经多样性个体的代理AI框架:一个用于健康饮食、日常习惯和包容性福祉的多代理系统

Salman Jan, Toqeer Ali Syed, Gohar Ali, Ali Akarma, Mohammad Riyaz Belgaum, Ahmad Ali

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种多代理系统,通过个性化营养、适应性调度、食品指导和生理监测等代理,为残疾和神经多样性个体提供健康饮食、日常习惯和包容性福祉的AI框架。

Comments Presented at International Conference on Business and Digital Technology, Bahrain, Springer Nature, 27 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22312 2025-12-01 cs.CL 57%

Token-Level Marginalization for Multi-Label LLM Classifiers

标记级边际化用于多标签LLM分类器

Anjaneya Praharaj, Jaykumar Kasundra

机构 * ServiceNow

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出三种标记级概率估计方法,提升生成模型在多标签内容安全分类中的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21395 2025-12-01 cs.CV cs.AI 57%

Monet: Reasoning in Latent Visual Space Beyond Images and Language

Monet: 在图像和语言之外的潜在视觉空间推理

Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, Yisen Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Amazon AGI SF Lab(Amazon AGI SF实验室) MIT(麻省理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Monet通过在潜在视觉空间中直接推理,提升多模态大语言模型的视觉推理能力,解决了潜在-视觉对齐和嵌入监督不足的问题,展示了在现实世界和抽象视觉任务中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO 50%

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12099 2025-12-01 cs.CV 50%

TinyRS-R1: Compact Multimodal Language Model for Remote Sensing

TinyRS-R1:用于遥感的紧凑多模态语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)

专题命中 安全训练 :alignment(abstract)

AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。

Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS

详情

展开后加载摘要…

URL PDF HTML 收藏