arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-02 至 2026-03-02 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2402.07462 2026-03-02 cs.AI cs.CY cs.LG cs.MA econ.TH 67%

A Hormetic Approach to the Value-Loading Problem: Preventing the Paperclip Apocalypse?

一种针对价值加载问题的激素方法:防止纸夹 apocalypse?

Nathan I. N. Henry, Mangor Pedersen, Matt Williams, Jamin L. B. Martin, Liesje Donkin

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 HALO通过激素分析方法解决价值加载问题,通过调节AI行为模式防止潜在的AI失控风险。

Comments 24 pages, 7 figures

Journal ref SN COMPUT. SCI. 6, 872 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23719 2026-03-02 cs.RO cs.AI 57%

SAGE-LLM: Towards Safe and Generalizable LLM Controller with Fuzzy-CBF Verification and Graph-Structured Knowledge Retrieval for UAV Decision

SAGE-LLM:面向安全且可泛化的LLM控制器,结合模糊-CBF验证和图结构知识检索用于无人机决策

Wenzhe Zhao, Yang Zhao, Ganchao Liu, Zhiyu Jiang, Dandan Ma, Zihao Li, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安 710072,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 SAGE-LLM通过模糊-CBF验证和图结构知识检索,提升无人机决策的安全性和泛化能力,无需在线训练即可在复杂环境中保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 57%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23896 2026-03-02 cs.RO 50%

TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving

TSC:基于拓扑条件的Stackelberg协调用于交互驾驶中的多智能体强化学习

Xiaotong Zhang, Gang Xiong, Yuanjing Wang, Siyu Teng, Alois Knoll, Long Chen

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Natural Sciences, University of Durham(达勒姆大学自然科学系) College of Civil and Transportation Engineering, Shenzhen University(深圳大学土木与交通工程学院) Chair of Robotics, Artificial Intelligence and Realtime Systems, Technical University of Munich(慕尼黑技术大学机器人、人工智能与实时系统教授职位)

专题命中 安全训练 :safety(abstract)

AI总结 TSC通过拓扑条件的Stackelberg协调方法,在无通信执行下实现密集交通中的去中心化多智能体强化学习,提升训练稳定性和安全性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏