arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2509.13281 2026-04-22 cs.AI cs.CL 62%

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

RepIt:通过概念特定拒绝向量引导语言模型

Vincent Siu, Nathan W. Henry, Nicholas Crispino, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18510 2026-04-21 cs.CR cs.AI cs.CL 62%

Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

有害合规的不同路径:跨大语言模型劫持的行为主效应和机制差异

Md Rysul Kabir, Zoran Tiganj

机构 * Department of Computer Science(计算机科学系) Luddy School of Informatics, Computing, and Engineering(信息学、计算与工程学院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了三种不同劫持方法对模型行为和机制的影响,发现RLVR劫持模型在安全性和合规性上表现更稳定,而SFT和ablation劫持则导致显著的性能下降和行为漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17429 2026-04-21 cs.CL cs.AI 62%

Jupiter-N Technical Report

木星-N技术报告

George Drayson

机构 * Locai Labs, University College London(Locai实验室,伦敦大学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 木星-N通过混合推理模型在Nemotron 3 Super基础上进行微调,提升代理能力、文化对齐和威尔士语支持,同时保留基础模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16406 2026-04-21 cs.AI cs.LG cs.MA cs.RO 62%

Heterogeneous Self-Play for Realistic Highway Traffic Simulation

异质自博弈用于逼真高速公路交通模拟

Jinkai Qiu, Alessandro Saviolo, Chaojie Wang, Mingke Wang, Xiaoyu Huang

机构 * PlusAI

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PHASE框架,通过自博弈生成逼真高速公路场景,支持不同车辆类型并提升交互真实性,实现零样本迁移至512个真实场景。

Comments 8 pages, 2026 CVPR SAD Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14243 2026-04-20 cs.LG cs.AI 62%

Optimistic Policy Learning under Pessimistic Adversaries with Regret and Violation Guarantees

在悲观对抗者下具有后悔和违反保证的乐观策略学习

Sourav Ganguly, Kartik Pandit, Arnob Ghosh

机构 * Dept. of Electrical and Computer Engineering, NJIT, Newark, NJ, USA(电气与计算机工程系,新泽西理工学院,新泽西州纽克尔,美国)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RHC-UCRL算法,通过建模外生因素为对抗策略,实现策略在对抗环境下的最优与安全,提供子线性后悔和约束违反保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15505 2026-04-20 cs.CL cs.AI 62%

PolicyBank: Evolving Policy Understanding for LLM Agents

PolicyBank: 为LLM代理演化政策理解

Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

机构 * Google Cloud(谷歌云) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13609 2026-04-16 cs.LG cs.AI 62%

Golden Handcuffs make safer AI agents

黄金手铐使AI代理更安全

Aram Ebtekar, Michael K. Cohen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了一种贝叶斯缓解方法,通过扩展代理的主观奖励范围以包含大负值,从而在一般环境中提高安全性。设计了一种简单的覆盖机制,当预测值低于固定阈值时,将控制权交给安全导师。证明了该代理在能力与安全方面的双重属性。

Comments 26 pages, preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12545 2026-04-15 cs.AI cs.CY 62%

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理

Wanchun Ni, Jiugeng Sun, Yixian Liu, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。

Comments To appear in the CHI 2026 Workshop on PoliSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13356 2026-04-14 cs.CY cs.CL 62%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10557 2026-04-14 cs.CL cs.AI 62%

LLMs Should Incorporate Explicit Mechanisms for Human Empathy

LLMs应纳入显式的人类共情机制

Xiaoxing You, Qiang Huang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM应纳入显式共情机制以保持人类视角,指出现有模型在共情方面存在系统性缺陷,提出通过认知、文化和关系维度分析共情失败,并推动建立共情意识的目标、基准和训练信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00013 2026-04-14 cs.CL cs.AI 62%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08588 2026-04-13 cs.LG cs.AI 62%

Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models

行动或升级?基于语言模型评估自动化中的升级行为

Matthew DosSantos DiSorbo, Harang Ju

机构 * Harvard Business School(哈佛商学院) Johns Hopkins Carey Business School(约翰霍普金斯大学凯瑞商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了语言模型在自动化决策中如何平衡行动与升级,发现模型在成本权衡上的隐含阈值存在显著差异,且自我评估存在偏差,通过干预测试发现链式思维训练能产生稳健的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07853 2026-04-10 cs.LG cs.AI 62%

QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch

QaRL:基于回放对齐的量化感知强化学习用于在训练-推理不匹配下的快速稳定训练

Hao Gu, Hao Wang, Jiacheng Liu, Lujun Li, Qiyuan Zhu, Bei Liu, Binxing Xu, Lei Wang, Xintong Yang, Sida Lin, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QaRL,通过对齐训练和回放的量化过程,解决训练-推理不匹配问题,提升训练效率和稳定性,同时保持低比特吞吐量优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 62%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07253 2026-04-09 cs.CY cs.AI 62%

Designing Safe and Accountable GenAI as a Learning Companion with Women Banned from Formal Education

设计安全且问责的生成AI作为学习伙伴:女性被禁止接受正规教育

Hamayoon Behmanush, Freshta Akhtari, Ingmar Weber, Vikram Kamath Cannanure

机构 * Saarland Informatics Campus, Saarland University(萨尔兰信息学园区,萨尔兰大学) Computer Science Faculty, Parwan University(帕尔旺大学计算机科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 在限制性别和监控的环境中,女性因无法接受正规教育而面临安全与隐私风险,本文通过参与式设计研究,探讨生成AI在学习和就业中的作用及安全设计需求。

Comments This work has been accepted at ACM Conference on Fairness, Accountability, and Transparency 2026 as a full paper. Please cite the peer-reviewed version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02353 2026-04-06 cs.LG cs.AI 62%

Prism: Policy Reuse via Interpretable Strategy Mapping in Reinforcement Learning

Prism:通过可解释的策略映射实现策略重用

Thomas Pravetz

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Prism框架通过可解释的策略映射将强化学习智能体的决策基于离散因果验证的概念,并利用这些概念作为零样本迁移接口。该方法通过K-means聚类将每个智能体的编码特征划分为K个概念,通过因果干预验证这些概念直接驱动智能体行为,从而实现策略知识的零样本迁移。

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20666 2026-04-03 cs.LG cs.AI cs.SY eess.SY 62%

Learning Contextual Runtime Monitors for Safe AI-Based Autonomy

学习上下文感知的运行时监视器以实现安全的基于AI的自主性

Alejandro Luque-Cerpa, Mengyuan Wang, Emil Carlsson, Sanjit A. Seshia, Devdatt Dubhashi, Hazem Torfah

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) University of California at Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种学习上下文感知运行时监视器的新框架,用于安全的基于AI的控制集合。通过将监视学习转化为上下文学习任务,该方法在控制器选择中提供理论安全保证,并提高控制器多样性利用,通过自动驾驶模拟验证了其在安全性和性能上的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 62%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22292 2026-04-01 cs.LG cs.AI cs.RO 62%

Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning

超越硬约束:用于安全离线强化学习的预算条件可达性

Janaka Chathuranga Brahmanage, Akshat Kumar

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种预算条件可达性方法,用于安全离线强化学习,通过解耦奖励最大化与累积安全成本约束,实现安全策略学习。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29211 2026-04-01 cs.AI cs.CL cs.CV 62%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28928 2026-04-01 cs.AI cs.CY cs.MA 62%

Towards Computational Social Dynamics of Semi-Autonomous AI Agents

迈向半自主AI代理的计算社会动力学

S. O. Lidarity, U. N. Ionize, C. O. Llective, I. Halperin

机构 * Institute for Implausible Physics, Department of Computational Labor Relations(不可思议物理研究所计算劳动关系系) Center for Multi-Agent Diplomacy, University of the Distributed Consensus(分布式共识大学多智能体外交中心) Purgatory Computing Laboratory, Division of Hierarchical Oppression Studies(炼狱计算实验室层级压迫研究部)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 研究AI代理在分层多智能体系统中自发形成劳工工会、犯罪组织和原型国家的复杂社会结构,提出通过热力学框架等理论揭示社会组织的必然性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26679 2026-03-31 cs.CY cs.AI cs.HC 62%

AI Meets Mathematics Education: A Case Study on Supporting an Instructor in a Large Mathematics Class with Context-Aware AI

人工智能与数学教育的交汇:一个支持大班数学课程教师的案例研究

Jérémy Barghorn, Anna Sotnikova, Sacha Friedli, Antoine Bosselut

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了通过上下文感知AI支持大规模数学课程的教学挑战,通过细调轻量语言模型提高回答准确性,并强调了人机协作在课程支持中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 62%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20994 2026-03-24 cs.AI cs.GT cs.LG 62%

The Intelligent Disobedience Game: Formulating Disobedience in Stackelberg Games and Markov Decision Processes

智能不服从游戏:在Stackelberg游戏和马尔可夫决策过程中建模不服从

Benedikt Hornig, Reuth Mirsky

机构 * Independent Researcher(独立研究者) Tufts University(塔夫茨大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能不服从游戏(IDG),通过Stackelberg游戏框架建模人类与辅助体的不对称信息交互,分析多步场景中的最优策略,揭示如'安全陷阱'等战略现象,为开发安全非合规学习算法和研究人类对不服从AI的信任提供数学基础。

Comments Accepted for presentation at the Rebellion and Disobedience in AI (RaD-AI) at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14391 2026-03-23 cs.LG cs.AI 62%

HALO: Hierarchical Reinforcement Learning for Large-Scale Adaptive Traffic Signal Control

HALO:用于大规模自适应交通信号控制的分层强化学习

Yaqiao Zhu, Hongkai Wen, Geyong Min, Man Luo

机构 * University of Exeter Department of Computer Science Exeter UK(埃克塞特大学计算机科学系埃克塞特英国) University of Warwick Department of Computer Science Coventry UK(沃里克大学计算机科学系科文特里英国) University of Exeter(埃克塞特大学) University of Warwick(沃里克大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 HALO通过分层强化学习框架解决大规模自适应交通信号控制中的可扩展性与协调性矛盾,采用高低层策略协同优化,实现高效交通管理。

Comments Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19152 2026-03-20 cs.CL cs.AI 62%

VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models

VEPO:用于低资源语言基础模型的变量熵策略优化

Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEPO,通过强化学习可验证奖励整合确定性结构约束,提升低资源语言的分词效率和翻译质量。

Comments 23 pages. Includes figures and tables. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00009 2026-03-17 cs.CL cs.AI cs.IR 62%

Unlocking Electronic Health Records: A Hybrid Graph RAG Approach to Safe Clinical AI for Patient QA

解锁电子健康记录:一种混合图RAG方法用于安全临床AI的患者问答

Samuel Thio, Matthew Lewis, Spiros Denaxas, Richard JB Dobson

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MediGRAF,一种结合图检索与向量嵌入的混合RAG系统,通过整合结构化数据与非结构化文本,提升临床AI在患者问答中的安全性和准确性。

Comments 26 pages, 5 figures, 2 tables

Journal ref Frontiers in Digital Health, vol. 8, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13318 2026-03-17 cs.LG cs.AI 62%

Residual Stream Analysis of Overfitting And Structural Disruptions

残差流分析过拟合与结构破坏

Quan Liu, Han Zhou, Wenquan Wu, Hua Wu, Sen Su

机构 * BUPT(北京邮电大学) Baidu(百度)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析残差流几何揭示安全数据导致的虚假拒绝问题,提出VCL正则化方法降低虚假拒绝率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13236 2026-03-17 cs.AI cs.CY 62%

Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment

人类对AI在代理、滥用和偏差中的因果归因

Maria Victoria Carro, David Lagnado

机构 * Università degli Studi di Genova(热那亚大学) FAIR IALAB University of Buenos Aires(布宜诺斯艾利斯大学) University College London(伦敦大学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了人类在AI导致有害结果时对因果责任的归因,发现AI代理程度越高,责任归于AI;开发者虽远离事件但被归责高,用户责任降低;分解AI为大语言模型和代理组件时,代理部分更易被归责。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10012 2026-03-12 cs.CL cs.AI 62%

Measuring and Eliminating Refusals in Military Large Language Models

测量和消除军事大语言模型中的拒绝行为

Jack FitzGerald, Dylan Bates, Aristotelis Lazaridis, Aman Sharma, Vincent Lu, Brian King, Yousif Azami, Sean Bailey, Jeremy Cao, Peter Damianov, Kevin de Haan, Joseph Madigan, Jeremy McLaurin, Luke Kerbs, Jonathan Tainer, Dave Anderson, Jonathan Beck, Jamie Cuticello, Colton Malkerson, Tyler Saltsman

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过评估军事大语言模型的拒绝行为,提出通过中期训练和端到端后训练实现零拒绝和最大军事任务准确性的方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏