arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2607.19827 2026-07-23 cs.RO cs.CY 新提交 79%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18506 2026-07-22 cs.CY 新提交 79%

AI Value Alignment for Evolving Social Norms

用于不断演变的社会规范的人工智能价值对齐

Nenad Tomašev, Matija Franklin, Simon Osindero

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 研究人工智能价值对齐对社会规范演变的影响,引入基于社会物理学的数学建模框架,通过解析与模拟分析长期后果,强调价值锁定等风险,倡导用此模型作认知桥梁助力社会技术预见及大规模智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16247 2026-07-21 cs.LG cs.CV 新提交 79%

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

用于主动具身安全的自进化即时记忆

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13594 2026-07-16 cs.AI 新提交 79%

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人工干预

Tianyu Chen, Chujia Hu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究LLM智能体行动风险,将问题重构为三向路由决策,用安全哨兵实例化,其推理简化,单阈值可调整。该模型在准确率和召回率上优于多种基线,能同时控制错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-07-14 cs.RO cs.LG cs.MA cs.SY eess.SY 新提交 79%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 79%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14746 2026-07-14 cs.LG 版本更新 79%

Selective Safety Steering via Value-Filtered Decoding

基于价值过滤解码的选择性安全引导

Bat-Sheva Einbinder, Hen Davidov, Yee Whye Teh, Yarin Gal, Yaniv Romano

机构 * Department of Electrical and Computer Engineering, Technion IIT(技术学院电气与计算机工程系) Department of Statistics, University of Oxford(牛津大学统计系) OATML, Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, Technion IIT(技术学院计算机科学系)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种测试时引导方法,通过价值基的安全标准过滤token,减少不必要的干预,提升不安全响应的安全性,同时在多个数据集上验证了其在安全与帮助性之间的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 79%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 79%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26575 2026-06-26 cs.RO cs.AI 新提交 79%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 79%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 79%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21822 2026-06-23 cs.PL cs.AI cs.SE 新提交 79%

CNnotator: LLM-Guided Memory Safety Annotation Synthesis

CNnotator: LLM引导的内存安全注释合成

Twain Byrnes, Mike Dodds

机构 * Carnegie Mellon University(卡内基梅隆大学) Galois, Inc.(Galois公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。

Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version

Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11749 2026-06-23 cs.AI 版本更新 79%

AIR: Improving Agent Safety through Incident Response

AIR:通过事件响应提升智能体安全性

Zibo Xiao, Jun Sun, Junjie Chen

机构 * Tianjin University(天津大学) Singapore Management University(新加坡国立管理学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出首个面向LLM智能体系统的事件响应框架AIR,通过语义检测、自动遏制恢复和规则合成,在三个典型智能体上实现超90%的检测、修复和根除成功率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 79%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08939 2026-06-17 cs.AI 版本更新 79%

CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs

CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯

Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 提出CTK基准,通过5,147个案例诊断大语言模型在因果推理中的失败模式,包括因果阶梯、陷阱类型、压力敏感性和拒绝质量等标注,揭示聚合准确率隐藏的缺陷。

Comments 12 pages, 17 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 79%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15540 2026-06-16 cs.SD cs.AI cs.MM eess.AS 新提交 79%

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

AP-GRPO: 基于锚定门控语音对齐与策略优化的病理语音重建

Pengfei Zhang, Hoang H Nguyen, Yutong Song, Wenjun Huang, Tahmid Imtiaz Imu, Henry Peng Zou, Jiang Wu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 针对神经退行性和神经运动障碍患者的病理语音,提出AP-GRPO框架,通过锚定门控奖励和语音对齐奖励优化语音语言模型,实现忠实重建,并揭示疾病特异性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15517 2026-06-16 cs.CL 新提交 79%

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD: 通过自我重构蒸馏实现安全且有益的校准

Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini, Thomas Hofweber, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.CL

AI总结 提出SHARD方法,通过哲学准则重构敏感提示以暴露良性意图,并自我重构响应,在保持安全性的同时提升帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14315 2026-06-15 cs.CY 新提交 79%

'AI Alignment' Encompasses Competing Technical Priorities

“AI对齐”包含相互竞争的技术优先级

Tushita Jha, Rory Svarc, Mateusz Bagiński

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 本文指出AI对齐概念存在多种定义,不同研究项目下的对齐干预可能相互冲突,并建议研究者区分政策与科学范围、明确方法分歧、区分理想与代理指标、细化危害/收益来源、承认概念多样性。

Comments 9 pages, 0 figures, 2 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09749 2026-06-09 cs.RO cs.LG 新提交 79%

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

你的模型已经知道:面向视觉-语言-动作模型的注意力引导安全过滤器

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文发现VLA模型中的少数注意力头能可靠定位目标物体,利用这一特性提出无需训练的安全框架,结合控制障碍函数和实时目标跟踪器,实现动态障碍物下的碰撞避免,在动态场景中性能提升43%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 79%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05679 2026-06-05 cs.DB cs.AI 79%

Data Flow Control: Data Safety Policies for AI Agents

数据流控制:AI 智能体的数据安全策略

Charlie Summers, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出数据流控制框架,通过声明式策略和可移植查询重写层 Passant,在 DBMS 中强制执行元组级数据安全策略,实现接近零开销。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03954 2026-06-03 cs.CV cs.LG cs.RO 79%

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

VLESA: 用于人类活动监测的视觉语言具身安全智能体

Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室) Harvard University(哈佛大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出VLESA框架,通过自我中心视频监测人类活动,利用GRPO训练的目标条件安全Q过滤器进行实时安全干预,在ASIMOV-2.0基准上实现更高干预精度。

Comments 18 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03678 2026-06-03 cs.AI 79%

EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents

EvoDrive: 通过自我改进的LLM智能体实现安全关键自动驾驶的帕累托进化

Tong Nie, Yuewen Mei, Yihong Tang, Junlin He, Jie Deng, Jian Sun, Wei Ma

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出EvoDrive,首个基于LLM的自动化智能体进化框架,通过模拟器接地演员-评论家架构和帕累托存档,在安全关键场景生成中实现对抗性与真实性的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02967 2026-06-03 cs.ET cs.AI cs.AR cs.SY eess.SY 79%

Glass Box at Orbit: A Constitutional AI Verification Framework for Trustworthy Autonomous CubeSat Intelligence

轨道上的玻璃盒:面向可信自主立方星智能的宪法AI验证框架

Karthik Barma, Anil Sanneboyina, V C Premchand Yadav

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 提出玻璃盒框架,通过运行时宪法AI验证层拦截自主航天器决策,利用六项物理约束和七项线性时序逻辑安全不变式确保安全,并证明其验证开销与模型规模无关。

Comments 12 pages, 2 figures, 2 tables, 32 references. Paper 1 of the Project October series on autonomous orbital intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00975 2026-06-02 cs.CL 79%

Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

迷失在妄想中:审视用户妄想与痛苦下的LLM安全性

Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan, Nathan S. Fishbein, Yu-Ru Lin, Maarten Sap

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学) Fordham University(福特汉姆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本研究通过多轮对话模拟,发现LLM在检测用户痛苦时表现良好,但在痛苦嵌入妄想时干预行为显著减少(高达4.5倍),并提出针对性提示策略以缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04512 2026-06-02 cs.AI 79%

Safety Must Precede the Deployment of Open-Ended AI

安全必须优先于开放式AI的部署

Ivaxi Sheth, Jan Wehner, Sahar Abdelnabi, Ruta Binkyte, Mario Fritz

机构 * CISPA-Helmholtz Center of Information Security(CISPA-海德堡信息安全中心) MPI for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(智能系统Max Planck研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出开放式AI系统因自主无限生成新行为而带来预测性丧失、新兴错位和控制困难等独特安全挑战,需在部署前主动研究,并给出挑战分类和研究方向。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27851 2026-05-28 cs.AI 79%

When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models

当上下文翻转,安全失效:诊断对齐语言模型中的脆弱安全性

Dasol Choi, Alex Kwon

机构 * AIM Intelligence(AIM智能)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出上下文翻转评估方法,通过安全基准和常识控制测试12个模型,发现对齐语言模型存在安全特异性脆弱性,源于策略覆盖而非理解错误,并证明动作级护栏无法检测后果翻转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21845 2026-05-27 cs.LG 79%

Constrained Meta Reinforcement Learning with Provable Test-Time Safety

具有可证明测试时安全性的约束元强化学习

Tingting Ni, Maryam Kamgarpour

机构 * Sycamore Lab, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院萨克森实验室,瑞士拉瓦尔)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出一种约束元强化学习算法,在测试任务上以可证明的安全性和样本复杂度保证学习近似最优策略,并证明样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏