arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2605.25893 2026-05-26 cs.AI 79%

$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing

$D^2$-Monitor: 通过犹豫感知路由实现扩散LLM的动态安全监控

Aoxi Liu, Yupeng Chen, James Oldfield, Guanzhe Hong, Junchi Yu, Baoyuan Wu, Philip Torr, Adel Bibi

机构 * Torr Vision Group, University of Oxford(奥克斯大学托尔视觉组) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对扩散大语言模型的安全监控问题,提出基于犹豫感知路由的双层动态监控框架$D^2$-Monitor,通过轻量级探针实时估计犹豫度并触发高容量探针,在3个数据集上以0.85M参数达到最优性能与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24862 2026-05-26 cs.LG 79%

Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets

统一跨域离线强化学习中异构数据集的价值对齐与价值分配

Zhongjian Qiao, Jiafei Lyu, Chenjia Bai, Peisong Wang, Siyang Gao, Shuang Qiu

机构 * City University of Hong Kong Tencent Institute of Artificial Intelligence (TeleAI), China Telecom Institute of Automation, Chinese Academy of Sciences. Corresponding Author

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 针对异构跨域离线强化学习中价值误分配问题,提出V2A方法,通过时间一致模态表示学习和模态感知优势学习统一动力学对齐、价值对齐与价值分配,显著提升策略性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24414 2026-05-26 cs.AI 79%

JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data

JT-SAFE-V2:具有世界上下文数据的安全设计基础模型

Junlan Feng, Fanyu Meng, Chong Long, Pengyu Cong, Duqing Wang, Yan Zheng, Yuyao Zhang, Xuanchang Gao, Ye Yuan, Yunfei Ma, Zhijie Ren, Fan Yang, Na Wu, Di Jin, Chao Deng

机构 * JIUTIAN Research(九天研究院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出JT-Safe-V2大语言模型,通过世界知识预训练、高确定性训练和安全强化后训练实现通用智能与安全设计的联合优化,并引入Safe-MoMA框架降低推理成本,在通用智能和安全基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11768 2026-05-20 cs.AI 79%

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework

在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架

Chingkwun Lam, Jiaxin Li, Lingfei Zhang, Kuo Zhao

机构 * College of Intelligent Science and Engineering(智能科学与工程学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21484 2026-05-20 cs.LG 79%

ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment

ETS: 为无训练强化学习对齐的能耗引导测试时缩放

Xiuyu Li, Jinkai Zhang, Mingyang Yi, Yu Li, Longqiang Wang, Yue Wang, Ju Fan

机构 * Renmin University of China, Beijing, China(中国人民大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种无需训练的推理方法,直接从最优强化学习策略中采样,通过结合参考策略模型和能耗项来改进掩码语言模型的过渡概率,并通过在线蒙特卡洛方法估计关键能耗项,从而提高生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24470 2026-05-20 cs.RO cs.AI 79%

Foundation models on the bridge: Semantic hazard detection and safety maneuvers for maritime autonomy with vision-language models

桥梁上的基础模型:基于视觉-语言模型的语义危险检测与安全操作用于海上自主性

Kim Alexander Christensen, Andreas Gudahl Tufte, Alexey Gusev, Rohan Sinha, Milan Ganai, Ole Andreas Alsos, Marco Pavone, Martin Steinert

机构 * Dept. of Mechanical and Industrial Engineering, NTNU(机械与工业工程系,挪威科技大学) Dept. of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 安全训练 :safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉-语言模型的语义危险检测与安全操作方法,用于满足IMO草案MASS代码对海上自主船舶的要求,通过快速-慢速异常管道和短时间范围的人类可覆盖回退操作来实现,在40个港口场景中验证了该方法的性能。

Comments 17 pages without bibliography or appendix. The main paper has 16 figures. Paper webpage can be found at https://kimachristensen.github.io/bridge_policy/

Journal ref Ocean Engineering 359, Part 3 (2026), Article 124646

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18842 2026-05-20 cs.LG 79%

Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints

在非平稳环境下通过自适应安全约束实现安全的持续强化学习

Timofey Tomashevskiy

机构 * McMaster Centre for Software Certification(麦斯特软件认证中心) Department of Computing and Software(计算与软件系) McMaster University(麦斯特大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出了一种结合三种自适应安全机制的框架,用于在非平稳环境下实现安全的持续强化学习,通过自适应约束机制减少分布偏移下的安全违规,同时保持任务性能。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01507 2026-05-12 cs.AI 79%

MILD: Mediator Agent System with Bidirectional Perception and Multi-Layered Alignment for Human-Vehicle Collaboration

MILD:具有双向感知和多层对齐的中介代理系统用于人车协作

Jiyao Wang, Yunbiao Wang, Yubo Jiao, Xiao Yang, Dengbo He, Sasan Jafarnejad, Luis Miranda-Moreno, Raphael Frank, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Interdisciplinary Centre for Security, Reliability and Trust, University of Luxembourg(卢森堡大学安全、可靠与信任跨学科中心)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文提出MILD系统,通过双向感知和多层对齐提升人车协作效率,采用ECPO算法确保策略符合安全规范和人类价值观,实验证明其在感知准确性和策略质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06992 2026-05-11 cs.LG stat.ML 79%

Why Does Agentic Safety Fail to Generalize Across Tasks?

为何代理安全无法跨任务泛化?

Yonatan Slutzky, Yotam Alexander, Tomer Slor, Yoav Nagel, Nadav Cohen

机构 * Some Institute(某些研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文探讨了代理安全在多任务场景中泛化失败的原因,指出安全要求使任务与安全执行的关系更为复杂,通过理论和实验表明需新的方法提升安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27358 2026-05-01 cs.AI 79%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27166 2026-05-01 cs.LG cs.GT 79%

Distributional Alignment Games for Answer-Level Fine-Tuning

分布对齐博弈用于答案级微调

Mehryar Mohri, Jon Schneider, Yifan Wu

机构 * Google Research(谷歌研究) Microsoft Research(微软研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17342 2026-04-30 cs.LG 79%

A Survey of Safe Reinforcement Learning and Constrained MDPs: A Technical Survey on Single-Agent and Multi-Agent Safety

安全强化学习与约束马尔可夫决策过程的综述:单智能体和多智能体安全的技术综述

Ankita Kushwaha, Kiran Ravish, Preeti Lamba, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, India(国际信息科技研究所,印度海得拉巴) Meta SuperIntelligence, USA(Meta超智能,美国)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文综述了安全强化学习和约束马尔可夫决策过程,涵盖单智能体和多智能体安全方法,总结了理论基础和最新算法,并提出五个开放性问题以推动该领域发展。

Comments 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08484 2026-04-28 cs.AI 79%

Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models

像软件一样修补大语言模型:一种轻量级方法用于改进大语言模型的安全策略

Huzaifa Arif, Keerthiram Murugesan, Ching-Yun Ko, Pin-Yu Chen, Payel Das, Alex Gittens

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种轻量级方法,通过在现有模型前添加可学习的前缀来快速修复大语言模型的安全漏洞,该方法在毒性缓解、偏见减少和有害性拒绝等关键领域实现了与新一代安全对齐模型相当的安全提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16968 2026-04-21 cs.CL 79%

On Safety Risks in Experience-Driven Self-Evolving Agents

经验驱动自演化代理中的安全风险

Weixiang Zhao, Yichen Zhang, Yingshuo Wang, Yang Deng, Yanyan Zhao, Xuda Zhi, Yongbo Huang, HaoHe, Wanxiang Che, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理大学) SERES

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究经验积累与利用对自演化代理在网页和具身环境中的安全性能影响,揭示经验驱动导致的安全性下降及安全-效用权衡问题。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13878 2026-04-17 cs.LG 79%

Drowsiness-Aware Adaptive Autonomous Braking System based on Deep Reinforcement Learning for Enhanced Road Safety

基于深度强化学习的清醒意识自适应自动刹车系统:提升道路安全

Hossem Eddine Hafidi, Elisabetta De Giovanni, Teodoro Montanaro, Ilaria Sergi, Massimo De Vittorio, Luigi Patrono

机构 * University of Salento(萨勒诺大学) Istituto Italiano di Tecnologia(意大利技术研究院) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的自适应自动刹车系统,结合车辆动力学与驾驶员生理数据,通过ECG信号检测清醒状态,提升道路安全。

Comments 16 pages, 12 figures. Under review at IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12500 2026-04-15 cs.LG cs.CR 79%

Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

安全训练调节策略下在策略强化学习中的有害对齐问题,但方向取决于环境设计

Leon Eshuijs, Shihan Wang, Antske Fokkens

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Utrecht University(埃因霍温大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究探讨了在策略强化学习中安全训练如何调节有害对齐问题,发现模型大小在不同环境中起到安全缓冲作用,且环境设计特征影响方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08439 2026-04-15 cs.AI 79%

Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance

自动驾驶中的数据集安全:要求、风险与保证

Alireza Abbaspour, Tejaskumar Balgonda Patil, B Ravi Kiran, Russel Mohr, Senthil Yogamani

机构 * Qualcomm Inc(高通公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种结构化框架,用于开发符合ISO/PAS 8800指南的安全生产数据集,通过AI感知系统案例,介绍AI数据飞轮和数据集生命周期,涵盖数据收集、标注、整理与维护,并定义安全要求和验证策略以确保符合安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09521 2026-04-13 cs.IT cs.AI math.IT 79%

Semantic Rate-Distortion for Bounded Multi-Agent Communication: Capacity-Derived Semantic Spaces and the Communication Cost of Alignment

语义率-失真:受限多智能体通信的容量导出语义空间及对齐成本

Anthony T. Nixon

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究多智能体在受限通信下的语义率-失真问题,提出基于容量导出的语义空间,并探讨通信对齐的成本与结构相变。

Comments 34 pages, 13 figures. Code: https://github.com/alch3mistdev/semantic-rate-distortion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 79%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07645 2026-04-03 cs.SE cs.AI cs.CR 79%

A Self-Improving Architecture for Dynamic Safety in Large Language Models

为大语言模型动态安全设计的自改进架构

Tyler Slater

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出自改进安全框架SISF,通过反馈循环实现LLM系统在运行时自动检测安全故障并生成防御策略,实验显示其能有效降低攻击成功率,提升系统鲁棒性。

Comments Under review at the journal Information and Software Technology (Special Issue on Software Architecture for AI-Driven Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00228 2026-04-02 cs.CL 79%

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

语言模型是否知道何时会拒绝?探测安全边界内的自我意识

Tanay Gondil

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型能否准确预测自身拒绝行为,通过系统分析发现模型在安全边界处敏感度下降,且通过置信度评分可提升安全部署的准确性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI 79%

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14723 2026-03-17 cs.CL 79%

Beyond Creed: A Non-Identity Safety Condition A Strong Empirical Alternative to Identity Framing in Low-Data LoRA Fine-Tuning

超越信仰:一种非身份安全条件:低数据LoRA微调中强经验性替代身份框架的非身份条件

Xinran Zhang

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了低数据LoRA安全微调中四种监督格式对安全性能的影响,发现非身份条件D在三个模型家族中表现最佳,挑战了身份框架假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 79%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 79%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23279 2026-02-27 cs.CY 79%

Safety First: Psychological Safety as the Key to AI Transformation

安全优先:心理安全是人工智能转型的关键

Aaron Reich, Diana Wolfe, Matt Price, Alice Choe, Fergus Kidd, Hannah Wagner

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 研究发现心理安全是员工采用人工智能工具的关键因素,但不影响其使用频率和持续时间,强调需区分采用与持续使用,推动早期AI实施的针对性干预。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17306 2026-02-26 cs.CL 79%

Refusal Direction is Universal Across Safety-Aligned Languages

拒绝方向在安全对齐语言中是普遍的

Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了多语言LLMs中拒绝方向的跨语言普遍性,发现英文提取的向量可有效绕过其他语言的拒绝,揭示了跨语言安全机制的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 79%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 79%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15061 2026-02-18 cs.RO cs.AI 79%

Safe-SDL:Establishing Safety Boundaries and Control Mechanisms for AI-Driven Self-Driving Laboratories

Safe-SDL:建立AI驱动自主实验室的安全边界与控制机制

Zihan Zhang, Haohui Que, Junhan Chang, Xin Zhang, Hao Wei, Tong Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) AI for Science Institute, Beijing(北京人工智能科学研究院) Peking University(北京大学) DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) National Key Laboratory of Advanced Micro and Nano Manufacture Technology, School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学国家先进微纳米制造技术重点实验室,集成电路学院,上海200240,中国)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Safe-SDL通过建立安全边界和控制机制,解决AI驱动自主实验室中的语法到安全间隙问题,确保实验系统的安全性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏