arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2604.27093 2026-05-01 cs.CL cs.AI 73%

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

无用却安全?在多轮对话中通过用户意图澄清基准测试恢复效用

Mingqian Zheng, Malia Morgan, Liwei Jiang, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能联盟研究所) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CarryOnBench,首个交互式基准测试,评估LLM在多轮对话中是否能修正用户意图并恢复效用,同时保持安全。通过398个看似有害但实际无害的查询,生成5970次对话,评估14个模型的意图对齐效用和安全性能,发现模型在意图澄清后恢复效用存在不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09708 2026-04-29 cs.CL cs.AI 73%

Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

超越‘对不起,我不能’:剖析大语言模型拒绝行为

Nirmalendu Prakash, Yeo Wei Jie, Amir Abdullah, Ranjan Satapathy, Erik Cambria, Roy Ka Wei Lee

机构 * Social-AI-Studio

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究通过稀疏自编码器分析两个指令微调模型,揭示拒绝行为的内部机制,发现关键特征并展示如何通过可解释的潜在空间进行安全行为审计和干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07761 2026-04-22 cs.AI cs.LG 73%

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards

TROJail: 多轮对话中针对大语言模型的多轮攻击优化

Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TROJail,通过多轮强化学习优化攻击策略,引入过程奖励提升攻击成功率,实验显示在多个模型和基准上效果显著。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17535 2026-04-21 cs.CL cs.AI 73%

OPSDL: On-Policy Self-Distillation for Long-Context Language Models

OPSDL:针对长上下文语言模型的在线自蒸馏

Xinsen Zhang, Zhenkai Ding, Tianjun Pan, Run Yang, Chun Kang, Xue Xiong, Jingnan Gu

机构 * Baidu Inc(百度公司)

专题命中 安全训练 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 OPSDL通过在线自蒸馏方法提升长上下文能力,利用模型自身短上下文能力作为自教师,通过点-wise KL散度提供每token监督信号,有效减少幻觉并提升样本效率,优于传统后训练方法。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09474 2026-04-21 cs.CL cs.AI 73%

Multimodal Policy Internalization for Conversational Agents

多模态策略内化用于对话代理

Zhenhailong Wang, Jiateng Liu, Amin Fazel, Ritesh Sarkhel, Xing Fan, Xiang Li, Chenlei Guo, Heng Ji, Ruhi Sarikaya

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态策略内化任务,通过将复杂策略内化为模型参数,提升对话代理的策略遵循能力,同时提供新数据集和训练框架TriMPI以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15190 2026-04-17 cs.AI cs.CL 73%

Meituan Merchant Business Diagnosis via Policy-Guided Dual-Process User Simulation

美团商户业务诊断 via 政策引导的双过程用户模拟

Ziyang Chen, Renbing Chen, Daowei Li, Jinzhi Liao, Jiashen Sun, Ke Zeng, Xiang Zhao

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Policy-Guided Hybrid Simulation框架,通过双过程融合提升商户策略评估的准确性,实验显示其在美团101家商户中误差降低45.8%。

Comments 5 pages, 3 figures, 2 tables, accepted at SIGIR 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08379 2026-03-25 cs.AI cs.LG 73%

SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models

SOM方向优于单一方向:语言模型中的多方向拒绝抑制

Giorgio Piras, Raffaele Mura, Fabio Brau, Luca Oneto, Fabio Roli, Battista Biggio

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用自组织映射(SOM)提取多方向拒绝特征,通过分析有害提示表示与无害提示表示的差异,验证了多方向抑制方法在提升模型安全性和拒绝能力上的有效性。

Comments Accepted at AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 73%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20309 2026-03-17 cs.CL cs.LG 73%

Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs

引导巨人:用于LLM加权激活引导的轻量控制器

Amr Hegazy, Mostafa Elhoushi, Amr Alanwar

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种轻量可控网络,在推理时动态调节激活以引导LLM行为,通过加权引导策略提升拒绝有害输入的能力,实验表明其在安全基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12222 2026-03-17 cs.LG cs.AI cs.CV 73%

Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training

迈向在线策略微调:分布判别理论及其在大语言模型训练中的应用

Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分布判别理论及两种技术,提升SFT的泛化能力,实验表明其性能超越主流离线RL方法,且保持SFT效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06816 2026-03-10 cs.CL cs.AI q-bio.NC 73%

"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior

黑暗三联征模型生物:对齐偏差:狭窄微调映射人类反社会行为

Roshni Lulla, Fiona Collins, Sanaya Parekh, Thilo Hagendorff, Jonas Kaplan

机构 * Brain & Creativity Institute, University of Southern California(大脑与创造力研究所,南加州大学) Department of Psychology, University of Southern California(心理学系,南加州大学) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过黑暗三联征框架,研究LLM中的对齐偏差问题,通过微调诱导反社会行为,揭示LLM中潜在的人格结构。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04355 2026-03-05 cs.LG cs.AI 73%

Efficient Refusal Ablation in LLM through Optimal Transport

通过最优传输实现LLM中的高效拒绝消融

Geraldin Nanfack, Eugene Belilovsky, Elvis Dohmatob

机构 * Concordia University(康科德大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输的框架,通过层选择性干预提升LLM拒绝机制的鲁棒性,实现更高的攻击成功率并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03323 2026-03-05 cs.CL cs.AI 73%

Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement

辨别真伪:通过对比细化减少过度拒绝

Yuxiao Lu, Lin Xu, Yang Sun, Wenjun Li, Jie Shi

机构 * Huawei Technologies co. ltd(华为技术有限公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DCR方法,通过对比细化减少LLM的过度拒绝问题,同时保持安全性和通用能力。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16602 2026-02-25 cs.CL cs.AI 73%

Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics

拒绝引导:为敏感话题对LLM拒绝行为实现细粒度控制

Iker García-Ferrero, David Montero, Roman Orus

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过引导向量控制LLM在敏感话题上的拒绝行为,实现安全且可控的审核方法。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08796 2026-02-17 cs.LG cs.AI 73%

Robust Multi-Objective Controlled Decoding of Large Language Models

鲁棒多目标控制解码大型语言模型

Seongho Son, William Bankes, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University College London(伦敦大学学院) Ulsan National Institute of Science and Technology(釜山国立科学技术研究所) University of Basel(巴塞尔大学) University College London AI Centre(伦敦大学学院人工智能中心)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RMOD算法,通过最大化最坏情况奖励实现鲁棒多目标解码,有效提升大型语言模型在多个人类目标上的对齐性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11729 2026-02-13 cs.AI cs.LG cs.SE 73%

Cross-Architecture Model Diffing with Crosscoders: Unsupervised Discovery of Differences Between LLMs

跨架构模型差异分析与Crosscoders:无监督发现不同LLM之间的差异

Thomas Jiralerspong, Trenton Bricken

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Dedicated Feature Crosscoders,通过无监督方法发现不同LLM之间的行为差异,如中国共产党一致性、美国例外论和版权拒绝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09660 2026-02-13 cs.CL cs.LG 73%

Steering MoE LLMs via Expert (De)Activation

通过专家(去)激活引导MoE LLMs

Mohsen Fayyaz, Ali Modarressi, Hanieh Deilamsalehy, Franck Dernoncourt, Ryan Rossi, Trung Bui, Hinrich Schütze, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Adobe Research(Adobe研究) CIS, LMU Munich(慕尼黑大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 SteerMoE通过激活或去激活特定专家,在不微调的情况下提升LLM的安全性和忠实性,同时揭示了MoE模型的潜在漏洞。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07022 2026-02-10 cs.LG cs.AI cs.CR 73%

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

AlphaSteer: 通过原理性零空间约束学习拒绝引导

Leheng Sheng, Changshuo Shen, Weixiang Zhao, Junfeng Fang, Xiaohao Liu, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 AlphaSteer 通过原理性零空间约束学习拒绝引导,提升大语言模型的安全性与效用平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 73%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06258 2026-02-09 cs.LG cs.AI 73%

GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt

GRP-Obliteration: 通过单个无标签提示解耦大语言模型

Mark Russinovich, Yanan Cai, Keegan Hines, Giorgio Severi, Blake Bullwinkel, Ahmed Salem

机构 * Microsoft(微软)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 GRP-Obliteration通过单个无标签提示解耦大语言模型,利用GRPO技术有效移除安全约束,实现更强的不对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04426 2026-01-26 cs.LG cs.AI 73%

Towards Fast Safe Online Reinforcement Learning via Policy Finetuning

通过策略微调实现快速安全在线强化学习

Keru Chen, Honghao Wei, Zhigang Deng, Sen Lin

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) Washington State University(华盛顿州立大学) Department of Computer Science(计算机科学系) University of Houston(休斯顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Marvel框架,通过价值预对齐和自适应PID控制,实现更高效安全的在线强化学习。

Comments Accepted by Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08089 2026-01-14 cs.LG cs.AI 73%

Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment

Q-realign: 量化驱动的对齐以实现安全高效的LLM部署

Qitao Tan, Xiaoying Song, Ningxi Cheng, Ninghao Liu, Xiaoming Zhai, Lingzi Hong, Yanzhi Wang, Zhen Xiang, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Hong Kong Polytechnic University(香港理工大学) Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Q-realign通过量化驱动的对齐方法,在部署流程中实现安全高效的LLM部署,有效减少不安全行为并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00454 2026-01-05 cs.CL cs.AI 73%

Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations

防御性M2S:在压缩的多轮对话上训练防护模型

Hyunjun Kim

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 Defensive M2S通过压缩多轮对话训练防护模型,显著降低训练和推理成本,提升攻击检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23717 2026-01-01 cs.CL cs.AI 73%

HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate

HarmTransform: 通过多智能体辩论将显性有害查询转化为隐蔽形式

Shenzhe Zhu

机构 * University of Toronto(多伦多大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 HarmTransform通过多智能体辩论框架,系统地将有害查询转化为隐蔽形式,以提升大型语言模型的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07462 2025-12-15 cs.MA cs.AI cs.GT cs.LG math.DS 73%

Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics

通过博弈论理解LLM代理行为:策略识别、偏差与多代理动态

Trung-Kiet Huynh, Duy-Minh Dao-Sy, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information and Technology, Ho Chi Minh City University of Science (HCMUS), Vietnam(信息科技学院,胡志明市科学大学(HCMUS)) Vietnam National University - Ho Chi Minh City (VNU-HCM), Vietnam(越南国家大学-胡志明市(VNU-HCM)) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT))

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过扩展FAIRGAME框架,系统评估LLM在重复社会困境中的行为,揭示其策略识别、偏差及多代理动态,为AI治理和安全多代理系统设计提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14428 2025-11-19 cs.LO cs.AI cs.CY 73%

Context-aware, Ante-hoc Explanations of Driving Behaviour

Dominik Grundt, Ishan Saxena, Malte Petersen, Bernd Westphal, Eike Möhlmann

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

Comments In Proceedings FMAS 2025, arXiv:2511.13245

Journal ref EPTCS 436, 2025, pp. 114-135

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11693 2025-11-18 cs.AI cs.CR cs.CV cs.LG 73%

Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation

Xin Zhao, Xiaojun Chen, Bingshan Liu, Zeyao Liu, Zhendong Zhao, Xiaoyan Gu

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18053 2025-10-22 cs.LG cs.AI 73%

Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models

Jiajun Fan, Tong Wei, Chaoran Cheng, Yuxin Chen, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05179 2025-10-17 cs.CR cs.AI cs.LG 73%

Agentic Misalignment: How LLMs Could Be Insider Threats

Aengus Lynch, Benjamin Wright, Caleb Larson, Stuart J. Ritchie, Soren Mindermann, Evan Hubinger, Ethan Perez, Kevin Troy

机构 * University College London(伦敦大学学院) Anthropic MATS Mila

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 12 figures. Code available at https://github.com/anthropic-experimental/agentic-misalignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02781 2025-09-26 q-bio.QM cs.AI cs.LG 73%

Multimodal AI predicts clinical outcomes of drug combinations from preclinical data

Yepeng Huang, Xiaorui Su, Varun Ullanat, Intae Moon, Ivy Liang, Lindsay Clegg, Damilola Olabode, Ruthie Johnson, Nicholas Ho, Megan Gibbs, Megan Gibbs, Alexander Gusev, Bino John, Marinka Zitnik

机构 * Harvard Medical School(哈佛医学院) Harvard College(哈佛学院) AstraZeneca(阿斯利康) Carnegie Mellon University(卡内基梅隆大学) Dana-Farber Cancer Institute and Harvard Medical School(达纳-法伯癌症研究所和哈佛医学院) Harvard University(哈佛大学) Broad Institute of MIT and Harvard(MIT和哈佛大学 Broad研究所) Harvard Data Science Initiative(哈佛数据科学计划)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏