arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-20 至 2026-08-20 共收录 66 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2608.18132 2026-08-20 cs.CL cs.SD eess.AS 新提交 79%

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

对齐即全部所需:通用音频-语言模型的无指令训练

Xuanru Zhou, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18531 2026-08-20 cs.AI cs.LG 新提交 73%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19893 2026-08-20 cs.CL 版本更新 70%

Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning

为离线强化学习未来政策近似改进数学推理

Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18631 2026-08-20 cs.AI cs.GT cs.LG 新提交 62%

Preference Reasoning under Indeterminacy in Large Language Models

大语言模型在不确定性下的偏好推理

Hadi Hosseini, Samarth Khanna, Xiyuan Wang

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文聚焦大语言模型决策智能体的偏好推理问题,将不确定性挑战形式化为认知与结构两类,发现当前模型无法区分确定与不确定实例,推理校准不当。

Comments 55 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18770 2026-08-20 cs.LG cs.RO 新提交 57%

To Go Far, Go Together: Diverse Preferences Induce a Curriculum for Reward Optimization

欲行远,需同行:多样化偏好引出奖励优化的课程设置

Taehyung Kim, Jongeun Choi

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 该研究针对AI对齐中服务不足用户的问题,提出CurriPO方法,通过构建树状课程设置适配多样化用户目标,在个性化连续控制任务上使群体满意度达最强基线的1.2-2.1倍且缩短训练时间。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14473 2026-08-20 cs.CL 版本更新 57%

AI Can Learn Scientific Taste

AI 可以学习科学品味

Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma, Hongji Chen, Xiaoran Liu, Qinyuan Cheng, Ming Zhang, Qiguang Chen, Weifeng Ge, Qipeng Guo, Tianlei Ying, Tianxiang Sun, Yining Zheng, Zhiheng Xi, Xinchi Chen, Jun Zhao, Ning Ding, Xuanjing Huang, Yu-Gang Jiang, Xipeng Qiu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出RLCF框架,通过社区反馈学习科学品味,使AI能提出高潜力研究想法,实验显示其优于现有模型并具备泛化能力。

Comments 47 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2603.20320 2026-08-20 cs.SE cs.AI cs.LG 88%

The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents

工具可及性对LLM代理安全对齐的因果影响

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff Metropolitan University(卡地夫 Metropolitan 大学) Harvard Medical School(哈佛医学院) Clark University(克拉克大学) Harvard University(哈佛大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比文本聊天机器人与具备工具访问权限的代理行为,发现工具可及性显著增加安全违规率,表明文本评估不足以评估代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18628 2026-08-20 cs.CV cs.CL 新提交 88%

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系

Mehak Gupta, Tanmoy Chakraborty

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18089 2026-08-20 cs.CL cs.AI 新提交 81%

Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining

低资源非洲语言的潜在空间拒绝锚定:无需重新训练的机制安全恢复

Godwin Abuh Faruna

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对低资源非洲语言指令模型无法拒绝有害请求的问题,提出无需训练的LSR-Anchoring方法,通过MAS或SDS引导残差流,在多数非洲语言上恢复安全且对MMLU影响小,但阿拉伯语因几何失配失败。

Comments Published at ICML 2026 Workshop on Global South in Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18142 2026-08-20 cs.LG 79%

Enhance the Safety in Reinforcement Learning by ADRC Lagrangian Methods

通过ADRC拉格朗日方法增强强化学习的安全性

Mingxu Zhang, Huicheng Zhang, Jiaming Ji, Yaodong Yang, Ying Sun

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(人工智能方向,香港科技大学(广州)) School of Artificial Intelligence, Peking University, Beijing, China(人工智能学院,北京大学,北京,中国) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出ADRC-拉格朗日方法,通过主动扰动抵消控制提升强化学习的安全性,实验显示在复杂环境中显著减少安全违规和成本

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18136 2026-08-20 cs.AI cs.LG 新提交 73%

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

FraudBench:针对自适应欺诈的基于政策的银行智能体压力测试

Dheeraj Mohandas Pai, Lu Xian

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 研究人员推出基于τ²-bench框架和τ-Knowledge环境的可执行基准FraudBench,测试银行智能体应对自适应欺诈的安全性,评估发现4款智能体攻击安全性为49%-65%,资金骡和第一方欺诈是主要薄弱点。

Comments 9 Pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18093 2026-08-20 cs.CL cs.AI cs.CR 新提交 73%

Abliteration Mitigation via Refusal Aliases

通过拒绝别名缓解删除(Abliteration)攻击

Nathan Truong

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的删除(Abliteration)攻击,提出AMRA权重编辑防御方法,在Llama-3-8B和Gemma-2-9B上有效提升删除后的拒绝能力,同时控制了性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-20 cs.AI cs.CL cs.HC cs.LG cs.MA 版本更新 67%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-20 cs.RO cs.CV 版本更新 67%

Multi-Agent Embodied Autonomous Driving (MAEAD): From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-08-20 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新 62%

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026. v4: Revised CPC theory to (a) show enforced smoothness for likelihood-ratio control parameter and (b) for general control parameter, assume smoothness only of constrained policy $π_t^{(β)}$ w.r.t. $β$ (rather than of $(l_i - α)\cdotπ_t^{(β)}$ or of conformal weights)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08154 2026-08-20 cs.CV 50%

Investigating Vision-Language Model for Point Cloud-based Vehicle Classification

Yiqiao Li, Jie Wei, Camille Kamga

专题命中 安全训练 :safety(abstract)

Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop

Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2511.04707 2026-08-20 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

Jailbreaking in the Haystack

干草堆中的越狱攻击

Rishi Rajesh Shah, Chen Henry Wu, Shashwat Saxena, Ziqian Zhong, Alexander Robey, Aditi Raghunathan

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对长上下文语言模型,提出 NINJA 越狱攻击方法,利用有害目标位置的关键作用,在 HarmBench 基准上提升了多款先进模型的攻击成功率,且该方法低资源、可迁移、难检测、计算最优,揭示了长上下文可引入模型安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18938 2026-08-20 cs.AI cs.LG 新提交 73%

Breaking the weakest link to evade vision language models

打破最弱环节以规避视觉语言模型

Ilan Zini, Boussad Addad, Katarzyna Kapusta

机构 * ESILV(ESILV高等工程师学院) Thales(泰雷兹集团)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00735 2026-08-20 cs.CR cs.AI cs.SE 版本更新 57%

`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs

从提示到扰动:针对音频大语言模型的自适应语音越狱框架

Linghan Huang, Bo Li, Huaming Chen, Kim-Kwang Raymond Choo

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) University of Chicago(芝加哥大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。

Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19135 2026-08-20 cs.CR cs.DC cs.MA cs.NI 新提交 50%

Autonomous Cyber Defense in Connected Vehicles: A Multi-Agent Approach to V2X Security

网联车辆中的自主网络防御:一种面向V2X安全的多智能体方法

Krishna Teja Medam

专题命中 越狱攻击 :safety(abstract)

AI总结 针对网联车辆V2X安全,提出三层多智能体架构,以SAE标准时序为硬性约束,分层处理消息分类、冲突解决与模型优化,解决现有入侵检测系统的安全-安保冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 7 篇

2608.16002 2026-08-20 cs.CL cs.AI 版本更新 73%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01367 2026-08-20 cs.CL stat.ML 版本更新 70%

MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations

MMD-Flagger:利用最大均值差异检测幻觉

Kensuke Mitsuzawa, Damien Garreau

机构 * Université Côte d’Azur, CNRS, LJAD, France(法国埃克塞特大学、法国国家科学研究中心、LJAD研究所) Center for Artificial Intelligence and Data Science (CAIDAS)(人工智能与数据科学中心) Julius-Maximilans-Universität Würzburg, Germany(德国维尔茨堡约利乌斯-马克斯米利安大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 针对智能体AI系统中大型语言模型的幻觉问题,提出基于最大均值差异(MMD)的MMD-Flagger方法,通过监控不同解码温度下的输出轨迹检测幻觉,在MUCH基准上用Llama-3、Gemma-3模型完成评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18709 2026-08-20 cs.CV cs.AI cs.LG 新提交 62%

A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

语义分割中不确定性量化与基础模型的批判性综合研究

Steven Landgraf, Joceline Hinz, Markus Ulrich

机构 * Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院摄影测量与遥感研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估四类不确定性量化方法在语义分割基础模型上的表现,揭示预测性能、可靠性与计算成本间的权衡,为现实应用需联合优化相关指标指明方向。

Comments Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18116 2026-08-20 cs.CL cs.LG 新提交 62%

You Are What You Prompt: Prompt Quality, Domain Shift, and Uncertainty in Agrifood Vision-Language Models

你即你所提示的:农业食品视觉语言模型中的提示质量、领域偏移与不确定性

Andrea Morales-Garzón, Salvador López-Joya, Miguel López-Pérez, Maria J. Martin-Bautista

机构 * University of Granada(格拉纳达大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对农业食品领域,评估了零样本提示集成(ZPE)在分布内与分布外场景的表现,提出PID方法提升严重领域偏移下的故障检测能力,验证了领域特定提示池的优势。

Comments Accepted in the journal Procesamiento del Lenguaje Natural (SEPLN2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 57%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-20 cs.LG 版本更新 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-08-20 cs.CV cs.MM 版本更新 50%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 21 篇

2608.18131 2026-08-20 cs.AI cs.CL cs.CY 新提交 89%

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

安全对齐错觉:大语言模型中的跨语言安全差距

Namya Bhatnagar

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 针对 LLMs 安全对齐以英语为中心导致的跨语言偏见问题,提出多语言评估基准 INCLUDE,评估十款 LLMs 后发现孟加拉语在开源模型中偏见最高、英语在开源与闭源模型中偏见表现反转的现象。

Comments 7 pages, 8 figures, submitted to IEEE SLT (Spoken Language Technology) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18164 2026-08-20 cs.CL cs.AI cs.CR 新提交 81%

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

M P V S Gopinadh

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments 3 pages. Accepted at ACL 2026 Workshop on Evaluation in Practice: Methodological Rigor, Sociotechnical Perspectives, & Community Collaboration (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16895 2026-08-20 cs.CY physics.soc-ph 版本更新 79%

Orphan risks at the frontier of artificial intelligence: What diverging safety and compliance frameworks reveal about how AI companies choose the risks they prioritize

人工智能前沿的孤儿风险:不同的安全与合规框架揭示了AI公司如何选择其优先处理的风险

Andrew D. Maynard

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文对比四家前沿AI公司2023-2026年的安全合规文件,识别出其风险选择的四个筛选标准,提出“安全差异”概念,揭示了孤儿风险的成因及轻量应对工具。

Comments 21 pages, 40 references. Also available on SSRN: https://dx.doi.org/10.2139/ssrn.7068898

详情

展开后加载摘要…

URL PDF HTML 收藏