arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2502.06059 2025-12-30 cs.CY 70%

Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles

优先原则,原则其次:一种适应性解读有助于、诚实和无害原则

Yue Huang, Chujie Gao, Yujun Zhou, Kehan Guo, Xiangqi Wang, Or Cohen-Sasson, Max Lamparth, Xiangliang Zhang

专题命中 安全训练 :alignment(abstract);harmlessness(abstract);分类 cs.CY

AI总结 本文提出了一种适应性解读有助于、诚实和无害原则的方法,通过优先级顺序平衡不同维度,以提高AI对齐的伦理和操作有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23546 2025-12-30 cs.CV 67%

PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation

PurifyGen:一种用于安全文本到图像生成的风险判别和语义净化模型

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 PurifyGen通过双阶段策略实现安全文本到图像生成,通过语义距离评估和双空间转换净化危险提示,减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23617 2025-12-30 cs.LG cs.AI math.ST stat.ME stat.ML stat.TH 62%

Le Cam Distortion: A Decision-Theoretic Framework for Robust Transfer Learning

Le Cam 变形:一种决策理论框架用于鲁棒迁移学习

Deniz Akdemir

机构 * Deniz Akdemir

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Le Cam 变形通过决策理论框架,解决了迁移学习中因域信息不均衡导致的负迁移问题,实现了在不降质源域的情况下有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23366 2025-12-30 cs.DB cs.AI 57%

AGRO-SQL: Agentic Group-Relative Optimization with High-Fidelity Data Synthesis

AGRO-SQL:基于高保真数据合成的群体相对优化

Cehua Yang, Dongyu Xiao, Junming Lin, Yuyang Song, Hanxu Yan, Shawn Guo, Wei Zhang, Jian Yang, Mingjie Tang, Bryan Dai

机构 * Sichuan University(四川大学) IQuest Research(IQuest研究院) Beihang University(北航大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 AGRO-SQL通过高保真数据合成和群体相对策略优化,提升文本到SQL系统的推理能力与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22568 2025-12-30 cs.AI physics.bio-ph q-bio.NC 57%

Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI

从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能

Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 通过整合动作、组合结构和事件记忆,改进基础模型以实现安全、可解释和类人的人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23505 2025-12-30 cs.RO cs.SY eess.SY 50%

Robust Deep Learning Control with Guaranteed Performance for Safe and Reliable Robotization in Heavy-Duty Machinery

具有保证性能的鲁棒深度学习控制:用于重载机械中安全可靠机器人化的关键技术

Mehdi Heydari Shahna

机构 * Business Finland Partnership Project(Business Finland合作伙伴项目) Tampere(塔尔帕)

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出了一种鲁棒深度学习控制框架,旨在提升重型机械在电气化和自主性转型中的安全性和可靠性,通过模块化设计和分层策略实现性能保障。

Comments Doctoral Dissertation, Tampere University

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 50%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏