arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2512.16626 2025-12-19 cs.LG cs.AI cs.GT cs.MA stat.ML 73%

Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game

基于人类反馈的Stackelberg学习:偏好优化作为连续博弈

Barna Pásztor, Thomas Kleine Buening, Andreas Krause

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 SLHF通过连续博弈框架实现偏好优化,优于RLHF和NLHF,在一致性、数据敏感性和鲁棒性方面具有优势,并在大规模语言模型中展示出强对齐能力。

Comments 10 pages, 5 tables, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11711 2025-12-19 cs.LG 70%

Reinforcement Learning Finetunes Small Subnetworks in Large Language Models

强化学习在大型语言模型中微调小型子网络

Sagnik Mukherjee, Lifan Yuan, Dilek Hakkani-Tur, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 强化学习在大型语言模型中通过微调小型子网络显著提升性能,且该子网络更新稀疏性源于数据分布和正则化技术的影响。

Comments NeuRIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15756 2025-12-19 cs.LG cs.AI 62%

ReactorFold: Generative discovery of nuclear reactor cores via emergent physical reasoning

ReactorFold:通过涌现物理推理生成核反应堆核心

Yoonpyo Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 ReactorFold通过生成框架和涌现物理推理,实现了核反应堆核心设计的创新发现,突破传统设计限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16565 2025-12-19 math.OC cs.LG 57%

Non-Asymptotic Global Convergence of PPO-Clip

PPO-Clip算法的非渐近全局收敛性

Yin Liu, Qiming Dai, Junyu Zhang, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) School of Mathematical Sciences, Peking University(北京大学数学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15957 2025-12-19 cs.CV cs.AI 57%

Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models

看见即信仰(并预测):基于视觉语言模型的上下文感知多人类行为预测

Utsav Panchal, Yuchen Liu, Luigi Palmieri, Ilche Georgievski, Marco Aiello

机构 * Institute of Architecture of Application Systems, University of Stuttgart, Germany(应用系统建筑研究所,斯图加特大学,德国) Bosch Research, Germany(博世研究,德国)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 CAMP-VLM通过结合视觉语言模型与上下文特征,提升了多人类行为预测的准确性,其在预测精度上比基线模型高66.9%。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏