arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-27 至 2025-11-27 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2511.14476 2025-11-27 cs.AI 89%

Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior

在大型语言模型对齐中操作多元价值观揭示了安全、包容性和模型行为之间的权衡

Dalia Ali, Dora Zhao, Allison Koenecke, Orestis Papakyriakopoulos

机构 * Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.AI

AI总结 本研究探讨了在大型语言模型对齐中融入多元价值观的影响,发现不同群体偏好和设计选择对模型行为和安全性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21050 2025-11-27 cs.LG cs.AI stat.ML 86%

Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs

打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏

Dongkyu Derek Cho, Huan Song, Arijit Ghosh Chowdhury, Haotian An, Yawei Wang, Rohit Thekkanal, Negin Sokhandan, Sharlina Keshava, Hannah Marlowe

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。

Comments AAAI-26 Workshop on Post-AI Formal Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19387 2025-11-27 cs.LG cs.SY eess.SY math.OC 83%

Alignment of large language models with constrained learning

受限学习下的大语言模型对齐

Botong Zhang, Shuo Li, Ignacio Hounie, Osbert Bastani, Dongsheng Ding, Alejandro Ribeiro

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于拉格朗日对偶性的迭代对偶对齐方法,用于在满足约束条件下优化大语言模型策略,通过实验验证了其在受限对齐问题中的有效性。

Comments 51 pages, 5 figures, 11 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19474 2025-11-27 cs.LG 79%

g-DPO: Scalable Preference Optimization for Protein Language Models

g-DPO:可扩展的偏好优化用于蛋白质语言模型

Constance Ferragu, Jonathan D. Ziegler, Nicolas Deutschmann, Arthur Lindoulsi, Eli Bixby, Cradle ML Team

机构 * Cradle ML Team(Cradle团队) Cradle Zürich, Switzerland(Cradle瑞士苏黎世)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.LG

AI总结 g-DPO通过序列聚类和组近似方法提升蛋白质语言模型的偏好优化效率,实现更快的收敛速度和与标准DPO相当的性能。

Comments Accepted at two workshops: FM4LS NeurIPS 2025 (accepted-paper.html" target="_blank" rel="noopener">https://nips2025fm4ls.github.io/pages/accepted-paper.html) and MLSB in Copenhagen EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18477 2025-11-27 cs.IR cs.AI cs.LG 62%

Personalized Image Generation for Recommendations Beyond Catalogs

推荐超越目录的个性化图像生成

Gabriel Patron, Zhiwei Xu, Ishan Kapnadak, Felipe Maia Polo

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2025-11-27 cs.LG 57%

Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Jalaj Bhandari, Yukai Yang, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21270 2025-11-27 cs.SD cs.CV 50%

Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale

多奖励GRPO用于大规模稳定且有声调的单代码本TTS LLMs

Yicheng Zhong, Peiji Yang, Zhisheng Wang

机构 * Tencent Technology Co.Ltd(腾讯科技有限公司)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出多奖励GRPO框架,通过优化单代码本TTS LLMs的生成策略,提升语音的语调稳定性、说话者相似性和自然度。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏