arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-05 至 2025-12-05 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2512.04210 2025-12-05 cs.AI cs.CL cs.CY 90%

Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment

通过迭代偏好对齐平衡医疗AI助手的安全性与帮助性

Huy Nghiem, Swetasudha Panda, Devashish Khatwani, Huy V. Nguyen, Krishnaram Kenthapadi, Hal Daumé

机构 * University of Maryland(马里兰大学) Oracle Labs(Oracle实验室) Oracle Health AI(Oracle健康AI)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过迭代偏好对齐框架提升医疗AI助手的安全性与帮助性,通过KTO和DPO优化改进模型,提升有害查询检测性能并平衡安全与效用。

Comments ML4H 2025 Proceedings, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08123 2025-12-05 cs.CL 81%

QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA

QA-LIGN:通过宪法分解的问答对对齐大语言模型

Jacob Dineen, Aswin RRV, Qin Liu, Zhikun Xu, Xiao Ye, Ming Shen, Zhaonan Li, Shijie Lu, Chitta Baral, Muhao Chen, Ben Zhou

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);harmlessness(abstract)

AI总结 QA-LIGN通过分解奖励信号提升LLM对齐效果,降低攻击成功率并保持低拒绝率,实现安全与帮助性的帕累托最优。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18541 2025-12-05 cs.AI 79%

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16139 2025-12-05 cs.AI 57%

Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints

通过几何投影参考约束的多维评分导向奖励模型学习

Yongnan Jin, Xurui Li, Feng Cao, Liucun Gao, Juanjuan Yao

机构 * Shanghai Mingpin Medical Data Technology Co., Ltd.(上海明品医疗数据技术有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 通过几何投影参考约束的多维评分导向奖励模型学习,提升医疗领域大型语言模型的性能和对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04419 2025-12-05 cs.AI 57%

Solving LLM Repetition Problem in Production: A Comprehensive Study of Multiple Solutions

在生产环境中解决大语言模型重复问题:对多种解决方案的综合研究

Weiwei Wang, Weijie Zou, Jiyong Min

机构 * Shenzhen Sunline Tech Co., Ltd(深圳Sunline科技有限公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文针对大语言模型在生产环境中重复问题,提出多种解决方案并验证其有效性,通过理论分析和实验评估,识别关键参数并提供实用的生产级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04302 2025-12-05 cs.AI 57%

Towards better dense rewards in Reinforcement Learning Applications

迈向强化学习应用中更优质的密集奖励

Shuyuan Zhang

机构 * McGill University(麦吉尔大学) Mila

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了强化学习应用中如何构建更有效的密集奖励,通过逆强化学习、奖励建模和自监督学习等方法提高奖励的准确性和可靠性。

Comments arXiv admin note: substantial text overlap with arXiv:2505.20417

详情

展开后加载摘要…

URL PDF HTML 收藏