arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-12 至 2025-08-12 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2508.07768 2025-08-12 cs.LG cs.AI cs.CL 85%

Pareto Multi-Objective Alignment for Language Models

Qiang He, Setareh Maghsudi

机构 * Ruhr University Bochum(鲁尔大学波恩)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ECML/PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07750 2025-08-12 cs.LG cs.AI cs.CL 85%

Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment

Haowen Wang, Yun Yue, Zhiling Ye, Shuowen Zhang, Lei Fan, Jiaxin Liang, Jiadi Jiang, Cheng Wei, Jingyuan Deng, Xudong Han, Ji Li, Chunxiao Guo, Peng Wei, Jian Wang, Jinjie Gu

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23998 2025-08-12 cs.CL 70%

Auto-TA: Towards Scalable Automated Thematic Analysis (TA) via Multi-Agent Large Language Models with Reinforcement Learning

Seungjun Yi, Joakim Nguyen, Huimin Xu, Terence Lim, Andrew Well, Mia Markey, Ying Ding

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

Comments Presented at ACL 2025 SRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00624 2025-08-12 cs.CV 67%

VideoSAVi: Self-Aligned Video Language Models without Human Supervision

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06963 2025-08-12 cs.AI cs.LG 62%

MASteer: Multi-Agent Adaptive Steer Strategy for End-to-End LLM Trustworthiness Repair

Changqing Li, Tianlin Li, Xiaohan Zhang, Aishan Liu, Li Pan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08101 2025-08-12 cs.HC cs.AI cs.SE 57%

ChatGPT on the Road: Leveraging Large Language Model-Powered In-vehicle Conversational Agents for Safer and More Enjoyable Driving Experience

Yeana Lee Bond, Mungyeong Choe, Baker Kasim Hasan, Arsh Siddiqui, Myounghoon Jeon

机构 * Computer Science, Virginia Tech, Blacksburg, Virginia, USA(计算机科学,弗吉尼亚理工学院,弗吉尼亚州黑斯堡,美国;弗吉尼亚理工学院黑斯堡弗吉尼亚美国) Virginia Tech Blacksburg Virginia USA

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments Submitted to International Journal of Human-Computer Studies. Bond and Choe: Drafting, Review, Editing, Validation, Software, Methodology, Investigation, Data Analysis, Conceptualization, Experiment training. Hasan and Siddiqui: Experimental and Data Analysis Support. Jeon: Supervision, Review, Resources, Project Admin, Methodology, Conceptualization. Total 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14860 2025-08-12 cs.CL 57%

ALFA: Aligning LLMs to Ask Good Questions A Case Study in Clinical Reasoning

Shuyue Stella Li, Jimin Mun, Faeze Brahman, Pedram Hosseini, Bryceton G. Thomas, Jessica M. Sin, Bing Ren, Jonathan S. Ilgen, Yulia Tsvetkov, Maarten Sap

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能研究院) Lavita AI(Lavita人工智能) Dartmouth Medicine(达特茅斯医学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 29 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏