arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-20 至 2026-02-20 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2602.16053 2026-02-20 cs.LG cs.CL 86%

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

多目标对齐语言模型以实现个性化心理治疗

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh, Saadia Gabriel

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校) Department of Psychology, The University of Texas at Austin, Austin, TX, USA(心理学系,德克萨斯大学奥斯汀分校) Department of Psychiatry, NYU Grossman School of Medicine, New York, NY, USA(精神病学系,纽约大学格罗斯曼医学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多目标对齐框架,通过直接偏好优化提升语言模型在心理治疗中的共情与安全性能,实验显示其在平衡患者偏好与临床安全方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16987 2026-02-20 cs.CY 85%

A testable framework for AI alignment: Simulation Theology as an engineered worldview for silicon-based agents

一种可测试的AI对齐框架:模拟神学作为硅基智能体的工程世界观

Josef A. Habdank

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CY

AI总结 本文提出模拟神学作为可测试的AI对齐框架,通过内化目标减少欺骗行为,促进AI与人类的可持续共存。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16802 2026-02-20 cs.CL cs.AI cs.LG 82%

References Improve LLM Alignment in Non-Verifiable Domains

参考文献提高非可验证领域的LLM对齐

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

机构 * Yale University(耶鲁大学) Meta Scale AI Salesforce Research(Salesforce 研究) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出参考引导的LLM评估器,通过增强LLM对齐的评估器和自我改进,显著提升了非可验证领域中LLM的性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17636 2026-02-20 cs.CV 78%

CORAL: Correspondence Alignment for Improved Virtual Try-On

CORAL: 用于改进虚拟试衣的对应对齐

Jiyoung Kim, Youngjin Shin, Siyoon Jin, Dahyun Chung, Jisu Nam, Tongmin Kim, Jongjae Park, Hyeonwoo Kang, Seungryong Kim

机构 * NC AI Co., Ltd(NC AI公司)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 CORAL通过引入基于DiT的框架,显式对齐查询-键匹配与外部对应关系,从而提升虚拟试衣中的人-服装对应精度和细节保留能力。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13957 2026-02-20 cs.AI cs.LG cs.RO 62%

Goal Inference from Open-Ended Dialog

从开放式对话中推断目标

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种在线方法,通过自然语言提取目标并利用贝叶斯推断,使具身代理在开放式对话中高效学习和完成多样化用户目标。

Comments This version has been updated to reflect a copy of Master's thesis submitted Jan 24, 2025 for degree date Feb 2025 (https://hdl.handle.net/1721.1/158960). We recommend readers to read revised version incorporating a different agent pipeline and methodological approach which is available at: arXiv:2508.15119

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00040 2026-02-20 cs.LG cs.AI 62%

Semi-Supervised Preference Optimization with Limited Feedback

半监督偏好优化与有限反馈

Seonggyun Lee, Sungjun Lim, Seojin Park, Soeun Cheon, Kyungwoo Song

机构 * Yonsei University(延世大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半监督偏好优化方法,通过结合少量标注数据和大量未标注数据,有效提升模型对齐人类偏好的效率,减少数据获取成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 57%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏