arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-22 至 2025-08-22 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2412.19792 2025-08-22 cs.LG cs.CL cs.IT math.IT 84%

InfAlign: Inference-aware language model alignment

Ananth Balashankar, Ziteng Sun, Jonathan Berant, Jacob Eisenstein, Michael Collins, Adrian Hutter, Jong Lee, Chirag Nagpal, Flavien Prost, Aradhana Sinha, Ananda Theertha Suresh, Ahmad Beirami

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15388 2025-08-22 cs.IR 78%

TrackRec: Iterative Alternating Feedback with Chain-of-Thought via Preference Alignment for Recommendation

Yu Xia, Rui Zhong, Zeyu Song, Wei Yang, Junchen Wan, Qingpeng Cai, Chi Lu, Peng Jiang

专题命中 偏好对齐 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15449 2025-08-22 cs.LG cs.AI 62%

Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection

Chengcan Wu, Zeming Wei, Huanran Chen, Yinpeng Dong, Meng Sun

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 9 figures, Under review as a full paper at AAAI 2026. A preliminary version is under review at the NeurIPS 2025 Workshop on Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15548 2025-08-22 cs.AI 57%

DeepThink3D: Enhancing Large Language Models with Programmatic Reasoning in Complex 3D Situated Reasoning Tasks

Jiayi Song, Rui Wan, Lipeng Ma, Weidong Yang, Qingyuan Zhou, Yixuan Li, Ben Fei

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14951 2025-08-22 cs.CL 57%

Improving LLMs for Machine Translation Using Synthetic Preference Data

Dario Vajda, Domen Vreš, Marko Robnik-Šikonja

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Paper with individual presentation at LUHME workshop at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15146 2025-08-22 cs.HC 50%

QueryGenie: Making LLM-Based Database Querying Transparent and Controllable

Longfei Chen, Shenghan Gao, Shiwei Wang, Ken Lin, Yun Wang, Quan Li

专题命中 偏好对齐 :alignment(abstract)

Comments Accepted by The 38th Annual ACM Symposium on User Interface Software and Technology (UIST Adjunct '25), September 28-October 1, 2025, Busan, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏