arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-06 至 2026-02-06 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2602.05113 2026-02-06 cs.AI cs.LG 88%

Democratic Preference Alignment via Sortition-Weighted RLHF

通过排序加权RLHF实现民主偏好对齐

Suvadip Sana, Jinzhou Wu, Martin T. Wells

机构 * cornell(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 DemPO通过算法排序机制优化偏好对齐,确保民主代表性,提升模型对代表性公众价值观的反映能力。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05164 2026-02-06 cs.LG cs.AI 81%

Position: Capability Control Should be a Separate Goal From Alignment

位置:能力控制应是与对齐分开的目标

Shoaib Ahmed Siddiqui, Eleni Triantafillou, David Krueger, Adrian Weller

机构 * University of Cambridge(剑桥大学) Google DeepMind(谷歌DeepMind) University of Montreal(蒙特利尔大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文主张将能力控制视为与对齐不同的目标,提出分层的控制机制以应对模型的潜在滥用和失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07253 2026-02-06 cs.LG cs.CV 80%

Alignment of Diffusion Models: Fundamentals, Challenges, and Future

扩散模型对齐:基础、挑战与未来

Buhua Liu, Shitong Shao, Bao Li, Lichen Bai, Zhiqiang Xu, Haoyi Xiong, James Kwok, Sumi Helal, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Baidu Inc.(百度公司) The University of Bologna(博洛尼亚大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文综述了扩散模型对齐的基础、挑战及未来方向,探讨了对齐技术、评估方法及当前挑战的解决方案。

Comments Accepted at ACM Computing Surveys. 35 pages, 5 figures, 4 tables. Paper List: github.com/xie-lab-ml/awesome-alignment-of-diffusion-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-02-06 cs.LG cs.AI 73%

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments 10 pages for main text, 10 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05205 2026-02-06 cs.CL cs.AI 62%

Aligning Large Language Model Behavior with Human Citation Preferences

使大型语言模型行为与人类引用偏好对齐

Kenichiro Ando, Tatsuya Harada

机构 * RIKEN AIP(日本研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建数据集分析LLM引用行为与人类偏好的一致性,发现模型在引用医学文本和数字句子上存在偏差,通过优化可提升对齐效果。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 62%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05932 2026-02-06 cs.CL 57%

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

多项语言还是多群体?多语言大语言模型对价值导向的选择题的回答

Léo Labat, Etienne Ollion, François Yvon

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) CREST, CNRS, Institut Polytechnique de Paris(CREST、国家科学研究中心、巴黎高等理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究多语言LLM在价值导向选择题中的回答一致性,发现语言影响回答,需进一步探讨偏好微调的作用。

Comments 17 pages, 5 figures (8 pages of references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏