arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2510.23631 2026-02-11 cs.LG cs.AI stat.ME stat.ML 84%

Beyond Pairwise: Empowering LLM Alignment With Ranked Choice Modeling

超越成对:通过排名选择建模增强大语言模型对齐

Yuxuan Tang, Yifan Feng

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Department of Analytics and Operations(分析与运营系) NUS Business School(新加坡国立大学商学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RCPO框架,通过最大似然估计结合排名选择建模,提升大语言模型对齐效果,实验显示其在多种模型和设置中均优于基线方法。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09538 2026-02-11 cs.CL 79%

UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment

UniARM: 向多目标测试时间对齐的统一自回归奖励模型迈进

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuan Huang, Deqing Wang, Jianxin Li, Yitong Yao, Chao Wang, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 UniARM通过统一自回归奖励模型实现多目标测试时间对齐,通过共享特征和偏好调节模块减少特征纠缠,提升对偏好权衡的控制能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03784 2026-02-11 stat.ML cs.AI cs.LG 62%

Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning

从人类反馈中鲁棒强化学习用于大语言模型微调

Kai Ye, Hongyi Zhou, Jin Zhu, Francesco Quinzan, Chengchun Shi

机构 * Department of Statistics, LSE(统计系,伦敦经济学院) Department of Mathematics, Tsinghua University(数学系,清华大学) School of Mathematics, University of Birmingham(数学学院,伯明翰大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种鲁棒的强化学习算法,用于改进大语言模型微调中从人类反馈学习奖励函数的性能,通过减少方差和改进后悔界,实验证明其在基准数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09662 2026-02-11 cs.CV 50%

TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution

TreeCUA: 通过树结构可验证进化高效扩展GUI自动化

Deyang Jiang, Jing Huang, Xuanle Zhao, Lei Chen, Liming Zheng, Fanfan Liu, Haibo Qiu, Peng Shi, Zhixiong Zeng

专题命中 偏好对齐 :DPO(abstract)

AI总结 TreeCUA通过树结构可验证进化高效扩展GUI自动化,提升GUI规划能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09411 2026-02-11 cs.CV 50%

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

K-Sort Eval: 通过校正VLM作为评判者实现视觉生成的高效偏好评估

Zhikai Li, Jiatong Li, Xuewen Liu, Wangbo Zhao, Pan Du, Kaicheng Zhou, Qingyi Gu, Yang You, Zhen Dong, Kurt Keutzer

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 K-Sort Eval通过后验校正和动态匹配策略,实现高效可靠的视觉生成模型偏好评估。

Comments ICLR 2026. Code is available at: https://github.com/zkkli/K-Sort-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏