arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2503.00231 2025-03-04 cs.CL cs.AI 79%

Jawaher: A Multidialectal Dataset of Arabic Proverbs for LLM Benchmarking

Samar M. Magdy, Sang Yun Kwon, Fakhraddin Alwajih, Safaa Abdelfadil, Shady Shehata, Muhammad Abdul-Mageed

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

Comments Project GitHub page is accessible at: https://github.com/UBC-NLP/jawaher

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15599 2025-02-10 cs.LG cs.AI 79%

Pareto-Optimal Learning from Preferences with Hidden Context

Ryan Bahlous-Boldi, Li Ding, Lee Spector, Scott Niekum

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19605 2025-02-04 cs.LG cs.CL 79%

The Crucial Role of Samplers in Online Direct Preference Optimization

Ruizhe Shi, Runlong Zhou, Simon S. Du

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments ICLR accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08458 2025-02-03 cs.LG cs.CL 79%

Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both

Abhijnan Nath, Changsoo Jung, Ethan Seefried, Nikhil Krishnaswamy

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01878 2025-01-28 cs.CL cs.LG 79%

LiPO: Listwise Preference Optimization through Learning-to-Rank

Tianqi Liu, Zhen Qin, Junru Wu, Jiaming Shen, Misha Khalman, Rishabh Joshi, Yao Zhao, Mohammad Saleh, Simon Baumgartner, Jialu Liu, Peter J. Liu, Xuanhui Wang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments Accepted at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01544 2025-01-06 cs.LG cs.CL stat.ML 79%

Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information

Rasul Tutnov, Antoine Grosnit, Haitham Bou-Ammar

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06411 2024-12-02 cs.LG cs.CL 79%

Length Desensitization in Direct Preference Optimization

Wei Liu, Yang Bai, Chengcheng Han, Rongxiang Weng, Jun Xu, Xuezhi Cao, Jingang Wang, Xunliang Cai

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);harmlessness(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03650 2024-10-04 cs.LG cs.CL 79%

On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization

Yong Lin, Skyler Seto, Maartje ter Hoeve, Katherine Metcalf, Barry-John Theobald, Xuan Wang, Yizhe Zhang, Chen Huang, Tong Zhang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments 12 pages, 8 tables, 3 figures; Paper Accepted at EMNLP Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17791 2024-09-27 cs.CL cs.AI 79%

Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness

Jian Li, Haojing Huang, Yujia Zhang, Pengfei Xu, Xi Chen, Rui Song, Lida Shi, Jingwen Wang, Hao Xu

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10571 2024-09-18 cs.LG cs.AI 79%

ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood

Ruoyu Wang, Jiachen Sun, Shaowei Hua, Quan Fang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19159 2024-09-10 cs.CL cs.LG 79%

Disentangling Length from Quality in Direct Preference Optimization

Ryan Park, Rafael Rafailov, Stefano Ermon, Chelsea Finn

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11999 2024-09-02 cs.CL cs.AI 79%

Token-level Direct Preference Optimization

Yongcheng Zeng, Guoqing Liu, Weiyu Ma, Ning Yang, Haifeng Zhang, Jun Wang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09641 2024-06-21 cs.AI cs.CL cs.CR cs.HC 79%

RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models

Jiongxiao Wang, Junlin Wu, Muhao Chen, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12182 2024-06-19 cs.CL cs.AI 79%

Aqulia-Med LLM: Pioneering Full-Process Open-Source Medical Language Models

Lulu Zhao, Weihao Zeng, Xiaofeng Shi, Hua Zhou, Donglin Hao, Yonghua Lin

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10977 2024-06-18 cs.CL cs.AI 79%

Toward Optimal LLM Alignments Using Two-Player Games

Rui Zheng, Hongyi Guo, Zhihan Liu, Xiaoying Zhang, Yuanshun Yao, Xiaojun Xu, Zhaoran Wang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Hang Li, Yang Liu

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Our code is released at https://github.com/ruizheng20/gpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07657 2024-06-13 cs.LG cs.CL 79%

OPTune: Efficient Online Preference Tuning

Lichang Chen, Jiuhai Chen, Chenxi Liu, John Kirchenbauer, Davit Soselia, Chen Zhu, Tom Goldstein, Tianyi Zhou, Heng Huang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08685 2024-04-02 cs.CL cs.AI 79%

Safer-Instruct: Aligning Language Models with Automated Preference Data

Taiwei Shi, Kai Chen, Jieyu Zhao

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

Comments 16 pages. NAACL 2024 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11296 2024-02-20 cs.CL cs.AI 79%

Dissecting Human and LLM Preferences

Junlong Li, Fan Zhou, Shichao Sun, Yikai Zhang, Hai Zhao, Pengfei Liu

专题命中 偏好对齐 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08466 2026-07-31 cs.IR 版本更新 78%

ToolRec: Calibrated Preference Alignment for Query Recommendation in On-Device Assistants

ToolRec: 面向设备端助手的校准偏好对齐查询推荐

Zihan Luo, Lingkui Chen, Ruike Zhang, Hong Huang, Boyang Zhang, Ziniu Chen, Lizhong Wang, Chao Chen

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 提出ToolRec框架,通过构建系统工具库和双层校准机制优化点击数据,利用加权KTO对齐模型,在设备端助手查询推荐中提升点击率和相关性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02061 2026-07-29 cs.IR 版本更新 78%

Reason4Rec: Deliberative User Preference Alignment of Large Language Models for Recommendation

Reason4Rec:用于推荐的大语言模型的审慎用户偏好对齐

Yi Fang, Wenjie Wang, Yang Zhang, Fengbin Zhu, Qifan Wang, Fuli Feng, Xiangnan He

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 研究旨在开发更可靠的推荐LLMs,引入“审慎推荐”任务并提出“推理驱动的推荐器”框架,利用语言化用户反馈增强推理能力,经实验验证该框架能提升预测准确性和推理质量。

Comments Accepted to IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 78%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03216 2026-06-03 cs.CV 78%

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

Follow-Your-Preference++:重新思考图像修复中的偏好对齐

Junkun Yuan, Yutao Shen, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * Zhejiang University(浙江大学) The University of Tokyo(东京大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。

Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13875 2026-05-15 cs.GT 78%

Common-agency Games for Multi-Objective Test-Time Alignment

多目标测试时对齐的共同代理博弈

Baiting Chen, Tong Zhu, Rui Yu, Xiaowu Dai

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出CAGE框架,通过游戏理论实现多目标测试时对齐,无需重新训练,支持灵活的权衡和弱到强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05000 2026-05-14 cs.LG cs.AI cs.CL 78%

Entropy Aware Reward Guidance for Diffusion Language Model Alignment

基于熵的奖励引导用于扩散语言模型对齐

Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11662 2026-05-13 cs.IR 78%

HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware Alignment

HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐

Guorui Li, Dugang Liu, Lei Li, Xing Tang, Zhong Ming

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV 78%

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16201 2026-03-16 cs.CV 78%

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美洲实验室) University of California, Riverside(加州大学河滨分校)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 78%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17636 2026-02-20 cs.CV 78%

CORAL: Correspondence Alignment for Improved Virtual Try-On

CORAL: 用于改进虚拟试衣的对应对齐

Jiyoung Kim, Youngjin Shin, Siyoon Jin, Dahyun Chung, Jisu Nam, Tongmin Kim, Jongjae Park, Hyeonwoo Kang, Seungryong Kim

机构 * NC AI Co., Ltd(NC AI公司)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 CORAL通过引入基于DiT的框架,显式对齐查询-键匹配与外部对应关系,从而提升虚拟试衣中的人-服装对应精度和细节保留能力。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11753 2026-02-13 cs.HC 78%

Building Intelligent User Interfaces for Human-AI Alignment

构建智能用户界面以实现人机对齐

Danqing Shi

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出参考模型,通过分析用户界面改进人机对齐,展示两个案例研究和六个界面的初步调查,强调人机交互对对齐的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏