arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-03 至 2025-09-03 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 12 篇

2509.00309 2025-09-03 cs.CL 83%

Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models

Chen Zheng, Yiyuan Ma, Yuan Yang, Deyi Liu, Jing Liu, Zuquan Song, Yuxin Song, Cheng Ren, Hang Zhu, Xin Liu, Yiyuan Ma, Siyuan Qiao, Xun Zhou, Liang Xiang, Yonghui Wu

机构 * Peking University(北京大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20491 2025-09-03 cs.CV cs.CL cs.LG 82%

VPO: Aligning Text-to-Video Generation Models with Prompt Optimization

Jiale Cheng, Ruiliang Lyu, Xiaotao Gu, Xiao Liu, Jiazheng Xu, Yida Lu, Jiayan Teng, Zhuoyi Yang, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02666 2025-09-03 cs.CL 79%

A Survey on Progress in LLM Alignment from the Perspective of Reward Design

Miaomiao Ji, Yanqiu Wu, Zhibin Wu, Shoujin Wang, Jian Yang, Mark Dras, Usman Naseem

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00373 2025-09-03 cs.CV cs.AI 70%

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

Sihao Wu, Gaojie Jin, Wei Huang, Jianhong Wang, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) Purple Mountain Laboratories(紫金山实验室) University of Bristol(布里斯托大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00685 2025-09-03 eess.AS cs.SD 67%

MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech

Kangxiang Xia, Xinfa Zhu, Jixun Yao, Lei Xie

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments Accepted by NCMMSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03742 2025-09-03 cs.CL cs.AI cs.LG 67%

Beyond Scalar Reward Model: Learning Generative Judge from Preference Data

Ziyi Ye, Xiangsheng Li, Qiuchi Li, Qingyao Ai, Yujia Zhou, Wei Shen, Dong Yan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Baichuan AI(拜智科技) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref The Thirteenth International Conference on Learning Representations 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05790 2025-09-03 cs.AI cs.HC cs.LG 66%

Understanding Impact of Human Feedback via Influence Functions

Taywon Min, Haeone Lee, Yongchan Kwon, Kimin Lee

机构 * KAIST(韩国科学技术院) Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :RLHF(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted at ACL 2025, Source code: https://github.com/mintaywon/IF_RLHF

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics 63 (2025) 27471-27500

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21496 2025-09-03 cs.CV cs.AI 57%

ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding

Hao Lu, Jiahao Wang, Yaolun Zhang, Ruohui Wang, Xuanyu Zheng, Yepeng Tang, Dahua Lin, Lewei Lu

机构 * Sensetime(秒氏科技)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01035 2025-09-03 cs.CL 57%

We Politely Insist: Your LLM Must Learn the Persian Art of Taarof

Nikta Gohari Sadr, Sahar Heidariasl, Karine Megerdoomian, Laleh Seyyed-Kalantari, Ali Emami

机构 * Brock University(布鲁克大学) Zoorna AI York University(约克大学) Emory University(埃默里大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03612 2025-09-03 cs.CL 57%

AIR: A Systematic Analysis of Annotations, Instructions, and Response Pairs in Preference Dataset

Bingxiang He, Wenbin Zhang, Jiaxi Song, Cheng Qian, Zixuan Fu, Bowen Sun, Ning Ding, Haiwen Hong, Longtao Huang, Hui Xue, Ganqu Cui, Wanxiang Che, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Lab(上海人工智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accept at the Conference On Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01610 2025-09-03 cs.CV 50%

Improving Large Vision and Language Models by Learning from a Panel of Peers

Jefferson Hernandez, Jing Shi, Simon Jenni, Vicente Ordonez, Kushal Kafle

机构 * Rice University(里士大学) Adobe Research(Adobe研究)

专题命中 偏好对齐 :alignment(abstract)

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01232 2025-09-03 cs.CV 50%

FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework

Lingzhou Mu, Qiang Wang, Fan Jiang, Mengchao Wang, Yaqi Fan, Mu Xu, Kai Zhang

专题命中 偏好对齐 :DPO(abstract)

Comments https://fantasy-amap.github.io/fantasy-hsi/

详情

展开后加载摘要…

URL PDF HTML 收藏