arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2505.23108 2025-05-30 cs.CL 57%

Generating Diverse Training Samples for Relation Extraction with Large Language Models

Zexuan Li, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(人工智能学院,南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(脑机智能技术重点实验室,教育部)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23037 2025-05-30 cs.CL 57%

Improving Multilingual Social Media Insights: Aspect-based Comment Analysis

Longyin Zhang, Bowei Zou, Ai Ti Aw

机构 * Institute for Infocomm Research, A*STAR, Singapore(信息与通信研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments The paper was peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22517 2025-05-29 cs.CL cs.MM 57%

Multi-MLLM Knowledge Distillation for Out-of-Context News Detection

Yimeng Gu, Zhao Tong, Ignacio Castro, Shu Wu, Gareth Tyson

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22172 2025-05-29 cs.CL 57%

Reverse Preference Optimization for Complex Instruction Following

Xiang Huang, Ting-En Lin, Feiteng Fang, Yuchuan Wu, Hangyu Li, Yuzhong Qu, Fei Huang, Yongbin Li

机构 * Tongyi Lab(通义实验室) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01834 2025-05-28 cs.CL eess.AS 57%

Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback

Guan-Ting Lin, Prashanth Gurunath Shivakumar, Aditya Gourav, Yile Gu, Ankur Gandhe, Hung-yi Lee, Ivan Bulyko

机构 * Amazon AGI(亚马逊人工智能实验室) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19484 2025-05-28 cs.CL 57%

CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data Synthesis

Ruixiang Feng, Shen Gao, Xiuying Chen, Lisi Chen, Shuo Shang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18952 2025-05-27 cs.LG 57%

Online Knowledge Distillation with Reward Guidance

Chen Jia

机构 * SI-TECH Information Technology(SI-TECH信息技术)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17540 2025-05-26 cs.CV cs.AI 57%

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

Mingrui Wu, Lu Wang, Pu Zhao, Fangkai Yang, Jianjin Zhang, Jianfeng Liu, Yuefeng Zhan, Weihao Han, Hao Sun, Jiayi Ji, Xiaoshuai Sun, Qingwei Lin, Weiwei Deng, Dongmei Zhang, Feng Sun, Qi Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学) Microsoft(微软)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Code is available at: https://github.com/microsoft/DKI_LLM/tree/main/RePrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16475 2025-05-23 cs.AI 57%

ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection

Jiaqi Li, Xinyi Dong, Yang Liu, Zhizhuo Yang, Quansen Wang, Xiaobo Wang, SongChun Zhu, Zixia Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16265 2025-05-23 cs.LG 57%

Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models

Ilgee Hong, Changlong Yu, Liang Qiu, Weixiang Yan, Zhenghao Xu, Haoming Jiang, Qingru Zhang, Qin Lu, Xin Liu, Chao Zhang, Tuo Zhao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18101 2025-05-23 cs.CL 57%

Diverse Preference Optimization

Jack Lanchantin, Angelica Chen, Shehzaad Dhuliawala, Ping Yu, Jason Weston, Sainbayar Sukhbaatar, Ilia Kulikov

机构 * Meta

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15779 2025-05-22 cs.CV cs.AI 57%

IA-T2I: Internet-Augmented Text-to-Image Generation

Chuanhao Li, Jianwen Sun, Yukang Feng, Mingliang Zhai, Yifan Chang, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments 12 pages, 7 figures, a framework that integrates reference images from the Internet into T2I/TI2I models

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02095 2025-05-21 cs.CL 57%

LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information

Bowen Ping, Jiali Zeng, Fandong Meng, Shuo Wang, Jie Zhou, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Pattern Recongnition Center, WechatAI, Tencent Inc(图案识别中心,微信AI,腾讯公司) Dept. of Comp. Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13403 2025-05-20 cs.CL 57%

MR. Judge: Multimodal Reasoner as a Judge

Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiulong Shan, Kieran Liu, Meng Cao

机构 * HKUST(香港科技大学) Apple(苹果公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13081 2025-05-20 cs.LG cs.CV 57%

Walking the Tightrope: Disentangling Beneficial and Detrimental Drifts in Non-Stationary Custom-Tuning

Xiaoyu Yang, Jie Lu, En Yu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faulty of Engineering and Information Technology(工程与信息技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments 17 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17061 2025-05-20 cs.CL 57%

Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration

Hai Ye, Mingbao Lin, Hwee Tou Ng, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Skywork AI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02718 2025-05-20 cs.CR cs.CL 57%

"Yes, My LoRD." Guiding Language Model Extraction with Locality Reinforced Distillation

Zi Liang, Qingqing Ye, Yanyun Wang, Sen Zhang, Yaxin Xiao, Ronghua Li, Jianliang Xu, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Baptist University(香港 Baptist大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments To appear at ACL 25 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12348 2025-05-20 cs.AI 57%

Reasoning-CV: Fine-tuning Powerful Reasoning LLMs for Knowledge-Assisted Claim Verification

Zhi Zheng, Wee Sun Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10527 2025-05-20 cs.CL 57%

WorldPM: Scaling Human Preference Modeling

Binghai Wang, Runji Lin, Keming Lu, Le Yu, Zhenru Zhang, Fei Huang, Chujie Zheng, Kai Dang, Yang Fan, Xingzhang Ren, An Yang, Binyuan Hui, Dayiheng Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Bowen Yu, Jingren Zhou, Junyang Lin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20157 2025-05-20 cs.CL 57%

Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models

Zae Myung Kim, Chanwoo Park, Vipul Raheja, Suin Kim, Dongyeop Kang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Code and data: https://github.com/minnesotanlp/mpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22480 2025-05-19 cs.LG 57%

Probabilistic Uncertain Reward Model

Wangtao Sun, Xiang Cheng, Xing Yu, Haotian Xu, Zhao Yang, Shizhu He, Jun Zhao, Kang Liu

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与复杂系统决策智能实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司) Meituan Inc(美团公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14289 2025-05-09 cs.CL 57%

Drift: Decoding-time Personalized Alignments with Implicit User Preferences

Minbeom Kim, Kang-il Lee, Seongho Joo, Hwaran Lee, Thibaut Thonet, Kyomin Jung

机构 * Seoul National University(首尔国立大学) Sogang University(ソガン大学) NAVER AI Lab(NAVER AI实验室) NAVER Labs Europe(NAVER欧洲实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02142 2025-05-06 cs.CL 57%

Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study

Xiaoyu Tian, Sitong Zhao, Haotian Wang, Shuaiting Chen, Yiping Peng, Yunjie Ji, Han Zhao, Xiangang Li

机构 * a-m-team(a-m团队)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21233 2025-05-01 cs.CL 57%

Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math

Haoran Xu, Baolin Peng, Hany Awadalla, Dongdong Chen, Yen-Chun Chen, Mei Gao, Young Jin Kim, Yunsheng Li, Liliang Ren, Yelong Shen, Shuohang Wang, Weijian Xu, Jianfeng Gao, Weizhu Chen

机构 * Microsoft(微软)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18580 2025-04-29 cs.LG 57%

Parameter-Efficient Checkpoint Merging via Metrics-Weighted Averaging

Shi Jie Yu, Sehyun Choi

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18203 2025-04-24 cs.CV cs.CL 57%

Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning

Di Zhang, Junxian Li, Jingdi Lei, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, Peng Ye, Wanli Ouyang, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Nankai University(南开大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) Nanjing University(南京大学) University of California, Merced(加州大学梅德福分校) Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15804 2025-04-23 cs.AR cs.AI 57%

Insights from Verification: Training a Verilog Generation LLM with Reinforcement Learning with Testbench Feedback

Ning Wang, Bingkun Yao, Jie Zhou, Yuchen Hu, Xi Wang, Nan Guan, Zhe Jiang

机构 * City University of Hong Kong(香港城市大学) Southeast University(东南大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14838 2025-04-22 cs.AI 57%

Establishing Reliability Metrics for Reward Models in Large Language Models

Yizhou Chen, Yawen Liu, Xuesi Wang, Qingtao Yu, Guangda Huzhang, Anxiang Zeng, Han Yu, Zhiming Zhou

机构 * Nanyang Technological University(新加坡国立大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13122 2025-04-18 cs.CV cs.LG 57%

VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Haojian Huang, Haodong Chen, Shengqiong Wu, Meng Luo, Jinlan Fu, Xinya Du, Hanwang Zhang, Hao Fei

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments Code and Data: https://github.com/HaroldChen19/VistaDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15124 2025-04-16 cs.CL 57%

Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Nathan Lambert, Jacob Morrison, Valentina Pyatkin, Shengyi Huang, Hamish Ivison, Faeze Brahman, Lester James V. Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D. Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Chris Wilhelm, Luca Soldaini, Noah A. Smith, Yizhong Wang, Pradeep Dasigi, Hannaneh Hajishirzi

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Added Tulu 3 405B results and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏