arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2505.07886 2025-05-14 cs.CL cs.AI 62%

PLHF: Prompt Optimization with Few-Shot Human Feedback

Chun-Pai Yang, Kan Zheng, Shou-De Lin

机构 * ZRT Technology(ZRT技术) National Taiwan University(国立台湾大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07858 2025-05-14 cs.CL cs.AI 62%

Scaling Laws for Speculative Decoding

Siyuan Yan, Mo Zhu, Guo-qing Jiang, Jianfei Wang, Jiaxing Chen, Wentai Zhang, Xiang Liao, Xiao Cui, Chen Zhang, Zhuoran Song, Ran Zhu

机构 * Red Note Hi-Lab(红笔记高研实验室) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05704 2025-05-12 cs.CL cs.AI 62%

Assessing Robustness to Spurious Correlations in Post-Training Language Models

Julia Shuieh, Prasann Singhal, Apaar Shanker, John Heyer, George Pu, Samuel Denton

机构 * Scale AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments ICLR '25 Workshop on Spurious Correlation and Shortcut Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04284 2025-05-08 cs.CL cs.AI 62%

GASCADE: Grouped Summarization of Adverse Drug Event for Enhanced Cancer Pharmacovigilance

Sofia Jamil, Aryan Dabad, Bollampalli Areen Reddy, Sriparna Saha, Rajiv Misra, Adil A. Shakur

机构 * Department of Computer Science & Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布分校计算机科学与工程系) Indira Gandhi Institute of Medical Sciences, Patna(英伽丁医学科学学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01435 2025-05-06 cs.IR cs.CL cs.DC cs.LG 62%

AdaParse: An Adaptive Parallel PDF Parsing and Resource Scaling Engine

Carlo Siebenschuh, Kyle Hippe, Ozan Gokdemir, Alexander Brace, Arham Khan, Khalid Hossain, Yadu Babuji, Nicholas Chia, Venkatram Vishwanath, Rick Stevens, Arvind Ramanathan, Ian Foster, Robert Underwood

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments This paper has been accepted at the The Eighth Annual Conference on Machine Learning and Systems (MLSys 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02894 2025-04-24 cs.CL cs.AI 62%

OnRL-RAG: Real-Time Personalized Mental Health Dialogue System

Ahsan Bilal, Beiyu Lin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments It needs more revisions. I am currently working on it with my co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07640 2025-04-22 cs.LG cs.AI 62%

Goedel-Prover: A Frontier Model for Open-Source Automated Theorem Proving

Yong Lin, Shange Tang, Bohan Lyu, Jiayun Wu, Hongzhou Lin, Kaiyu Yang, Jia Li, Mengzhou Xia, Danqi Chen, Sanjeev Arora, Chi Jin

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿语言与智能,普林斯顿大学) Tsinghua University(清华大学) Amazon(亚马逊) Meta FAIR Numina

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08772 2025-04-15 cs.LG cs.AI 62%

Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning

Younghwan Lee, Tung M. Luu, Donghoon Lee, Chang D. Yoo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 5 pages, ICASSP 2025. First two authors are equally contributed

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21037 2025-04-11 cs.SD cs.AI cs.CL eess.AS 62%

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Chia-Yu Hung, Navonil Majumder, Zhifeng Kong, Ambuj Mehrish, Amir Ali Bagherzadeh, Chuan Li, Rafael Valle, Bryan Catanzaro, Soujanya Poria

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments https://tangoflux.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16615 2025-04-10 cs.IR cs.CL cs.LG 62%

Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval

Luo Ji, Feixiang Guo, Teng Chen, Qingqing Gu, Xiaoyu Wang, Ningyuan Xi, Yihong Wang, Peng Yu, Yue Zhao, Hongyang Lei, Zhonglin Jiang, Yong Chen

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 3 figures, ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00092 2025-04-09 cs.CL cs.AI 62%

Large Language Model for Patent Concept Generation

Runtao Ren, Jian Ma, Jianxi Luo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in Advanced Engineering Informatics, Link: https://doi.org/10.1016/j.aei.2025.103301

Journal ref Advanced Engineering Informatics 65 (2025): 103301

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23371 2025-04-01 cs.CL cs.AI 62%

FeRG-LLM : Feature Engineering by Reason Generation Large Language Models

Jeonghyun Ko, Gyeongyun Park, Donghoon Lee, Kyunam Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10020 2025-03-31 cs.CL cs.AI 62%

Self-Rewarding Language Models

Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19988 2025-03-27 cs.LG cs.AI cs.DB 62%

ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback

Bohan Zhai, Canwen Xu, Yuxiong He, Zhewei Yao

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17236 2025-03-25 cs.CL cs.AI cs.IR 62%

Large Language Models Empowered Personalized Web Agents

Hongru Cai, Yongqi Li, Wenjie Wang, Fengbin Zhu, Xiaoyu Shen, Wenjie Li, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to WWW 2025. The code and data are available on the project website https://hongrucai.github.io/PersonalWAB/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17126 2025-03-24 cs.CL cs.LG 62%

Modifying Large Language Model Post-Training for Diverse Creative Writing

John Joon Young Chung, Vishakh Padmakumar, Melissa Roemmele, Yuqian Sun, Max Kreminski

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12556 2025-03-18 cs.CL cs.AI 62%

From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations

Sarvesh Baskar, Tanmay Tulsidas Verelakar, Srinivasan Parthasarathy, Manas Gaur

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 1 Figure, Oral Presentation at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06810 2025-03-11 cs.LG cs.AI 62%

Mitigating Preference Hacking in Policy Optimization with Pessimism

Dhawal Gupta, Adam Fisch, Christoph Dann, Alekh Agarwal

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03796 2025-03-10 cs.MA cs.AI cs.LG cs.RO 62%

Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm

Hyeonjun Kim, Kanghoon Lee, Junho Park, Jiachen Li, Jinkyoo Park

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02989 2025-03-06 cs.CL cs.AI 62%

Effectively Steer LLM To Follow Preference via Building Confident Directions

Bingqing Song, Boran Han, Shuai Zhang, Hao Wang, Haoyang Fang, Bonan Min, Yuyang Wang, Mingyi Hong

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20468 2025-03-06 cs.AI cs.CY 62%

A Comprehensive Framework for Reliable Legal AI: Combining Specialized Expert Systems and Adaptive Refinement

Sidra Nasir, Qamar Abbas, Samita Bai, Rizwan Ahmed Khan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.CY

Comments 16 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09230 2025-03-05 cs.CL cs.AI 62%

Improving Semantic Understanding in Speech Language Models via Brain-tuning

Omer Moussa, Dietrich Klakow, Mariya Toneva

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00018 2025-03-04 cs.CL cs.AI 62%

Eeyore: Realistic Depression Simulation via Supervised and Preference Optimization

Siyang Liu, Bianca Brie, Wenda Li, Laura Biester, Andrew Lee, James Pennebaker, Rada Mihalcea

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19328 2025-02-27 cs.CL cs.AI 62%

Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Bin Xu, Lei Hou, Juanzi Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08964 2025-02-27 cs.CL cs.AI 62%

Language Imbalance Driven Rewarding for Multilingual Self-improving

Wen Yang, Junhong Wu, Chen Wang, Chengqing Zong, Jiajun Zhang

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments Camera ready version for ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16793 2025-02-25 cs.LG cs.AI 62%

Adam-mini: Use Fewer Learning Rates To Gain More

Yushun Zhang, Congliang Chen, Ziniu Li, Tian Ding, Chenwei Wu, Diederik P. Kingma, Yinyu Ye, Zhi-Quan Luo, Ruoyu Sun

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14868 2025-02-25 cs.CL cs.LG 62%

Direct Multi-Turn Preference Optimization for Language Agents

Wentao Shi, Mengqi Yuan, Junkang Wu, Qifan Wang, Fuli Feng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments Accepted by EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02306 2025-02-25 cs.LG cs.AI 62%

On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback

Marcus Williams, Micah Carroll, Adhyyan Narang, Constantin Weisser, Brendan Murphy, Anca Dragan

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14834 2025-02-21 cs.CV cs.AI cs.CL 62%

LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language Models

Shangqing Tu, Yucheng Wang, Daniel Zhang-Li, Yushi Bai, Jifan Yu, Yuhao Wu, Lei Hou, Huiqin Liu, Zhiyuan Liu, Bin Xu, Juanzi Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14272 2025-02-21 cs.CL cs.AI 62%

Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models

Yanggan Gu, Junzhuo Li, Sirui Huang, Xin Zou, Zhenghua Li, Xuming Hu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏