arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2506.05339 2026-03-05 cs.CL 57%

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

奉承、浮夸与雾:诊断和缓解偏好模型中的固有偏见

Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本研究通过反事实数据增强方法缓解偏好模型中的固有偏见,减少校准错误和偏斜差异,提升模型可靠性。

Comments Published at ICLR 2026; Code and data available at https://github.com/anirudhb123/preference-model-biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01124 2026-03-03 cs.CV cs.AI 57%

ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

ClinCoT:面向医学视觉语言模型的临床感知视觉推理链

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Jianxu Chen, Haolin Yang, Imran Razzak, Yutong Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05534 2026-03-03 cs.CL 57%

Revisiting Self-Play Preference Optimization: On the Role of Prompt Difficulty

重新审视自我对弈偏好优化:关于提示难度的作用

Yao Xiao, Jung-jae Kim, Roy Ka-wei Lee, Lidong Bing

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文研究了提示难度对自我对弈偏好优化的影响,发现困难提示会降低性能,而简单提示更有效,提出通过训练少量简单提示来提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 57%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23391 2026-03-02 cs.LG 57%

Detoxifying LLMs via Representation Erasure-Based Preference Optimization

通过基于表示擦除的偏好优化来净化大语言模型

Nazanin Mohammadi Sepahvand, Eleni Triantafillou, Hugo Larochelle, Doina Precup, Daniel M. Roy, Gintare Karolina Dziugaite

机构 * McGill University(麦吉尔大学) Mila Google DeepMind(谷歌DeepMind) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出REPO方法,通过基于表示擦除的偏好优化,有效净化大语言模型,提升其对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 57%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07922 2026-02-26 cs.LG 57%

SERL: Self-Examining Reinforcement Learning on Open-Domain

SERL:面向开放域的自我审查强化学习

Weixuan Ou, Yanzhao Zheng, Shuoshuo Sun, Wei Zhang, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Pengwei Yan, Yifan Qiao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 SERL通过自我审查机制提升开放域任务中的LLM性能,无需外部信号,实现演员与裁判的协同改进。

Comments Accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20595 2026-02-25 cs.CR cs.AI 57%

OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services

OptiLeak: 通过强化学习在多租户LLM服务中高效重建提示

Longxiang Wang, Xiang Zheng, Xuhao Zhang, Yao Zhang, Ye Wu, Cong Wang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 OptiLeak通过强化学习和两阶段微调,在多租户LLM服务中高效重建提示,减少请求次数达12.48倍,提升隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17814 2026-02-23 cs.CV cs.IR cs.LG 57%

VQPP: Video Query Performance Prediction Benchmark

VQPP:视频查询性能预测基准

Adrian Catalin Lutu, Eduard Poesina, Radu Tudor Ionescu

机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) University of Bucharest(布加勒斯大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 57%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15350 2026-02-18 eess.SY cs.AI cs.SY 57%

Fine-Tuning LLMs to Generate Economical and Reliable Actions for the Power Grid

对LLM进行微调以生成经济且可靠的电网动作

Mohamad Chehade, Hao Zhu

机构 * Chandra Family Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 本文提出一种多阶段适应管道,通过微调LLM生成经济且可靠的电网纠正切换计划,显著提高了电网运行效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16779 2026-02-18 cs.HC cs.LG 57%

Improving User Interface Generation Models from Designer Feedback

改进来自设计师反馈的用户界面生成模型

Jason Wu, Amanda Swearngin, Arun Krishna Vajjala, Alan Leung, Jeffrey Nichols, Titus Barik

机构 * Purdue University(普渡大学) Apple(苹果公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于设计师反馈的改进方法,通过评论、草图和直接操作等交互方式提升UI生成模型的质量,实验表明其优于传统排名反馈方法。

Comments Version accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 57%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12116 2026-02-13 cs.CL 57%

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

P-GenRM:具有测试时用户基于缩放的个性化生成奖励模型

Pinyi Zhang, Ting-En Lin, Yuchuan Wu, Jingyang Chen, Zongqi Wang, Hua Yang, Ze Xu, Fei Huang, Kai Zhang, Yongbin Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 P-GenRM通过测试时用户基于缩放机制,实现个性化生成奖励模型,提升用户偏好适应性和泛化能力。

Comments Accepted as ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12281 2026-02-10 cs.CL 57%

Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain

Legal$Δ$: 通过强化学习与链式思维引导信息增益提升大语言模型的法律推理

Xin Dai, Buqiang Xu, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Xiaoyuan Yi, Shuo Wang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL

AI总结 Legal$Δ$通过强化学习与链式思维引导信息增益提升法律推理的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 57%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05932 2026-02-06 cs.CL 57%

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

多项语言还是多群体?多语言大语言模型对价值导向的选择题的回答

Léo Labat, Etienne Ollion, François Yvon

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) CREST, CNRS, Institut Polytechnique de Paris(CREST、国家科学研究中心、巴黎高等理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究多语言LLM在价值导向选择题中的回答一致性,发现语言影响回答,需进一步探讨偏好微调的作用。

Comments 17 pages, 5 figures (8 pages of references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04493 2026-02-05 cs.CL cs.HC 57%

PersoDPO: Scalable Preference Optimization for Instruction-Adherent, Persona-Grounded Dialogue via Multi-LLM Evaluation

PersoDPO: 通过多LLM评估实现可扩展的偏好优化

Saleh Afzoon, MohammadHossein Ahmadi, Usman Naseem, Amin Beheshti

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 PersoDPO通过多LLM评估实现可扩展的偏好优化,提升对话系统的人格导向和上下文连贯性。

Comments Accepted at WISE 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18321 2026-02-05 cs.MM cs.CL cs.CV 57%

Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning

融合细粒度音频视觉证据以实现鲁棒的多模态情绪推理

Zhixian Zhao, Wenjie Tian, Lei Xie

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SABER-LLM通过构建大规模情绪推理数据集和结构化证据分解范式,实现鲁棒的多模态情绪推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03097 2026-02-04 cs.AI 57%

De-conflating Preference and Qualification: Constrained Dual-Perspective Reasoning for Job Recommendation with Large Language Models

解构偏好与资格:基于大语言模型的约束双视角推理 job 推荐

Bryce Kan, Wei Yang, Emily Nguyen, Ganghui Yi, Bowen Yi, Chenxiao Yu, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 JobRec通过约束双视角推理解构偏好与资格,提升职位推荐的可控性和匹配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02178 2026-02-04 cs.CL 57%

AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?

AR-MAP:自回归大语言模型是否是扩散大语言模型的隐式教师?

Liang Lin, Feng Xiong, Zengbin Wang, Kun Wang, Junhao Dong, Xuecai Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP,阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 AR-MAP通过利用自回归大语言模型作为隐式教师,有效提升扩散大语言模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01137 2026-02-03 cs.LG 57%

Self-Generative Adversarial Fine-Tuning for Large Language Models

自生成对抗微调用于大语言模型

Shiguang Wu, Yaqing Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出SGALM,通过生成对抗游戏实现大语言模型的对齐微调,无需外部奖励模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20668 2026-02-03 cs.CL 57%

PIRA: Preference-Oriented Instruction-Tuned Reward Models with Dual Aggregation

PIRA:基于双聚合的偏好导向指令调优奖励模型

Yongfu Xue

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 PIRA通过整合三种策略,利用LLM的偏好指令能力,提升奖励模型的鲁棒性和泛化能力,有效缓解奖励过度优化问题。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16142 2026-02-03 cs.CL 57%

RLKD: Distilling LLMs' Reasoning via Reinforcement Learning

通过强化学习蒸馏LLM的推理能力:RLKD

Shicheng Xu, Liang Pang, Yunchang Zhu, Jia Gu, Zihao Wei, Jingcheng Deng, Feiyang Pan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Huawei Inc.(华为公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RLKD通过强化学习和生成结构奖励模型,有效蒸馏LLM的多分支推理结构,提升学生模型的推理能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23161 2026-02-02 cs.SD cs.CL 57%

DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

DIFFA-2:一种实用的扩散大型语言模型用于通用音频理解

Jiaming Zhou, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 DIFFA-2是一种基于扩散模型的实用大型音频语言模型,通过升级语音编码器和双适配器提升音频理解性能,且在实际训练预算下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01458 2026-02-02 cs.LG 57%

How Well Can Preference Optimization Generalize Under Noisy Feedback?

在有噪声反馈下,偏好优化能有多好?

Shawn Im, Sharon Li

机构 * Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文研究了在噪声反馈下偏好优化的一般化能力,分析了不同噪声类型和强度对模型性能的影响,并验证了其在实际LLM训练中的有效性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 57%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL 57%

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17567 2026-01-27 cs.IR cs.AI 57%

Real-Time Trend Prediction via Continually-Aligned LLM Query Generation

通过持续对齐的LLM查询生成进行实时趋势预测

Zijing Hui, Wenhan Lyu, Shusen Wang, Li Chen, Chu Wang

机构 * Meta Platforms(Meta平台)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 RTTP通过持续对齐的LLM查询生成,在低流量搜索环境中实现实时趋势预测,显著提升尾部趋势检测精度和查询生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15120 2026-01-23 cs.AI 57%

Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories

从地面崛起:通过推导真实调用为虚拟轨迹来解决工具使用代理中的意图偏差

Qian Xiong, Yuekai Huang, Bo Yang, Yujia Zheng, Tianhao Li, Ziyou Jiang, Zhiyuan Chang, Zhaoyang Li, Huanxiang Feng, Mingyang Li

机构 * Beijing Forestry University(北京林业大学) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Duke University(杜克大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 RISE通过推导真实调用为虚拟轨迹,解决工具使用代理中的意图偏差问题,提升任务完成和意图对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏