arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3261 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3261 篇

2604.01787 2026-04-03 cs.CL 83%

DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment

DEFT:基于分布的高效微调以实现人类对齐

Liang Zhu, Feiteng Fang, Yuelin Bai, Longze Chen, Zhexiang Zhang, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Science and Technology of China(中国科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出DEFT框架,通过数据过滤和分布引导提升模型对齐效率与泛化能力,减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25145 2026-03-27 cs.CV cs.LG 83%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18507 2026-03-20 cs.AI 83%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04822 2026-03-06 cs.AI 83%

VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment

VISA: 通过屏蔽适应进行价值注入以实现个性化大语言模型对齐

Jiawei Chen, Tianzhuo Yang, Guoxi Zhang, Jiaming Ji, Yaodong Yang, Juntao Dai

机构 * Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 VISA通过屏蔽适应机制,有效缓解大语言模型对齐税,实现精细化价值观对齐与语义完整性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03827 2026-03-04 cs.CL 83%

STARS: Synchronous Token Alignment for Robust Supervision in Large Language Models

STARS: 同步标记对齐用于大语言模型中稳健的监督

Mohammad Atif Quamar, Mohammad Areeb, Mikhail Kuznetsov, Muslum Ozgur Ozmen, Z. Berkay Celik

机构 * Purdue University(普渡大学) Amazon(亚马逊) Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 STARS通过同步标记对齐方法提升大语言模型的对齐性能,实现稳健监督和高效系统吞吐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11661 2026-03-03 cs.AI 83%

Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm

夸克医疗对齐:一种全面的多维对齐与协作优化范式

Tianxiang Xu, Jiayi Liu, Yixuan Tong, Jialu Xu, Yunqing Wei, Kaiwen Feng, PanPan Hou, Kangping Yin, Jiyuan Hu, Hao Zhou, Zhenxin Ma, Jian Xu, Guanjun Jiang

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出夸克医疗对齐范式,通过多维对齐矩阵和统一优化机制解决医疗问答中的对齐问题,实现正确性、安全性和合规性的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20498 2026-02-26 cs.CL 83%

Robust Preference Alignment via Directional Neighborhood Consensus

通过方向邻域共识实现鲁棒偏好对齐

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 通过方向邻域共识实现鲁棒偏好对齐,提升模型在多样化偏好下的稳定性与可靠性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13415 2026-02-17 cs.LG 83%

MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection

MAVIS: 通过推理时值引导选择实现多目标对齐

Jeremy Carleton, Debajoy Mukherjee, Srinivas Shakkottai, Dileep Kalathil

机构 * Department of Electrical and Computer Engineering, Texas A\&M University, College Station, Texas, USA(电气与计算机工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 MAVIS通过推理时值引导选择实现多目标对齐,通过训练小价值模型动态调整LLM输出,提升多目标平衡性能。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11180 2026-02-13 cs.CL 83%

Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions

大语言模型对齐的机制可解释性:进展、挑战与未来方向

Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型对齐中机制可解释性的进展与挑战,提出未来研究方向,包括自动化可解释性、跨模型泛化和可解释性驱动的对齐技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08259 2026-02-10 stat.ML cs.LG 83%

A Statistical Framework for Alignment with Biased AI Feedback

带有偏见AI反馈的统计框架

Xintao Xia, Zhiqiu Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) Department of Statistics, Rutgers University(罗格斯大学统计学系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06836 2026-02-09 cs.AI 83%

LLM Active Alignment: A Nash Equilibrium Perspective

LLM主动对齐:从纳什均衡视角出发

Tonghan Wang, Yuqi Pan, Xinyi Yang, Yanchen Jiang, Milind Tambe, David C. Parkes

机构 * College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) Harvard University, Cambridge, MA, USA(哈佛大学,马萨诸塞州剑桥,美国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种基于纳什均衡的LLM主动对齐方法,通过建模代理行为以避免文本空间计算难题,并展示其在社交媒体中防止政治排斥的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06788 2026-02-09 cs.LG 83%

Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences

对抗位移的DPO扩展:非凸f-散度

Idan Pipano, Shoham Sabach, Kavosh Asadi, Mohammad Ghavamzadeh

机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) Technion - Israel Institute of Technology(技术ion-以色列理工学院) Meta Qualcomm AI Research(高通人工智能研究)

专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种对抗位移的DPO扩展方法,通过非凸f-散度改进了传统DPO,提供了更强的理论保证和实际表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10416 2026-01-16 cs.AI 83%

LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models

LLMdoctor: 基于令牌级流引导的偏好优化用于大语言模型高效测试时间对齐

Tiesunlong Shen, Rui Mao, Jin Wang, Heming Sun, Jian Zhang, Xuejie Zhang, Erik Cambria

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 LLMdoctor通过令牌级流引导偏好优化,实现高效的大语言模型测试时间对齐,提升对齐精度并保留生成多样性。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06596 2026-01-13 cs.CR cs.AI 83%

Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity

大型语言模型是否易受偏好削弱攻击(PUA)攻击?一种诊断偏好对齐与现实有效性之间权衡的因子分析方法

Hongjun An, Yiliang Song, Jiangan Chen, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics, Northwestern Polytechnical University(人工智能学院、光学与电子学院、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) School of Economics and Management, Guangxi Normal University(经济管理学院,广西师范大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种因子分析方法,用于诊断LLM在偏好对齐与现实有效性之间的权衡,揭示了高级模型可能更易受操纵性提示攻击,并强调了定制防御的重要性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05075 2026-01-09 cs.CL 83%

SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment

SemPA:通过语义偏好对齐提升大语言模型的句子嵌入

Ziyang Chen, Zhenxuan Huang, Yile Wang, Weiqin Wang, Lu Yin, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 SemPA通过语义偏好对齐提升大语言模型的句子嵌入能力,同时保持其生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03589 2026-01-08 cs.CL 83%

OLA: Output Language Alignment in Code-Switched LLM Interactions

OLA:代码切换交互中的输出语言对齐

Juhyun Oh, Haneul Yoo, Faiz Ghifari Haznitrama, Alice Oh

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00647 2026-01-05 cs.CL cs.CE q-bio.QM 83%

Physio-DPO: Aligning Large Language Models with the Protein Energy Landscape to Eliminate Structural Hallucinations

Physio-DPO:将大型语言模型与蛋白质能量景观对齐以消除结构幻觉

QiWei Meng

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL

AI总结 Physio-DPO通过引入物理感知的目标,将蛋白质语言模型与热力学稳定性对齐,有效减少结构幻觉并提升折叠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11518 2026-01-05 cs.CL 83%

W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search

W2S-AlignTree: 通过蒙特卡洛树搜索实现大语言模型的弱到强推理时对齐

Zhenyu Ding, Yuhao Wang, Tengyue Xiao, Haoying Wang, Caigui Jiang, Ning Ding

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 W2S-AlignTree通过结合MCTS与弱到强泛化范式,实现大语言模型在推理时的高效对齐,提升摘要任务性能15.9%。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15843 2026-01-01 cs.CL 83%

Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model

Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用

Junshu Pan, Wei Shen, Shulin Huang, Qiji Zhou, Yue Zhang

专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04453 2025-12-23 cs.LG 83%

ESSA: Evolutionary Strategies for Scalable Alignment

ESSA:可扩展对齐的进化策略

Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov, Alexey Khokhulin, Nikita Surnachev, Kirill Ovcharenko, George Bredis, Alexey Gorbatovski, Viacheslav Sinii, Daniil Gavrilov

机构 * T-Tech

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 ESSA通过进化策略实现大规模LLM对齐,无需梯度优化,提升模型准确率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13837 2025-12-17 cs.LG 83%

Explainable reinforcement learning from human feedback to improve alignment

通过人类反馈改进强化学习的可解释性以提升对齐

Shicheng Liu, Siyuan Xu, Wenjie Qiu, Hangfan Zhang, Minghui Zhu

机构 * Department of Electrical Engineering, Pennsylvania State University(宾夕法尼亚州立大学电气工程系) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出通过纠正RLHF中不满意响应的原因来提升语言模型对齐性的方法,结合事后解释与卸载技术改进模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11998 2025-12-16 cs.CL 83%

Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models

直接置信对齐:将 verbalized 置信度与内部置信度对齐于大语言模型

Glenn Zhang, Treasure Mayowa, Jason Fan, Yicheng Fu, Aaron Sandoval, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出直接置信对齐方法,通过优化使LLM的 verbalized 置信度与内部置信度对齐,提升模型透明度和可靠性。

Comments Accepted at ACL 2025 SRW, 5 pages body, 14 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06515 2025-12-09 cs.CL 83%

ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models

ProSocialAlign:语言模型中的偏好条件测试时间对齐

Somnath Banerjee, Sayan Layek, Sayantan Adak, Mykola Pechenizkiy, Animesh Mukherjee, Rima Hazra

机构 * Cisco Research(思科研究) Indian Institute of Technology Kharagpur(印度理工学院卡里格普尔分校) Eindhoven University of Technology, Netherlands (TU/e)(埃因霍温理工大学(荷兰))

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 ProSocialAlign通过测试时间参数高效方法,在不重新训练模型的情况下,引导生成安全、富有同理心且价值观一致的响应,提升语言模型的安全性和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16929 2025-12-09 cs.CV cs.AI 83%

TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment

TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解

Shicheng Li, Lei Li, Kun Ouyang, Shuhuai Ren, Yuanxin Liu, Yuanxing Zhang, Fuzheng Zhang, Lingpeng Kong, Qi Liu, Xu Sun

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。

Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23316 2025-12-04 cs.CL 83%

Proximalized Preference Optimization for Diverse Feedback Types: A Decomposed Perspective on DPO

近端化偏好优化用于多样化反馈类型:对DPO的分解视角

Kaiyang Guo, Yinchuan Li, Zhitang Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出PRO方法,通过分解DPO损失并恢复完整正则化项,解决似然不足确定性问题,提升对多样化反馈类型的适应能力。

Comments NeurIPS'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19387 2025-11-27 cs.LG cs.SY eess.SY math.OC 83%

Alignment of large language models with constrained learning

受限学习下的大语言模型对齐

Botong Zhang, Shuo Li, Ignacio Hounie, Osbert Bastani, Dongsheng Ding, Alejandro Ribeiro

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于拉格朗日对偶性的迭代对偶对齐方法,用于在满足约束条件下优化大语言模型策略,通过实验验证了其在受限对齐问题中的有效性。

Comments 51 pages, 5 figures, 11 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02709 2025-11-19 cs.LG 83%

Preference Robustness for DPO with Applications to Public Health

Cheol Woo Kim, Shresth Verma, Mauricio Tec, Milind Tambe

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09385 2025-11-18 cs.CL 83%

AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment

Ruibo Deng, Duanyu Feng, Wenqiang Lei

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

Comments AAAI 2026 AIA oral, our code is available at https://github.com/Shiroha-Offical/AMaPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02095 2025-11-04 cs.CV cs.LG 83%

Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences

Hyojin Bahng, Caroline Chan, Fredo Durand, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21794 2025-10-28 cs.CV cs.AI 83%

Token-Level Inference-Time Alignment for Vision-Language Models

Kejia Chen, Jiawen Zhang, Jiacong Hu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏