arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2512.02665 2025-12-03 cs.CL 74%

Input Order Shapes LLM Semantic Alignment in Multi-Document Summarization

输入顺序影响多文档摘要中LLM语义对齐

Jing Ma

机构 * University of Zurich(苏黎世大学)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 研究发现输入顺序显著影响LLM在多文档摘要中的语义对齐,优先位置的文章对摘要的语义相似性有显著影响。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03459 2025-10-16 cs.LG 74%

Can DPO Learn Diverse Human Values? A Theoretical Scaling Law

Shawn Im, Sharon Li

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :DPO(title);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03095 2025-06-04 cs.AI cs.CV 74%

DPO Learning with LLMs-Judge Signal for Computer Use Agents

Man Luo, David Cobbley, Xin Su, Shachar Rosenman, Vasudev Lal, Shao-Yen Tseng, Phillip Howard

机构 * Intel(英特尔) Thoughtworks

专题命中 偏好对齐 :DPO(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18710 2025-05-27 cs.IR cs.AI 74%

GainRAG: Preference Alignment in Retrieval-Augmented Generation through Gain Signal Synthesis

Yi Jiang, Sendong Zhao, Jianbo Li, Haochun Wang, Bing Qin

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16610 2025-05-23 cs.CL 74%

From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment

Jing Ye, Lu Xiang, Yaping Zhang, Chengqing Zong

专题命中 偏好对齐 :alignment(title);分类 cs.CL

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08507 2025-05-14 cs.LG 74%

InfoPO: On Mutual Information Maximization for Large Language Model Alignment

Teng Xiao, Zhen Ge, Sujay Sanghavi, Tian Wang, Julian Katz-Samuels, Marc Versage, Qingjun Cui, Trishul Chilimbi

机构 * Amazon(亚马逊)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03156 2025-05-07 cs.IT cs.AI math.IT 74%

Soft Best-of-n Sampling for Model Alignment

Claudio Mayrink Verdun, Alex Oesterling, Himabindu Lakkaraju, Flavio P. Calmon

机构 * Harvard University(哈佛大学) Harvard Business School(哈佛商学院)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

Comments Accepted for presentation at the 2025 IEEE International Symposium on Information Theory (ISIT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05535 2025-04-09 cs.CL 74%

COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values

P Team, Siwei Wu, Jincheng Ren, Xinrun Du, Shuyue Guo, Xingwei Qu, Yiming Liang, Jie Liu, Yunwen Li, Tianyu Zheng, Boyu Feng, Huaqing Yuan, Zenith Wang, Jiaheng Liu, Wenhao Huang, Chenglin Cai, Haoran Que, Jian Yang, Yuelin Bai, Zekun Moore Wang, Zhouliang Yu, Qunshu Lin, Ding Pan, Yuchen Jiang, Tiannan Wang, Wangchunshu Zhou, Shenzhi Wang, Xingyuan Bu, Minghao Liu, Guoyin Wang, Ge Zhang, Chenghua Lin

专题命中 偏好对齐 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18013 2025-03-25 cs.CV cs.AI 74%

Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Yufei Zhan, Yousong Zhu, Shurong Zheng, Hongyin Zhao, Fan Yang, Ming Tang, Jinqiao Wang

专题命中 偏好对齐 :alignment(title);分类 cs.AI

Comments Project in development. Github: https://github.com/jefferyZhan/Griffon/tree/master/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11584 2025-03-14 cs.RO cs.AI cs.CV 74%

DeformPAM: Data-Efficient Learning for Long-horizon Deformable Object Manipulation via Preference-based Action Alignment

Wendi Chen, Han Xue, Fangyuan Zhou, Yuan Fang, Cewu Lu

专题命中 偏好对齐 :alignment(title);分类 cs.AI

Comments Accepted to ICRA 2025. Project page: https://deform-pam.robotflow.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10695 2024-10-23 cs.CV cs.AI cs.GR 74%

Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models

Bingchen Liu, Ehsan Akhgari, Alexander Visheratin, Aleks Kamko, Linmiao Xu, Shivam Shrirao, Chase Lambert, Joao Souza, Suhail Doshi, Daiqing Li

专题命中 偏好对齐 :alignment(title);分类 cs.AI

Comments Project page: https://playground.com/pg-v3

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04112 2024-10-08 cs.CL 74%

Exploring LLM-based Data Annotation Strategies for Medical Dialogue Preference Alignment

Chengfeng Dou, Ying Zhang, Zhi Jin, Wenpin Jiao, Haiyan Zhao, Yongqiang Zhao, Zhengwei Tao

专题命中 偏好对齐 :alignment(title);分类 cs.CL

Comments 14 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14313 2024-05-22 cs.CL 74%

Self-Supervised Alignment with Mutual Information: Learning to Follow Principles without Preference Labels

Jan-Philipp Fränken, Eric Zelikman, Rafael Rafailov, Kanishk Gandhi, Tobias Gerstenberg, Noah D. Goodman

专题命中 偏好对齐 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21864 2026-08-25 cs.LG cs.AI cs.CV 新提交 73%

BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications

BioMed-Agent-RL:元学习,生物医学应用的一切所需

Md Asaduzzaman Jabin, Zihao Wu, Tianming Liu

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对临床视觉大语言模型的缺陷,提出BioMed-Agent-RL医学智能体,整合多模态元学习与强化学习等技术,在多基准实验中准确率达约73%,较现有模型提升约5%,为临床智能体系统建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-08-25 cs.MA cs.AI cs.CL 版本更新 73%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17378 2026-08-24 cs.LG cs.AI 版本更新 73%

Efficient Exploration at Scale

大规模高效探索

Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy

机构 * Google(谷歌) DeepMind(深度思维)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18531 2026-08-20 cs.AI cs.LG 新提交 73%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09432 2026-08-11 cs.CL cs.AI 新提交 73%

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现

Róisín Luo

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00155 2026-08-11 cs.LG cs.CL math.OC stat.ML 版本更新 73%

Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback

Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习

Yikai Wang, Shang Liu, Jose Blanchet

机构 * Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学) Imperial Business School, Imperial College London(帝国理工学院伦敦商学院) Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出Wasserstein分布鲁棒遗憾优化(DRRO)用于强化学习从人类反馈,通过简单分配模型研究提示问题,展示在ℓ1-地面成本Wasserstein模糊集下,内最坏遗憾有精确解,最优策略具有水填充结构,从而实现高效政策梯度算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08027 2026-07-30 cs.CL cs.CY 73%

"Amazing, They All Lean Left" -- Analyzing the Political Temperaments of Current LLMs

W. Russell Neuman, Chad Coleman, Ali Dasdan, Safinah Ali, Manan Shah, Kund Meghani

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22083 2026-07-28 cs.AI cs.CL 版本更新 73%

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

南贝格4.2 - 3B:以紧凑模式解锁智能体能力

Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20448 2026-07-24 cs.CL cs.LG 新提交 73%

Domyn-Small: A European 10B Reasoning Language Model

Domyn-Small:一个欧洲的100亿参数推理语言模型

Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino

机构 * CINECA(意大利国家计算应用研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20433 2026-07-24 cs.CL cs.AI 新提交 73%

Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing

莫尔:让模型为稳健的跨域知识编辑指引自身方向

Jea Kwon, Jiwon Kim, Dong-kyum Kim, Meeyoung Cha

机构 * Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究针对语言模型训练后知识编辑核心能力退化问题,提出莫尔方法,通过从模型自身解码分布采样估计保留协方差,无需外部数据,可作插入组件。实验表明该方法能在多模型上扩展保留能力,提升准确率,凸显分布对齐对无损编辑的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14180 2026-07-24 cs.CL cs.AI 版本更新 73%

Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model

无外部表达的知识:探索经典中文语言模型的泛化边界

Jiuting Chen, Yuan Lian, Hao Wu, Tianqi Huang, Hiroshi Sasaki, Makoto Kouno, Jongil Choi

机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。

Comments 27 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16410 2026-07-22 cs.CL cs.AI 版本更新 73%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18163 2026-07-21 cs.LG cs.AI 新提交 73%

OR Else: A Differentiable Trust Region for Policy Optimization

OR 否则:用于策略优化的可微信赖域

Chinmay Rane, Kanishka Tyagi, Michael Manry

机构 * Quantiphi Inc(昆蒂菲公司) Self Machines Inc(自机器公司) The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01171 2026-07-17 cs.CL cs.AI 版本更新 73%

Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity

言语化采样:如何减轻模式坍塌并释放大语言模型的多样性

Jiayi Zhang, Simon Yu, Derek Chong, Anthony Sicilia, Michael R. Tomz, Christopher D. Manning, Weiyan Shi

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现偏好数据中的典型性偏差致大语言模型模式坍塌,引入言语化采样策略。该策略能促使模型说出响应概率分布,经实验验证可显著提升创意写作等多方面性能,为模式坍塌提供新视角及实用补救方法。

Comments 83 pages, 31 figures, 44 tables. Code is available at https://github.com/CHATS-lab/verbalize-sampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05736 2026-07-15 q-bio.QM cs.CL cs.CV cs.LG 73%

Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applications

通过偏好优化整合多模态知识以增强大语言模型的多模态知识转移(生物医学应用)

Zhanliang Wang, Da Wu, Quan Nguyen, Zhuoran Xu, Kai Wang

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 MINT通过偏好优化整合多模态知识,提升大语言模型在生物医学任务中的表现,特别是在罕见遗传疾病预测和组织类型分类中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 73%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03453 2026-07-07 cs.LG cs.AI 新提交 73%

Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning

最佳中的更优N:通过上下文学习生成预对齐响应

Eric Lei, Hsiang Hsu, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏