arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2603.09692 2026-06-02 cs.LG cs.AI cs.CL 75%

ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning

ActiveUltraFeedback:使用主动学习的高效偏好数据生成

Davit Melikidze, Marian Schneider, Jessica Lam, Martin Wertich, Ido Hakimi, Barna Pásztor, Andreas Krause

机构 * University of Freiburg(弗赖堡大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ActiveUltraFeedback主动学习流水线,通过不确定性估计和两种新采样方法(DRTS和DeltaUCB)动态选择最具信息量的响应对,以最少六分之一的标注数据实现与静态基线相当或更优的下游性能。

Comments 40 pages, 9 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30273 2026-05-29 cs.HC cs.AI cs.CL cs.CY cs.SI 75%

LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback

LLUMI: 利用在线社区反馈改进心理健康支持中的LLM写作辅助

Jiwon Kim, Maya Ajit, Sherry Gong, Soorya Ram Shimgekar, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出LLUMI框架,通过在线社区反馈(如Reddit投票)构建偏好对,结合监督微调和直接偏好优化训练开源小模型,在隐私保护下实现与GPT相当的心理健康支持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25549 2026-05-26 cs.CL cs.AI cs.LG 75%

BC Protocol: Structured Dual-Expert Dialogue for Eliciting High-Quality Chain-of-Thought Post-Training Data

BC协议:结构化双专家对话用于生成高质量思维链后训练数据

Bo Zou, Chao Xu

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型后训练中高质量专家思维链数据生产瓶颈,提出BC协议——一种结构化双专家引出方法,通过配对领域专家与知识工程师,系统外化专家隐性判断为自然语言推理链,实验证明其在推理过程自然性上具有压倒性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18808 2026-05-20 cs.LG cs.AI cs.CL 75%

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

在指令微调的LLM中构建组合文学原语:跨架构SAE特征用于自我、风格和情感

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira

机构 * Federal University of Goias(戈亚斯联邦大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过稀疏自编码器研究了指令微调的LLM中组合文学原语的架构,发现四种特征类别,并通过跨架构SAE特征验证了自我、风格和情感的表达能力。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 75%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20531 2026-05-08 cs.DC cs.AI cs.CL cs.LG 75%

Epistemic Observability in Language Models

语言模型中的认知可观察性

Tony Mason, Vaastav Anand

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现语言模型在制造内容时自信度最高,证明这是观察问题而非能力问题,提出通过计算副产品提升检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM 75%

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23113 2026-04-28 cs.SI 75%

Reducing Detail Hallucinations in Long-Context Regulatory Understanding via Targeted Preference Optimization

通过定向偏好优化减少长上下文监管理解中的细节幻觉

Yang Liu, Bin Chong, Yuhan Lin, Chongyang Zhang, Hao Zheng, Ziyi Zhang, Jiayu Liang, Ran Ran, Qian Li, Kefu Xu

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract)

AI总结 本文提出DetailDPO框架,通过定向偏好优化减少长上下文监管文档中的细节幻觉,实验显示在不同模型和上下文长度下,DetailDPO有效降低细节错误率,跨领域迁移表现良好。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12817 2026-04-23 cs.CL cs.AI cs.CY 75%

From Noise to Signal to Selbstzweck: Reframing Human Label Variation in the Era of Post-training in NLP

从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异

Shanshan Xu, Santosh T. Y. S. S, Barbara Plank

机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院) Amazon(亚马逊) LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨人类标签变异在NLP后训练时代的重要性,提出将其作为内在价值自我目的进行保护,以提升模型鲁棒性和社会技术安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 75%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04497 2026-04-07 cs.LG cs.AI cs.CL 75%

One Model for All: Multi-Objective Controllable Language Models

一个模型解决所有问题:多目标可控语言模型

Qiang He, Yucheng Yang, Tianyi Zhou, Meng Fang, Mykola Pechenizkiy, Setareh Maghsudi

机构 * Ruhr University Bochum(波鸿鲁尔大学) Eindhoven University of Technology(埃因霍温理工大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。

Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13607 2026-03-30 cs.CL cs.AI cs.LG 75%

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

Nemotron-Cascade:基于级联强化学习的通用推理模型规模化

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * NVIDIA(英伟达)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。

Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22944 2026-03-25 cs.HC 75%

From Morality Installation in LLMs to LLMs in Morality-as-a-System

从LLM中的道德安装到道德作为系统中的LLM

Gunter Bombaerts

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract)

AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。

Comments 22pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03622 2026-02-04 cs.CL cs.AI cs.LG 75%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04675 2026-01-16 cs.AI cs.CL cs.LG 75%

Scalable Oversight for Superhuman AI via Recursive Self-Critiquing

通过递归自我批评实现超人类AI的可扩展监督

Xueru Wen, Jie Lou, Xinyu Lu, Junjie Yang, Yanjiang Liu, Yaojie Lu, Debing Zhang, Xing Yu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过递归自我批评实现超人类AI的可扩展监督,探索批评的批评比直接批评更容易,并验证递归批评在AI监督中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15745 2025-12-25 cs.LG cs.AI cs.CL 75%

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

LLaDA2.0:将扩散语言模型扩展到100B参数

Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Zhou, Liwang Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Westlake University(西湖大学) HongKong University of Science and Technology(香港科学与技术大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15432 2025-12-12 cs.AI cs.CL cs.LG 75%

SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data

SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据

Bidyapati Pradhan, Surajit Dasgupta, Amit Kumar Saha, Omkar Anustoop, Sriram Puttagunta, Vipul Mittal, Gopal Sarda

机构 * ServiceNow Inc.(ServiceNow公司)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13022 2025-12-01 cs.CL cs.AI cs.LG 75%

On the Role of Preference Variance in Preference Optimization

关于偏好方差在偏好优化中的作用

Jiacheng Guo, Zihao Li, Jiahao Qiu, Yue Wu, Mengdi Wang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学) AI Lab(人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了偏好方差在偏好优化中的作用,发现高方差提示在训练大型语言模型时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07477 2025-11-12 cs.CY cs.AI cs.CL 75%

The Polite Liar: Epistemic Pathology in Language Models

Bentley DeVilling

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 17 pages, 2 tables, Preprint - under review at AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15483 2025-11-11 cs.LG cs.AI cs.CL math.OC stat.ML 75%

Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective

Heshan Fernando, Han Shen, Parikshit Ram, Yi Zhou, Horst Samulowitz, Nathalie Baracaldo, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM Research(IBM研究院) Cornell University(康奈尔大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13518 2025-11-07 cs.CL cs.AI cs.LG 75%

Selective Preference Optimization via Token-Level Reward Function Estimation

Kailai Yang, Zhiwei Liu, Qianqian Xie, Jimin Huang, Erxue Min, Sophia Ananiadou

机构 * National Centre for Text Mining, The University of Manchester(曼彻斯特大学文本挖掘中心) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究中心) The Fin AI(Fin AI公司) Baidu Inc.(百度公司) Archimedes Research(阿基米德研究)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by the EMNLP 2025 main conference

Journal ref https://aclanthology.org/2025.emnlp-main.359/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20548 2025-10-21 cs.LG cs.AI cs.CL 75%

$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training

Jin Peng Zhou, Kaiwen Wang, Jonathan Chang, Zhaolin Gao, Nathan Kallus, Kilian Q. Weinberger, Kianté Brantley, Wen Sun

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23223 2025-10-15 cs.LG cs.AI cs.CL cs.GT 75%

COMAL: A Convergent Meta-Algorithm for Aligning LLMs with General Preferences

Yixin Liu, Argyris Oikonomou, Weiqiang Zheng, Yang Cai, Arman Cohan

机构 * Yale University(耶鲁大学) Allen Institute for AI(人工智能研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23024 2025-09-30 cs.LG cs.AI cs.CL 75%

Tracing the Representation Geometry of Language Models from Pretraining to Post-training

Melody Zixuan Li, Kumar Krishna Agrawal, Arna Ghosh, Komal Kumar Teru, Adam Santoro, Guillaume Lajoie, Blake A. Richards

机构 * Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所) UC Berkeley(加州大学伯克利分校) G o o g l e , Paradigms of Intelligence Team(谷歌,智能范式团队) Mathematics and Statistics, Université de Montréal(蒙特利尔大学数学与统计学系) Neurology & Neurosurgery and Montreal Neurological Institute, McGill University(神经病学与神经外科及蒙特利尔神经研究所,麦吉尔大学) CIFAR Learning in Machines & Brains Program(CIFAR 机器与大脑学习计划)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 33 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05129 2025-09-19 cs.CL cs.CY cs.LG 75%

SMART: Simulated Students Aligned with Item Response Theory for Question Difficulty Prediction

Alexander Scarlatos, Nigel Fernandez, Christopher Ormerod, Susan Lottridge, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Cambium Assessment(Cambium评估)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Published in EMNLP 2025: The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07484 2025-07-11 cs.CL cs.AI cs.LG 75%

Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models

Kaiqu Liang, Haimin Hu, Xuandong Zhao, Dawn Song, Thomas L. Griffiths, Jaime Fernández Fisac

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project page, code & data: https://machine-bullshit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03637 2025-07-08 cs.CL cs.AI cs.LG 75%

RewardAnything: Generalizable Principle-Following Reward Models

Zhuohao Yu, Jiali Zeng, Weizheng Gu, Yidong Wang, Jindong Wang, Fandong Meng, Jie Zhou, Yue Zhang, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) WeChat AI(微信AI) William & Mary(威廉与玛丽学院) Westlake University(西交利物浦大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages, 9 figures, Code & model weights available at: https://zhuohaoyu.github.io/RewardAnything

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00092 2025-07-02 cs.AI cs.CL cs.LG 75%

Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models

Basab Jha, Firoj Paudel, Ujjwal Puri, Zhang Yuting, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(维达学院) Madan Bhandari Memorial College(马达恩·班达里纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10490 2025-07-01 cs.LG cs.AI cs.CL 75%

Learning Dynamics of LLM Finetuning

Yi Ren, Danica J. Sutherland

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08712 2025-06-13 cs.CL cs.AI cs.LG 75%

ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization

Hee Suk Yoon, Eunseop Yoon, Mark Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏