arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 17 篇

2601.06108 2026-01-13 cs.AI cs.CL 90%

From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models

从RLHF到直接对齐:大型语言模型偏好学习的理论统一

Tarun Raheja, Nilay Pochhi

机构 * Independent Researchers(独立研究者)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06238 2026-01-13 cs.LG cs.AI cs.CL 87%

SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers

SPINAL -- 神经对齐层中的缩放律与偏好整合

Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06157 2026-01-13 cs.LG cs.AI 86%

ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment

ECLIPTICA -- 一种通过CITA进行可切换LLM对齐的框架

Kapil Wanaskar, Gaytri Jena, Vinija Jain, Aman Chadha, Amitava Das

机构 * San José State University(圣何塞州立大学) Google(谷歌) Apple(苹果) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa 印度分校实验室)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 ECLIPTICA通过CITA实现LLM对齐的可切换框架,以高效率提升指令对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06596 2026-01-13 cs.CR cs.AI 83%

Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity

大型语言模型是否易受偏好削弱攻击(PUA)攻击?一种诊断偏好对齐与现实有效性之间权衡的因子分析方法

Hongjun An, Yiliang Song, Jiangan Chen, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics, Northwestern Polytechnical University(人工智能学院、光学与电子学院、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) School of Economics and Management, Guangxi Normal University(经济管理学院,广西师范大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种因子分析方法,用于诊断LLM在偏好对齐与现实有效性之间的权衡,揭示了高级模型可能更易受操纵性提示攻击,并强调了定制防御的重要性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06180 2026-01-13 cs.LG cs.AI cs.CL 82%

MixDPO: Modeling Preference Strength for Pluralistic Alignment

MixDPO:建模偏好强度以实现多元对齐

Saki Imai, Pedram Heydari, Anthony Sicilia, Asteria Kaeberlein, Katherine Atwell, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixDPO通过建模偏好强度差异,提升多样的偏好对齐性能,同时保持子群体偏好,适用于高异质性场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07835 2026-01-13 cs.CR cs.CV 80%

SecureCAI: Injection-Resilient LLM Assistants for Cybersecurity Operations

SecureCAI: 面向网络安全操作的抗注入大语言模型助手

Mohammed Himayath Ali, Mohammed Aqib Abdullah, Mohammed Mudassir Uddin, Shahnawaz Alam

机构 * Computer Science Department, Cybersecurity and Artificial Intelligence Division(计算机科学系、网络安全与人工智能 division)

专题命中 偏好对齐 :safety(abstract);prompt injection(abstract);trustworthy(abstract);AI safety(abstract)

AI总结 SecureCAI通过引入安全意识护栏和偏好优化,有效提升网络安全操作中对抗攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04346 2026-01-13 cs.CL 79%

Adding Alignment Control to Language Models

向语言模型添加对齐控制

Wenhong Zhu, Weinan Zhang, Rui Wang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出CLM模型,通过添加身份层实现语言模型的对齐控制,通过插值系数实现对齐的插值和外推,提升模型的可用性。

Comments I have changed the title of the paper and resubmitted a new one on arXiv titled "Flexible realignment of language models" (arXiv:2506.12704)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 67%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06543 2026-01-13 cs.CL cs.AI cs.LG 67%

SimLLM: Fine-Tuning Code LLMs for SimPy-Based Queueing System Simulation

SimLLM:用于基于SimPy的排队系统模拟的代码LLM微调

Jun-Qi Chen, Kun Zhang, Rui Zheng, Ying Zhong

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) School of Information, Renmin University of China(中国人民大学信息学院) School of Management and Economics, University of Electronic Science and Technology of China(电子科技大学管理学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SimLLM通过微调开源LLM提升SimPy排队系统模拟代码生成能力,提供替代闭源模型的可行方案。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07199 2026-01-13 cs.LG cs.AI 62%

Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization

正向与反向:在直接偏好优化中比较推理目标

Murtaza Nikzad, Raghuram Ramanujan

机构 * Department of Math and Computer Science(数学与计算机科学系)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文通过直接偏好优化比较正向与反向推理目标,发现正向训练提升准确性,反向训练降低误报率,两者互补提升模型推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07149 2026-01-13 cs.AI cs.CL 62%

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

奖励创造力:一种人类对齐的生成奖励模型用于故事创作中的强化学习

Zhaoyan Li, Hang Lei, Yujia Wang, Lanbo Liu, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类对齐的生成奖励模型和强化学习框架,用于提升故事创作的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19467 2026-01-13 cs.CL cs.AI 62%

Can Reasoning Help Large Language Models Capture Human Annotator Disagreement?

推理是否能帮助大语言模型捕捉人类标注者的分歧?

Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理方法对大语言模型捕捉人类标注分歧的影响,发现RLVR推理会降低性能,而朴素推理能提升性能,揭示了用推理模型替代人类标注的风险。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06700 2026-01-13 cs.CL cs.AI 62%

Characterising Toxicity in Generative Large Language Models

表征生成大语言模型中的毒性

Zhiyao Zhang, Yazan Mash'Al, Yuhan Wu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了生成大语言模型在提示下的毒性输出生成程度及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00023 2026-01-13 cs.AI 57%

ToolBrain: A Flexible Reinforcement Learning Framework for Agentic Tools

ToolBrain: 一种灵活的强化学习框架用于智能工具

Quy Minh Le, Minh Sao Khue Luu, Khanh-Tung Tran, Duc-Hai Nguyen, Hoang-Quoc-Viet Pham, Quan Le, Hoang Thanh Lam, Hoang D. Nguyen

机构 * ToolBrain Research(ToolBrain研究机构) University College Cork(大学学院科克) CeADAR University College Dublin(CeADAR大学学院都柏林) IBM Research Lab(IBM研究实验室)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18497 2026-01-13 cs.CL 57%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18676 2026-01-13 cs.LG 57%

Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift

此刻正确,此后错误:在偏好漂移下的非平稳直接偏好优化

Seongho Son, William Bankes, Sayak Ray Chowdhury, Brooks Paige, Ilija Bogunovic

机构 * Department of Computer Science, University College London, London, United Kingdom(计算机科学系,伦敦大学学院,英国) Department of Electronic and Electrical Engineering, University College London, London, United Kingdom(电子与电气工程系,伦敦大学学院,英国) Department of Computer Science and Engineering, IIT Kanpur, India(计算机科学与工程系,印度IIT坎浦尔)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 NS-DPO通过动态Bradley-Terry模型建模时间依赖奖励函数,在偏好漂移下提升LLM微调性能。

Comments 31 pages, 10 figures. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 57%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏