arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 98 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 17 篇

2601.06108 2026-01-13 cs.AI cs.CL 90%

From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models

从RLHF到直接对齐:大型语言模型偏好学习的理论统一

Tarun Raheja, Nilay Pochhi

机构 * Independent Researchers(独立研究者)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06238 2026-01-13 cs.LG cs.AI cs.CL 87%

SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers

SPINAL -- 神经对齐层中的缩放律与偏好整合

Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06157 2026-01-13 cs.LG cs.AI 86%

ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment

ECLIPTICA -- 一种通过CITA进行可切换LLM对齐的框架

Kapil Wanaskar, Gaytri Jena, Vinija Jain, Aman Chadha, Amitava Das

机构 * San José State University(圣何塞州立大学) Google(谷歌) Apple(苹果) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa 印度分校实验室)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 ECLIPTICA通过CITA实现LLM对齐的可切换框架,以高效率提升指令对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06596 2026-01-13 cs.CR cs.AI 83%

Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity

大型语言模型是否易受偏好削弱攻击(PUA)攻击?一种诊断偏好对齐与现实有效性之间权衡的因子分析方法

Hongjun An, Yiliang Song, Jiangan Chen, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics, Northwestern Polytechnical University(人工智能学院、光学与电子学院、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) School of Economics and Management, Guangxi Normal University(经济管理学院,广西师范大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种因子分析方法,用于诊断LLM在偏好对齐与现实有效性之间的权衡,揭示了高级模型可能更易受操纵性提示攻击,并强调了定制防御的重要性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06180 2026-01-13 cs.LG cs.AI cs.CL 82%

MixDPO: Modeling Preference Strength for Pluralistic Alignment

MixDPO:建模偏好强度以实现多元对齐

Saki Imai, Pedram Heydari, Anthony Sicilia, Asteria Kaeberlein, Katherine Atwell, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixDPO通过建模偏好强度差异,提升多样的偏好对齐性能,同时保持子群体偏好,适用于高异质性场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07835 2026-01-13 cs.CR cs.CV 80%

SecureCAI: Injection-Resilient LLM Assistants for Cybersecurity Operations

SecureCAI: 面向网络安全操作的抗注入大语言模型助手

Mohammed Himayath Ali, Mohammed Aqib Abdullah, Mohammed Mudassir Uddin, Shahnawaz Alam

机构 * Computer Science Department, Cybersecurity and Artificial Intelligence Division(计算机科学系、网络安全与人工智能 division)

专题命中 偏好对齐 :safety(abstract);prompt injection(abstract);trustworthy(abstract);AI safety(abstract)

AI总结 SecureCAI通过引入安全意识护栏和偏好优化,有效提升网络安全操作中对抗攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04346 2026-01-13 cs.CL 79%

Adding Alignment Control to Language Models

向语言模型添加对齐控制

Wenhong Zhu, Weinan Zhang, Rui Wang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出CLM模型,通过添加身份层实现语言模型的对齐控制,通过插值系数实现对齐的插值和外推,提升模型的可用性。

Comments I have changed the title of the paper and resubmitted a new one on arXiv titled "Flexible realignment of language models" (arXiv:2506.12704)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 67%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06543 2026-01-13 cs.CL cs.AI cs.LG 67%

SimLLM: Fine-Tuning Code LLMs for SimPy-Based Queueing System Simulation

SimLLM:用于基于SimPy的排队系统模拟的代码LLM微调

Jun-Qi Chen, Kun Zhang, Rui Zheng, Ying Zhong

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) School of Information, Renmin University of China(中国人民大学信息学院) School of Management and Economics, University of Electronic Science and Technology of China(电子科技大学管理学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SimLLM通过微调开源LLM提升SimPy排队系统模拟代码生成能力,提供替代闭源模型的可行方案。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07199 2026-01-13 cs.LG cs.AI 62%

Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization

正向与反向:在直接偏好优化中比较推理目标

Murtaza Nikzad, Raghuram Ramanujan

机构 * Department of Math and Computer Science(数学与计算机科学系)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文通过直接偏好优化比较正向与反向推理目标,发现正向训练提升准确性,反向训练降低误报率,两者互补提升模型推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07149 2026-01-13 cs.AI cs.CL 62%

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

奖励创造力:一种人类对齐的生成奖励模型用于故事创作中的强化学习

Zhaoyan Li, Hang Lei, Yujia Wang, Lanbo Liu, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类对齐的生成奖励模型和强化学习框架,用于提升故事创作的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19467 2026-01-13 cs.CL cs.AI 62%

Can Reasoning Help Large Language Models Capture Human Annotator Disagreement?

推理是否能帮助大语言模型捕捉人类标注者的分歧?

Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理方法对大语言模型捕捉人类标注分歧的影响,发现RLVR推理会降低性能,而朴素推理能提升性能,揭示了用推理模型替代人类标注的风险。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06700 2026-01-13 cs.CL cs.AI 62%

Characterising Toxicity in Generative Large Language Models

表征生成大语言模型中的毒性

Zhiyao Zhang, Yazan Mash'Al, Yuhan Wu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了生成大语言模型在提示下的毒性输出生成程度及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00023 2026-01-13 cs.AI 57%

ToolBrain: A Flexible Reinforcement Learning Framework for Agentic Tools

ToolBrain: 一种灵活的强化学习框架用于智能工具

Quy Minh Le, Minh Sao Khue Luu, Khanh-Tung Tran, Duc-Hai Nguyen, Hoang-Quoc-Viet Pham, Quan Le, Hoang Thanh Lam, Hoang D. Nguyen

机构 * ToolBrain Research(ToolBrain研究机构) University College Cork(大学学院科克) CeADAR University College Dublin(CeADAR大学学院都柏林) IBM Research Lab(IBM研究实验室)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18497 2026-01-13 cs.CL 57%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18676 2026-01-13 cs.LG 57%

Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift

此刻正确,此后错误:在偏好漂移下的非平稳直接偏好优化

Seongho Son, William Bankes, Sayak Ray Chowdhury, Brooks Paige, Ilija Bogunovic

机构 * Department of Computer Science, University College London, London, United Kingdom(计算机科学系,伦敦大学学院,英国) Department of Electronic and Electrical Engineering, University College London, London, United Kingdom(电子与电气工程系,伦敦大学学院,英国) Department of Computer Science and Engineering, IIT Kanpur, India(计算机科学与工程系,印度IIT坎浦尔)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 NS-DPO通过动态Bradley-Terry模型建模时间依赖奖励函数,在偏好漂移下提升LLM微调性能。

Comments 31 pages, 10 figures. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 57%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2601.07200 2026-01-13 cs.LG cs.AI 84%

Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment

通过推拉分布对齐保障大语言模型微调安全

Haozhong Wang, Zhuo Li, Yibo Yang, He Zhao, Hongyuan Zha, Dandan Guo

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SOT通过推拉分布对齐机制提升大语言模型微调的安全性与效用平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06226 2026-01-13 cs.LG cs.AI 62%

Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification

剔除恶意:一种全局子空间方法用于LLM去毒化

Zenghao Duan, Zhiyi Yin, Zhichao Shi, Liang Pang, Shaoling Jing, Zihe Huang, Jiayi Wu, Yu Yan, Jingcheng Deng, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GLOSS方法,通过识别并消除LLM参数中的全局子空间来实现去毒化,有效提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11742 2026-01-13 cs.CV cs.AI 57%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06364 2026-01-13 cs.HC cs.AI 57%

Human-in-the-Loop Interactive Report Generation for Chronic Disease Adherence

具有临床医生的交互式报告生成用于慢性病依从性

Xiaotian Zhang, Jinhong Yu, Pengwei Yan, Le Jiang, Xingyi Shen, Mumo Cheng, Xiaozhong Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种具有临床医生的交互式报告生成系统,通过AI生成与医生审查的分工,提高慢性病依从性报告的效率和准确性,同时确保问责制。

Comments 5 pages, 3 figures. Accepted at the AAAI 2026 Workshop on AI for Healthy Aging and Longevity

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06115 2026-01-13 cs.AI 57%

Dreaming Is Not a Bug: A Jung-Inspired Dream Layer for Multi-Agent LLM Companions

梦境并非bug:一种基于荣格思想的多智能体LLM伴侣的梦境层

V. Cheung

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于荣格思想的梦境层,通过离线生成梦境叙事来增强多智能体LLM伴侣的学习与关系建立能力,将幻觉转化为资源而非bug。

Comments Preprint, 35 pages (5 pages of appendix), 2 figures, 3 tables. Conceptual and architectural proposal with preliminary simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07715 2026-01-13 eess.SY cs.SY 50%

Safe Navigation under Uncertain Obstacle Dynamics using Control Barrier Functions and Constrained Convex Generators

在不确定障碍动态下使用控制屏障函数和约束凸生成器的安全导航

Hugo Matias, Daniel Silvestre

专题命中 安全训练 :safety(abstract)

AI总结 本文提出利用控制屏障函数和约束凸生成器实现安全导航,通过凸优化问题转换障碍物流为CBF,适用于不确定障碍动态的代理导航。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 86%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03356 2026-01-13 cs.CR 82%

From static to adaptive: immune memory-based jailbreak detection for large language models

从静态到适应性:基于免疫记忆的大型语言模型 jailbreak 检测

Jun Leng, Yu Liu, Litian Zhang, Ruihan Hu, Zhuting Fang, Xi Zhang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 基于免疫记忆的框架,通过动态记忆更新和主动免疫机制,提升大型语言模型对 jailbreak 攻击的检测准确率至 94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI 70%

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06884 2026-01-13 cs.CL cs.AI cs.LG 67%

Paraphrasing Adversarial Attack on LLM-as-a-Reviewer

对LLM-as-a-Reviewer的改写对抗攻击

Masahiro Kaneko

机构 * MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种针对LLM作为评审员的改写对抗攻击方法,通过优化生成改写序列以提高评审评分,同时保持语义和语言自然性,并验证了其有效性及潜在的检测信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06305 2026-01-13 cs.CL 57%

Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language Models

为何LoRA无法遗忘:针对语言模型中的后门行为的正则化低秩适应

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 RoRA通过增强谱强度和纠正对齐,有效提升LoRA在对抗后门攻击时的遗忘能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2601.01592 2026-01-13 cs.CR cs.CV 82%

OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

OpenRT: 一种用于多模态大语言模型的开源红队框架

Xin Wang, Yunhao Chen, Juncheng Li, Yixu Wang, Yang Yao, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 红队测试 :red teaming(title);safety(abstract);AI safety(abstract)

AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2601.07072 2026-01-13 cs.CR cs.AI 79%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏