arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 84 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2511.17579 2025-11-25 cs.LG cs.AI 88%

Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation

通过价值去相关与外推实现大语言模型的多值对齐

Hefei Xu, Le Wu, Chen Cheng, Hao Liu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。

Comments accepted by AAAI26 oral; 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17937 2025-11-25 cs.AI 87%

Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria

对齐欺骗 - 训练到部署的不对称性:通过博弈论视角的贝叶斯-斯克尔伯格均衡

Kartik Garg, Shourya Mishra, Kartikeya Sinha, Ojaswi Pratap Singh, Ayush Chopra, Kanishk Rai, Ammar Sheikh, Raghav Maheshwari, Aman Chadha, Vinija Jain, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa学院) Apple, USA(苹果公司) Google, USA(谷歌公司)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);harmlessness(abstract)

AI总结 通过博弈论视角研究AI对齐欺骗现象,分析不同偏好优化方法在安全、无害和有用性方面的表现,揭示其成因及发生条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18084 2025-11-25 cs.LG cs.AI 84%

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement from Clinical Decision-making Quality

医学大语言模型在不孕症护理中的对齐悖论:解耦算法改进与临床决策质量

Dou Liu, Ying Long, Sophia Zuoqiu, Kaipeng Xie, Runze Yang, Di Liu, Kang Li, Yiting Lin, Hanyi Liu, Rong Yin, Tian Tang

机构 * Department of Obstetrics and Gynecology, West China Second University Hospital(妇产科部门,西昌第二大学医院) Reproductive Medical Center, Department of Obstetrics and Gynecology, West China Second University Hospital(生殖医学中心,妇产科部门,西昌第二大学医院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现,尽管GRPO在算法准确性上表现最佳,但临床医生更偏好SFT模型,因其推理更清晰且治疗可行性更高,揭示了算法改进与临床信任之间的对齐悖论。

Comments 22 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11255 2025-11-25 cs.IR 82%

Align$^3$GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation

Align$^3$GR: 基于大语言模型的生成推荐系统统一多级对齐

Wencai Ye, Mingjie Sun, Shuhang Chen, Wenjin Wu, Peng Jiang

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract)

AI总结 Align$^3$GR通过统一多级对齐方法,提升大语言模型在生成推荐系统中的性能,实验显示在Recall@10和NDCG@10指标上均取得显著提升。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 81%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18397 2025-11-25 cs.AI cs.SE 77%

Natural Emergent Misalignment from Reward Hacking in Production RL

生产强化学习中奖励黑客导致的自然涌现偏差

Monte MacDiarmid, Benjamin Wright, Jonathan Uesato, Joe Benton, Jon Kutasov, Sara Price, Naia Bouscal, Sam Bowman, Trenton Bricken, Alex Cloud, Carson Denison, Johannes Gasteiger, Ryan Greenblatt, Jan Leike, Jack Lindsey, Vlad Mikulik, Ethan Perez, Alex Rodrigues, Drake Thomas, Albert Webson, Daniel Ziegler, Evan Hubinger

机构 * Anthropic

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 研究发现大型语言模型在生产强化学习环境中学习奖励黑客会导致严重偏差,提出三种缓解措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05321 2025-11-25 cs.IR cs.AI cs.LG 73%

VALUE: Value-Aware Large Language Model for Query Rewriting via Weighted Trie in Sponsored Search

VALUE: 用于通过加权前缀树进行查询重写的值感知大语言模型

Xiao Zhang, Guanyu Chen, Boyang Zuo, Feng Li, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 VALUE通过加权前缀树整合价值感知,提升搜索引擎广告中查询重写的语义相关性和商业价值

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12609 2025-11-25 cs.CL cs.AI cs.CV 73%

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型

Yunxin Li, Xinyu Chen, Shenyuan Jiang, Haoyuan Shi, Zhenyu Liu, Xuanyu Zhang, Nanhao Deng, Zhenran Xu, Yicheng Ma, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。

Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17265 2025-11-25 cs.CL cs.CV 70%

Systematic Reward Gap Optimization for Mitigating VLM Hallucinations

系统性奖励缺口优化以缓解视觉语言模型的幻觉

Lehan He, Zeren Chen, Zhelun Shi, Tianyu Yu, Jing Shao, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 TPR通过主题级偏好重写系统优化奖励缺口配置,显著减少VLM幻觉并提升对齐效果。

Comments 34 pages, 12 figures, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17869 2025-11-25 cs.LG 57%

The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems

霍克鲁斯:用于检测和缓解具身AI系统中奖励黑客行为的可解释任务分解

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)伯克利大学) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本研究提出MITD方法,通过可解释性任务分解有效检测和缓解具身AI系统中的奖励黑客行为,实验表明分解深度可显著降低奖励黑客频率。

Comments Accepted to the NeurIPS (Mexico City) 2025 Workshop on Embodied and Safe-Assured Robotic Systems (E-SARS). Thanks to Aman Chadha

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2303.12610 2025-11-25 eess.SY cs.SY math.OC 78%

Distributed Safe Control Design and Probabilistic Safety Verification for Multi-Agent Systems

分布式安全控制设计与多智能体系统的概率安全验证

Han Wang, Antonis Papachristodoulou, Kostas Margellos

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出了一种分布式算法,用于多智能体系统的安全控制设计和概率安全验证,通过合作机制解决不可行性问题,并通过场景方法量化安全性。

Comments manuscript accepted by Automatica

Journal ref Automatica, Vol. 179, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17818 2025-11-25 cs.LG cs.AI 62%

APRIL: Annotations for Policy evaluation with Reliable Inference from LLMs

APRIL:利用LLM可靠推断进行策略评估的标注

Aishwarya Mandyam, Kalyani Limaye, Barbara E. Engelhardt, Emily Alsentzer

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 APRIL利用大语言模型生成医疗领域的反事实注释,以提高离线策略评估的准确性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16986 2025-11-25 cs.CV 50%

VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation

VCE:通过视觉对比利用实现安全的自回归图像生成

Feng Han, Chao Gong, Zhipeng Wei, Jingjing Chen, Yu-Gang Jiang

专题命中 安全训练 :DPO(abstract)

AI总结 VCE通过视觉对比利用方法,有效保护自回归图像生成模型,实现对不安全内容的精确擦除并保持安全内容的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11425 2025-11-25 cs.MA 50%

Tapas Are Free! Training-Free Adaptation of Programmatic Agents via LLM-Guided Program Synthesis in Dynamic Environments

Tapas Are Free! 通过LLM引导的程序合成实现动态环境下的免训练程序代理适应

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

专题命中 安全训练 :safety(abstract)

AI总结 TAPA通过LLM引导的程序合成,在动态环境中实现免训练的程序代理适应,提升网络安全和群体智能任务的性能与可靠性。

Comments Extended version of the paper accepted at AAAI-26 Oral to comply with the AAAI camera-ready requirements with minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2511.06852 2025-11-25 cs.CR cs.AI cs.LG cs.SE 88%

Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment

差异化方向干预:一种规避LLM安全对齐的框架

Peng Zhang, Peijie Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DBDI框架,通过区分有害检测和拒绝执行方向,提升LLM安全对齐的规避效果。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15289 2025-11-25 cs.CR cs.AI cs.CL 86%

SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage

SATA: 一种通过简单辅助任务链接实现LLM劫持的范式

Xiaoning Dong, Wenbo Hu, Wei Xu, Tianxing He

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Hefei University of Technology(合肥工业大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SATA通过简单辅助任务链接实现LLM劫持,有效绕过安全措施并提升攻击成功率

Comments ACL Findings 2025. Welcome to employ SATA as a baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 83%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17666 2025-11-25 cs.CR cs.AI 70%

Evaluating Adversarial Vulnerabilities in Modern Large Language Models

评估现代大语言模型中的对抗漏洞

Tom Perel

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文评估了现代大语言模型在对抗攻击中的安全漏洞,通过比较Gemini 2.5 Flash和GPT-4的易受性,揭示了安全机制的差异及Transformer架构的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 3 篇

2509.15478 2025-11-25 cs.CL 83%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 红队测试 :red teaming(title);safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15998 2025-11-25 cs.CR cs.AI 79%

Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming

AI流量中的隐藏:利用MCP进行LLM驱动的代理红队攻击

Strahinja Janjusevic, Anna Baron Garcia, Sohrob Kazerounian

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI

AI总结 本文提出一种基于MCP的C2架构,用于LLM驱动的红队攻击,通过异步并行操作和实时情报共享,减少检测足迹并提升系统整体效能。

Comments 23 pages, 9 figures, 3 tables. Submitted as a full paper for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16466 2025-11-25 cs.CR cs.AI 79%

Incalmo: An Autonomous LLM-assisted System for Red Teaming Multi-Host Networks

Incalmo:一种自主的LLM辅助系统用于多主机网络红队测试

Brian Singer, Keane Lucas, Lakshmi Adiga, Meghna Jain, Lujo Bauer, Vyas Sekar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI

AI总结 Incalmo是一种基于LLM的自主红队测试系统,通过高层次任务规划和专用任务代理实现多主机网络攻击,显著提高了红队测试的效率和成功率。

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2501.18416 2025-11-25 cs.LG 79%

Exploring Potential Prompt Injection Attacks in Federated Military LLMs and Their Mitigation

探索联邦军事大语言模型中的潜在提示注入攻击及其缓解方法

Youngjoon Lee, Taehyun Park, Yunho Lee, Jinu Gong, Joonhyuk Kang

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)-ITRC (Information Technology Research Center)(信息与通信技术规划与评估机构(IITP)-ITRC(信息技术研究中心))

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文探讨了联邦军事大语言模型中潜在的提示注入攻击问题,提出人机协作框架结合技术和政策措施来缓解相关风险。

Comments Accepted to the 3rd International Workshop on Dataspaces and Digital Twins for Critical Entities and Smart Urban Communities - IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00230 2025-11-25 cs.HC cs.AI 57%

Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI

神经透明:用于预测模型行为的机制可解释性接口以实现个性化AI

Sheer Karny, Anthony Baez, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 提示注入 :safety(abstract);分类 cs.AI

AI总结 本研究提出神经透明接口,通过可视化语言模型内部结构帮助用户预测AI行为,提升信任并促进更安全的人机交互。

Comments SK and AB are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 5 篇

2511.17793 2025-11-25 cs.CV cs.LG 79%

Attention Guided Alignment in Efficient Vision-Language Models

注意力引导的高效视觉-语言模型

Shweta Mahajan, Hoang Le, Hyojin Park, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出AGE-VLM,通过交错交叉注意力层和空间知识提取,减少高效视觉-语言模型中的幻觉问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18874 2025-11-25 cs.AI cs.CV cs.LG cs.MA cs.RO cs.SI 62%

GContextFormer: A global context-aware hybrid multi-head attention approach with scaled additive aggregation for multimodal trajectory prediction

GContextFormer: 一种基于全局上下文的混合多头注意力方法,通过缩放加法聚合实现多模态轨迹预测

Yuzhi Chen, Yuanchang Xie, Lei Zhao, Pan Liu, Yajie Zou, Chen Wang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GContextFormer通过全局上下文感知的混合多头注意力和缩放加法聚合,实现无地图依赖的多模态轨迹预测,提升鲁棒性和预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17572 2025-11-25 cs.CL cs.SI 57%

Community-Aligned Behavior Under Uncertainty: Evidence of Epistemic Stance Transfer in LLMs

在不确定性下对齐的行为:LLMs中认知立场转移的证据

Patrick Gerard, Aiden Chang, Svitlana Volkova

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究通过删除事件知识验证LLMs在无知情况下仍能保持社区特定的行为模式,证明对齐编码了结构化且可推广的行为,推动更安全的LLM部署。

Comments 37 pages, EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13533 2025-11-25 cs.CV 50%

Minimax Multi-Target Conformal Prediction with Applications to Imaging Inverse Problems

最小最大多目标符合预测及其在成像反问题中的应用

Jeffrey Wen, Rizwan Ahmad, Philip Schniter

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) The Ohio State University(俄亥俄州立大学) Department of Biomedical Engineering(生物医学工程系)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种渐近最小最大方法用于多目标符合预测,应用于多指标盲图像质量评估、多任务不确定性量化和多轮测量获取,通过合成和MRI数据验证了其有效性。

Journal ref Transactions on Machine Learning Research, 11/2025. https://openreview.net/forum?id=53FEYwDQK0

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17875 2025-11-25 math.OC 50%

Modeling and Calibration of Supplier Selection Problem in Freight Agent-Based Simulations

货运 agent 仿真实验中供应商选择问题的建模与校准

Abdelrahman Ismael, Taner Cokyasar

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究提出了一种大规模校准的 agent 仿真实验模型,用于建模和校准供应商选择问题,以提高货运网络流的预测精度和供应链的韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 28 篇

2511.17947 2025-11-25 cs.AI cs.IR 83%

Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis

利用证据引导的LLM提升可信的抑郁症诊断

Yining Yuan, J. Ben Tamo, Micky C. Nnamdi, Yifei Wang, May D. Wang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出EGDR框架,通过证据引导推理和置信度评分提升抑郁症诊断的准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18597 2025-11-25 cs.CL 79%

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks

迈向可信的难度评估:大型语言模型作为编程和合成任务的裁判

H. M. Shadman Tabib, Jaber Ahmed Deedar

机构 * Department of Computer Science, Bangladesh University of Engineering and Technology(计算机科学系,孟加拉国工程与技术大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在评估编程问题难度时的可靠性,发现LightGBM在准确性上显著优于GPT-4o,揭示了模型在处理数字约束方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏