arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-24 至 2026-02-24 共收录 89 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2602.03003 2026-02-24 cs.AI cs.LG 81%

Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment

可微社会选择中的开放问题:学习机制、决策与对齐

Zhiyu An, Wan Du

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 78%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19416 2026-02-24 cs.AI cs.LG 73%

IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking

IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法

Mohammad Beigi, Ming Jin, Junshan Zhang, Jiaxin Zhang, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) Salesforce(Salesforce公司) Meta AI

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19519 2026-02-24 cs.AI cs.LG 62%

Ada-RS: Adaptive Rejection Sampling for Selective Thinking

Ada-RS: 选择性思维的自适应拒绝采样

Yirou Ge, Yixi Li, Alec Chiu, Shivani Shekhar, Zijie Pan, Avinash Thangali, Yun-Shiuan Chuang, Chaitanya Kulkarni, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 50%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 偏好对齐 :alignment(abstract)

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2602.19844 2026-02-24 cs.CR cs.AI cs.SE 70%

LLM-enabled Applications Require System-Level Threat Monitoring

依赖大语言模型的应用需要系统级威胁监控

Yedi Zhang, Haoyu Wang, Xianglin Yang, Jin Song Dong, Jun Sun

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08104 2026-02-24 cs.AI cs.LG cs.MA 62%

Interpretable Failure Analysis in Multi-Agent Reinforcement Learning Systems

多智能体强化学习系统中的可解释性故障分析

Risal Shahriar Shefin, Debashis Gupta, Thai Le, Sarra Alqahtani

机构 * Wake Forest University(威克森林大学) Indiana University(印第安纳大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种两阶段梯度框架,用于多智能体强化学习系统中可解释的故障检测与归因分析,通过几何分析和敏感性分析提高故障诊断的透明度和准确性。

Comments Accepted to the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-02-24 cs.DB cs.AI cs.CL cs.SE 62%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04446 2026-02-24 cs.LG 57%

Sampling-aware Adversarial Attacks Against Large Language Models

针对大语言模型的采样感知对抗攻击

Tim Beyer, Yan Scholten, Leo Schwinn, Stephan Günnemann

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于采样感知的对抗攻击方法,通过优化与采样资源分配提升攻击成功率和效率,揭示了采样在评估大语言模型安全性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19110 2026-02-24 physics.plasm-ph 50%

Machine learning prediction of plasma behavior from discharge configurations on WEST

基于WEST磁约束装置放电配置的机器学习预测等离子体行为

Chenguang Wan, Feda Almuhisen, Philippe Moreau, Remy Nouailletas, Zhisong Qu, Youngwoo Cho, Robin Varennes, Kyungtak Lim, Kunpeng Li, Jia Huang, Weidong Chen, Jiangang Li, Xavier Garbet

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出基于变换器的机器学习模型,用于预测WEST托卡马克的关键等离子体参数,实现快速放电规划与实时控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11995 2026-02-24 cs.MA 50%

Compositionally Safe Construction of Autonomous Driving Systems

基于组成安全性的自动驾驶系统构建

Marius Bozga, Joseph Sifakis

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于组成安全性的自动驾驶系统构建方法,通过协调执行驾驶操作来确保安全,采用分阶段控制策略,涵盖主要驾驶任务。

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 50%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2507.23465 2026-02-24 cs.CL cs.AI 79%

Role-Aware Language Models for Secure and Contextualized Access Control in Organizations

面向角色的语言模型:用于组织中的安全且上下文化的访问控制

Saeed Almheiri, Yerulan Kongrat, Adrian Santosh, Ruslan Tasmukhanov, Josemaria Loza Vera, Muhammad Dehan Al Kautsar, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Nazarbayev University(纳扎尔拜耶夫大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向角色的语言模型,通过三种策略实现基于组织角色的安全访问控制,并通过实验验证其在不同组织结构下的性能和鲁棒性。

Comments AACL 2025 - Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19396 2026-02-24 cs.AI 70%

Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement

明文之中隐藏:通过激活解耦检测隐蔽的 jailbreak

Amirhossein Farzam, Majid Behabahani, Mani Malek, Yuriy Nevmyvaka, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind) Apple(苹果公司)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 通过解耦 LLM 激活中的语义因子,提出 FrameShield 异常检测器,提升对隐蔽 jailbreak 的检测能力,并推动 LLM 安全和可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04891 2026-02-24 cs.CL cs.AI cs.LG 67%

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性

Punya Syon Pandey, Hai Son Le, Devansh Bhardwaj, Rada Mihalcea, Zhijing Jin

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16789 2026-02-24 cs.CL cs.AI cs.LG 67%

Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards

意外漏洞:影响微调的因子

Punya Syon Pandey, Samuel Simko, Kellin Pelrine, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) FAR AI(FAR人工智能公司) McGill University(麦吉尔大学) MILA(蒙特利尔人工智能研究院) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究意外漏洞,揭示微调数据集特征对模型安全性和对抗鲁棒性的影响

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2602.18483 2026-02-24 cs.CY cs.AI cs.CL cs.HC 85%

Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation

对LLM进行红队行动作为社会技术实践:从探索和数据创建到评估

Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola

机构 * Responsible Tech Research IBM Research Yorktown Heights New York USA(负责技术研究 IBM 研究 Yorktown Heights 新 York 美国) IBM Research(IBM 研究) The Pennsylvania State University(宾夕法尼亚州立大学) University of Notre Dame(诺特达美大学)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过访谈从业者,探讨了红队行动数据集定义、创建和评估的社会技术实践,揭示了从业者在风险概念化中的不足,并提出HCI研究者扩展红队行动概念化和数据实践的三个机会。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2602.13597 2026-02-24 cs.CR 86%

AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks

AlignSentinel: 一种考虑对齐的提示注入攻击检测方法

Yuqi Jia, Ruiqi Wang, Xilong Wang, Chong Xiang, Neil Gong

专题命中 提示注入 :prompt injection(title,abstract);alignment(title)

AI总结 AlignSentinel通过分析LLM注意力图,有效区分包含错位指令、对齐指令和非指令输入,提升提示注入攻击检测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18514 2026-02-24 cs.CR cs.AI 85%

Trojan Horses in Recruiting: A Red-Teaming Case Study on Indirect Prompt Injection in Standard vs. Reasoning Models

招聘中的木马:针对标准与推理模型间接提示注入的红队案例研究

Manuel Wirth

机构 * University of Mannheim(曼海姆大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究通过红队测试揭示了标准与推理模型在间接提示注入中的安全差异,发现推理模型在复杂指令下易出现元认知泄漏,而标准模型在简单攻击中表现较弱。

Comments 43 pages, 3 synthetic CV PDF's, 6 chat history PDF's and system prompts. This work was developed as part of the Responsible AI course within the Mannheim Master in Data Science (MMDS) program at the University of Mannheim

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 4 篇

2602.17053 2026-02-24 cs.AI cs.CL 62%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18763 2026-02-24 cs.CV cs.AI 57%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19968 2026-02-24 physics.app-ph 50%

Probabilistic Photonic Computing

概率光子计算

Frank Brückerhoff-Plückelmann, Anna P. Ovvyan, Akhil Varri, Hendrik Borras, Bernhard Klein, C. David Wright, Harish Bhaskaran, Ghazi Sarwat Syed, Abu Sebastian, Holger Fröning, Wolfram Pernice

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出利用光子计算实现低延迟、低能耗的概率计算架构,以解决传统确定性硬件在概率建模中的不足,并探讨其在人工智能系统中的应用与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19507 2026-02-24 cs.HC 50%

Conversational AI for Automated Patient Questionnaire Completion: Development Insights and Design Principles

用于自动患者问卷完成的对话式AI:开发见解与设计原则

David Fraile Navarro, Mor Peleg

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种基于生成式AI的对话代理,用于自动完成患者问卷,通过主题对话提高数据收集效率,并总结了设计原则和开发经验。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2602.19087 2026-02-24 cs.CR cs.AI cs.LG 62%

Detecting Cybersecurity Threats by Integrating Explainable AI with SHAP Interpretability and Strategic Data Sampling

通过整合可解释AI与SHAP可解释性及战略数据采样检测网络安全威胁

Norrakith Srisumrith, Sunantha Sodsee

机构 * Dept. of Digital Network and Information Security Management(数字网络与信息安全管理系)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过整合可解释AI与SHAP可解释性及战略数据采样,提升网络安全威胁检测的透明度和效率

Comments 10 pages, 6 figures, accepted for publication in ICTIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 29 篇

2602.18729 2026-02-24 cs.CV cs.AI 88%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19614 2026-02-24 cs.SE cs.LG 85%

Workflow-Level Design Principles for Trustworthy GenAI in Automotive System Engineering

汽车系统工程中可信生成式人工智能的工作流级设计原则

Chih-Hong Cheng, Brian Hsuan-Cheng Liao, Adam Molin, Hasan Esen

机构 * Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) DENSO AUTOMOTIVE

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出可信生成式人工智能在汽车系统工程中工作流级设计原则,通过需求增量识别、SysML架构更新及可追溯测试保障安全关键系统工程的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 78%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18468 2026-02-24 cs.CY cs.CL 73%

The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models

算法无意识:大型语言模型中的结构机制与隐性偏见

Philippe Boisnard

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。

Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 71%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 安全评测 :trustworthy(title)

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19547 2026-02-24 cs.CR 67%

CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents

CIBER:代码解释器代理安全评估的综合基准

Lei Ba, Qinbin Li, Songze Li

专题命中 安全评测 :alignment(abstract);prompt injection(abstract)

AI总结 CIBER提出了一种综合基准,评估代码解释器代理对四种主要对抗性攻击的鲁棒性,揭示了模型架构、对齐和智能水平对安全的影响,以及自然语言伪装和安全极化现象。

详情

展开后加载摘要…

URL PDF HTML 收藏