arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-04 至 2026-03-04 共收录 63 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2511.03827 2026-03-04 cs.CL 83%

STARS: Synchronous Token Alignment for Robust Supervision in Large Language Models

STARS: 同步标记对齐用于大语言模型中稳健的监督

Mohammad Atif Quamar, Mohammad Areeb, Mikhail Kuznetsov, Muslum Ozgur Ozmen, Z. Berkay Celik

机构 * Purdue University(普渡大学) Amazon(亚马逊) Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 STARS通过同步标记对齐方法提升大语言模型的对齐性能,实现稳健监督和高效系统吞吐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03242 2026-03-04 cs.AI cs.CL 81%

Density-Guided Response Optimization: Community-Grounded Alignment via Implicit Acceptance Signals

密度引导的响应优化:通过隐含接受信号实现社区导向的对齐

Patrick Gerard, Svitlana Volkova

机构 * Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学) Aptima Inc.(Aptima公司)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过隐含接受信号实现社区导向的对齐,无需显式偏好标签,提升语言模型在多样社区中的适应性与表现。

Comments 27 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01352 2026-03-04 cs.CL cs.AI cs.LG 80%

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Skywork-Reward-V2: 通过人机协同扩大偏好数据整理

Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

机构 * Research, Skywork AI(2050研究, Skywork AI)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Skywork-Reward-V2通过人机协同扩大偏好数据整理,提出SynPref-40M数据集和两阶段流程,训练出八种参数不同的奖励模型,在多个基准中取得最佳性能。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03000 2026-03-04 cs.LG cs.AI 73%

Why Does RLAIF Work At All?

为什么RLAIF真的有效?

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02232 2026-03-04 cs.LG cs.AI 62%

Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback

超越二元偏好:基于顺序反馈的奖励建模原理框架

Amirhossein Afsharrad, Ruida Zhou, Luca Viano, Sanjay Lall, Mohammad Ghavamzadeh

机构 * Stanford University(斯坦福大学) Amazon AGI(亚马逊人工智能研究) EPFL(瑞士联邦理工学院) Qualcomm AI Research(高通人工智能研究) Aktus AI

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于顺序反馈的奖励建模原理框架,通过离散顺序回归方法,学习阈值参数以捕捉偏好顺序结构,实现更有效的细粒度人类反馈利用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2603.02635 2026-03-04 cs.LG 85%

SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety

SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理

Zixuan Xu, Tiancheng He, Huahui Yi, Kun Wang, Xi Chen, Gongli Xi, Qiankun Li, Kang Li, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL 84%

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML 80%

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02675 2026-03-04 cs.LG 77%

From Shallow to Deep: Pinning Semantic Intent via Causal GRPO

从浅层到深层:通过因果GRPO固定语义意图

Shuyi Zhou, Zeen Song, Wenwen Qiang, Jiyan Sun, Yao Zhou, Yinlong Liu, Wei Ma

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过因果GRPO框架,解决大型语言模型对对抗性前缀攻击的脆弱性问题,实现意图固定以提升安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21831 2026-03-04 cs.CY 57%

A Multi-Turn Framework for Evaluating AI Misuse in Fraud and Cybercrime Scenarios

针对欺诈和网络犯罪场景的多轮评估框架

Kimberly T. Mai, Anna Gausen, Magda Dubois, Mona Murad, Bessie O'Dell, Nadine Staes-Polet, Christopher Summerfield, Andrew Strait

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种针对欺诈和网络犯罪场景的多轮评估框架,评估了当前大型语言模型在提供可操作信息方面的局限性,并揭示了安全措施和请求分解对信息提供的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02680 2026-03-04 cs.AI 57%

LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization

基于大语言模型的高频决策:归一化动作奖励引导的一致性策略优化

Yang Zhao, Zihao Li, Zhiyu Jiang, Dandan Ma, Ganchao Liu, Wenzhe Zhao

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出NAR-CP方法,通过归一化动作奖励和一致性损失优化,提升高频决策任务中的策略一致性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02588 2026-03-04 cs.CL 57%

ExpGuard: LLM Content Moderation in Specialized Domains

ExpGuard: 专门领域中的大语言模型内容审核

Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son

机构 * KAIST AI(韩国科学技术院人工智能研究所) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 ExpGuard通过专门领域的大语言模型内容审核模型,有效提升对金融、医疗和法律领域有害内容的防御能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02555 2026-03-04 cs.IR 50%

Relevance Matters: A Multi-Task and Multi-Stage Large Language Model Approach for E-commerce Query Rewriting

相关性至关重要:一种多任务和多阶段大型语言模型方法用于电子商务查询重写

Aijun Dai, Jixiang Zhang, Haiqing Hu, Guoyu Tang, Lin Liu, Ziguang Cheng

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出一种基于多任务和多阶段的大型语言模型方法,用于提升电子商务查询重写的相关性和用户转化效果。

Comments Accepted for publication at ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2603.03081 2026-03-04 cs.CL 85%

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

TAO-Attack:迈向大型语言模型的高级优化基 Jailbreak 攻击

Zhi Xu, Jiaqi Li, Xiaotong Zhang, Hong Yu, Han Liu

机构 * Dalian University of Technology(大连理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 TAO-Attack 提出了一种基于优化的 Jailbreak 攻击方法,通过双阶段损失函数和方向优先 token 优化策略,有效提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02479 2026-03-04 cs.CR cs.CL 77%

BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage

BitBypass:一种新的方向:利用位流伪装进行对齐大语言模型的黑盒劫持

Kalyan Nakka, Nitesh Saxena

机构 * SPIES Research Lab, Dept. of CSE, Texas A&M University(SPIES研究实验室,计算机科学与工程系,德克萨斯A&M大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 BitBypass通过位流伪装技术,提出了一种新的黑盒劫持方法,有效绕过对齐大语言模型的安全机制,展现出更高的隐蔽性和攻击成功率。

Comments 27 pages, 27 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08207 2026-03-04 cs.AI 57%

Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking

面向动态Stackelberg博弈框架的代理AI防御对抗大语言模型劫持

Zhengye Han, Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出动态Stackelberg博弈框架,用于代理AI防御对抗大语言模型劫持,通过RRT搜索和博弈树分析提升防御效果。

Comments Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02590 2026-03-04 cs.CR 50%

Extending the Formalism and Theoretical Foundations of Cryptography to AI

扩展密码学形式化和理论基础以适应人工智能

Federico Villa, F. Betül Durak, Tadayoshi Kohno, Tapdig Maharramli, Franziska Roesner

专题命中 越狱攻击 :harmlessness(abstract)

AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 4 篇

2602.09870 2026-03-04 cs.CL 77%

Steer2Edit: From Activation Steering to Component-Level Editing

Steer2Edit:从激活引导到组件级编辑

Chung-En Sun, Ge Yan, Zimo Wang, Tsui-Wei Weng

机构 * Department of Computer Science(计算机科学系) Halıcıoğlu Data Science Institute, UC San Diego(哈利奇奥卢数据科学研究所,加州大学圣迭戈分校)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 Steer2Edit通过将引导信号转化为可解释的参数更新,实现组件级权重编辑,提升模型的安全性、真实性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02798 2026-03-04 cs.AI cs.CL 73%

Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification

基于指南的证据积累用于高风险代理验证

Yichi Zhang, Nabeel Seedat, Yinpeng Dong, Peng Cui, Jun Zhu, Mihaela van de Schaar

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Thomson Reuters Foundational Research(汤姆森路透基础研究)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 GLEAN通过基于指南的证据积累框架,提升高风险代理决策的验证可靠性,实验显示其在AUROC和Brier分数减少方面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20346 2026-03-04 cs.CR cs.AI cs.LG 62%

Multimodal Multi-Agent Ransomware Analysis Using AutoGen

基于AutoGen的多模态多智能体勒索软件分析

Asifullah Khan, Aimen Wadood, Mubashar Iqbal, Umme Zahoora

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于AutoGen的多模态多智能体框架,通过融合静态、动态和网络信息,提升勒索软件分类的准确性和稳定性。

Comments 46 pages, 11 figures and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22165 2026-03-04 cs.LG 57%

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

思想图景:可视化大语言模型的推理过程

Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) Stanford University(斯坦福大学) Mila - Québec AI Institute(魁北克 AI 院) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔 HEC 学院) Intel AI Lab(英特尔 AI 实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2603.02882 2026-03-04 cs.CV 67%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract)

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 16 篇

2603.02482 2026-03-04 cs.LG cs.CL cs.CV cs.SD eess.AS 84%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Submitted to ACL 2026 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00857 2026-03-04 cs.CL 83%

ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs

ManagerBench: 评估自主大语言模型中的安全与务实之间的权衡

Adi Simhi, Jonathan Herzig, Martin Tutek, Itay Itzhak, Idan Szpektor, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) Google Research(谷歌研究) University of Zagreb(Zagreb大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 ManagerBench评估自主大语言模型在安全与务实权衡中的表现,揭示模型在冲突目标下的决策缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 79%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03126 2026-03-04 cs.DL cs.DB cs.IR cs.SI 78%

The Science Data Lake: A Unified Open Infrastructure Integrating 293 Million Papers Across Eight Scholarly Sources with Embedding-Based Ontology Alignment

科学数据湖:整合29300万篇论文的统一开放基础设施

Jonas Wilinski

专题命中 安全评测 :alignment(title,abstract)

AI总结 科学数据湖通过整合29300万篇论文,利用嵌入本体对齐技术实现跨来源数据统一,提升学术数据整合与分析效率。

Comments 18 pages, 8 figures, 7 tables. Dataset DOI: 10.57967/hf/7850. Code: https://github.com/J0nasW/science-datalake

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03206 2026-03-04 cs.LG cs.AI cs.CL 75%

Understanding and Mitigating Dataset Corruption in LLM Steering

理解并缓解LLM引导中的数据集损坏

Cullen Anderson, Narmeen Oozeer, Foad Namjoo, Remy Ogasawara, Amirali Abdullah, Jeff M. Phillips

机构 * Department of Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机科学系) Kahlert School of Computing, University of Utah(犹他大学凯尔特计算学校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究对比引导在数据集损坏下的鲁棒性,发现其对中等损坏较稳健,但恶意篡改会引发副作用,通过替换高维均值计算为鲁棒估计器可缓解影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02688 2026-03-04 cs.AI cs.RO 70%

Retrieval-Augmented Robots via Retrieve-Reason-Act

通过检索-推理-行动实现增强型机器人

Izat Temiraliev, Diji Yang, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23725 2026-03-04 cs.AI 70%

MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models

MedLA:基于大语言模型的复杂医学推理多智能体框架

Siqi Ma, Jiajie Huang, Fan Zhang, Yue Shen, Jinlin Wu, Guohui Fan, Zhu Zhang, Zelin Zang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MedLA是一种基于大语言模型的逻辑驱动多智能体框架,通过多轮图引导讨论实现透明推理和共识达成,有效提升复杂医学推理性能。

Comments accepted by AAAI-26 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21023 2026-03-04 cs.CL cs.AI cs.LG 67%

Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost

ParamΔ 用于直接权重混合:零成本的后训练大语言模型

Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ParamΔ通过零成本方法实现基础模型的后训练能力迁移,提升模型性能与开发效率。

Comments Published as a conference paper at ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏