arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 151 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 22 篇

2608.22615 2026-08-25 cs.AI 新提交 57%

DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue

DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习

Qi Zhang, Heajun An, Prakriti Dumaru, Sang Won Lee, Lifu Huang, Pamela J. Wisniewski, Jin-Hee Cho

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DeepSAGE是融合LLM与DRL的阶段感知咨询对话框架,经评估在阶段目标完成与对话效率上优于6种替代方案,为AI咨询提供了有前景的新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21803 2026-08-25 cs.CR cs.AI 新提交 57%

ExplainGuard: A Zero Trust Framework for Post-Hoc Explanation Integrity Guarantees in Blackbox XAI Models

ExplainGuard:一种用于黑盒XAI模型事后解释完整性保证的零信任框架

Maraz Mia, Shovan Roy, Mir Mehedi A. Pritom, Maanak Gupta

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出ExplainGuard零信任框架,通过策略决策点的三项验证支柱,中和XAI解释操纵攻击,将审计过程转为可验证操作,保障黑盒XAI模型事后解释的完整性。

Comments 9 pages, 2 figures. Accepted at the IEEE Cybersecurity Awareness and Research Symposium 2026 (IEEE CARS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21501 2026-08-25 cs.AI 新提交 57%

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

让信用跟随计算:面向大语言模型强化学习的架构感知信用传输

Qifan Shi, Zhaolu Kang, Chenghua Zhu

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对大语言模型强化学习的信用传输算子与架构无关的问题,提出计算条件信用传输框架及 CompPO 算法,在 Qwen3-4B 等模型上较 GRPO 取得更优的保留准确率与贪心评估表现。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14685 2026-08-25 cs.LG stat.ML 版本更新 57%

Rethinking Reverse KL as Adaptive Entropy Distillation

将反向KL重新思考为自适应熵蒸馏

Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-08-25 cs.CV cs.CL 版本更新 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22932 2026-08-25 eess.SP 新提交 50%

AirMoE: Realizing Over-the-Air Distributed Mixture-of-Experts Inference at the Wireless Edge

AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理

Huiling Yang, Zhanwei Wang, Kaibin Huang

专题命中 安全训练 :alignment(abstract)

AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22868 2026-08-25 cs.CR 新提交 50%

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全

Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

专题命中 安全训练 :safety(abstract)

AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-25 eess.SY 版本更新 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-08-25 cs.RO 版本更新 50%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 8 篇

2608.22312 2026-08-25 cs.CL 新提交 85%

Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models

面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动

Wenyun Li, Guiping Cao, Xiangyuan Lan, Zheng Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。

Comments Accept by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21895 2026-08-25 cs.CR cs.AI 新提交 83%

Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks

打破假设:针对语义攻击的输入端越狱防御审计

Aaditya Pratap, Harsh Kasyap, Somanath Tripathy

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文针对本地部署大语言模型的输入端越狱防御开展审计,追溯防御失效的假设根源,在6款14B至35B参数的开源权重模型上,用100条来自40余公开源的越狱提示完成13800条评估记录的测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23028 2026-08-25 cs.AI 新提交 77%

PsychJail: Exploring Psychological Jailbreaks via Multi-Turn Persuasion of LLM Policies

PsychJail:通过对大语言模型策略的多轮说服探索心理越狱

Zeyu Feng, Qingyu Wu, Yuzhe Luo, Hua Cheng

机构 * The Defense Innovation Institute, Academy of Military Sciences(军事科学院国防创新研究院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.AI

AI总结 本文提出PsychJail框架,利用社会心理学技术构建攻击策略,通过轨迹级强化学习优化,在四个对齐LLM上实现87.3%平均攻击成功率,揭示了不同模型的心理画像指纹,为LLM安全红队提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23185 2026-08-25 cs.CR 新提交 67%

Towards Automated Cyber Threat Intelligence Elicitation in Underground Forums

面向地下论坛中自动化网络威胁情报的获取

Lorenzo Bossi, Federico Saccani, Francesco Panebianco, Antonio Maci, Stefano Zanero, Stefano Longari, Michele Carminati

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出首个基于多智能体大语言模型的主动CTI获取系统DarkBot,其在受控与真实世界实验中均优于基线,可从地下论坛高效获取CTI且安全合规。

Comments 23 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00566 2026-08-25 cs.LG cs.CL cs.CR 版本更新 62%

Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models

相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性

Mohammed Sameer Syed, Rozhin Yasaei (University of Arizona)

机构 * University of Arizona(亚利桑那大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22716 2026-08-25 cs.CR cs.AI 新提交 57%

TEE-X: TEE-aware Acceleration Framework for Large Vision Models at the Edge

TEE-X:面向边缘端大视觉模型的感知可信执行环境加速框架

Kurt M Wilson, Mohaiminul Al Nahian, Abeer Matar A. Almalky, Sadat Shahriyar, Souvik Kundu, Zhishan Guo, Abdullah Al Arafat, Adnan Siraj Rakin

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 该研究提出TEE-X框架,在Arm TrustZone的OP-TEE上验证,可在NVIDIA Jetson AGX Xavier上实现大视觉模型的安全高效边缘推理,兼顾性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-08-25 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-08-25 cs.CR 版本更新 50%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 越狱攻击 :safety(abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2608.21985 2026-08-25 cs.AI 新提交 70%

Redteaming Leading Arabic LLMs with ASAS

基于ASAS对领先阿拉伯大型语言模型开展红队测试

Fidaa Abed, Haidar Khan, M Saiful Bari, Babar Khan, Abdalghani Abujabal

专题命中 红队测试 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究推出首个人工策划的阿拉伯语红队测试基准ASAS,评估7款领先阿拉伯LLM的安全性,发现多数模型对50%不安全提示防御失效,自动安全评判器表现逊于人工,为阿拉伯LLM安全提供文化适配的测试方案。

Comments 13 pages, 5 figues, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 7 篇

2608.21500 2026-08-25 cs.CR cs.AI 新提交 85%

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

SecOPD:通过策略内蒸馏缓解自适应提示注入攻击

Yibo Peng, Long Lian, David Wagner, Sizhe Chen

专题命中 提示注入 :prompt injection(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对AI智能体面临的自适应提示注入攻击,提出SecOPD方法,通过令牌级反馈优化防御微调,大幅降低攻击成功率,且安全性可泛化到工具调用等新领域。

Comments EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-25 cs.LG 版本更新 83%

Localize and Neutralize: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22248 2026-08-25 cs.CR 新提交 82%

Beyond Over-Refusal: Defending Indirect Prompt Injection via Latent Instruction Manifolds

超越过度弃权:通过潜在指令流形防御间接提示注入攻击

Jiahao Chen, Rui Yin, Xinfeng Li, Qianli Ma, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)

AI总结 针对LLMs防御间接提示注入时的安全-效用权衡问题,提出AEGIS模型,通过指令敏感投影器与统一多层共识机制实现出色的攻击检测性能,缓解IPI攻击。

Comments Extended Content of EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04565 2026-08-25 cs.CR cs.AI cs.CL 版本更新 73%

Breadcrumbing Search Agents

面包屑式搜索智能体

Xuebin Li, Hanqing Zhao, Siyuan Liang, Kejiang Chen, Weiming Zhang, Dacheng Tao, Nenghai Yu

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21656 2026-08-25 cs.CL 新提交 70%

Mitigating Database Leakage in RAG Systems with Keyword-Grounded Fact Substitution

基于关键词锚定的事实替换缓解RAG系统中的数据库泄露

Ziliang Zhang, Yubo Zhu, Wei Tong, Jingyu Hua, Zijian Wang, Yuan Zhang, Sheng Zhong

机构 * Nanjing University(南京大学)

专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL

AI总结 针对RAG系统易受提示注入攻击导致数据库泄露的问题,提出KFS-RAG防御方法,通过关键词锚定的事实替换缓解泄露风险,同时保持响应准确性与相关性,为构建安全可信RAG系统提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-08-25 cs.LG 版本更新 70%

System-Prompt Anchoring with Cross-Attention Layers

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-25 cs.CR cs.AI 版本更新 57%

Your Agentic LLMs Secretly Encode Indirect Prompt-Injection Exposure in Hidden States

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Peng Xu, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2608.21444 2026-08-25 cs.AI cs.ET cs.HC cs.RO 新提交 79%

Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities

面向安全关键多无人机系统的智能体人工智能:挑战与机遇

Timothy Merritt, Alejandro Jarabo-Peñas, Juan Bravo-Arrabal, Maria-Theresa Bahodi, Anders Lyhne Christensen

机构 * Aalborg University(奥尔堡大学) University of Southern Denmark(南丹麦大学)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 本文针对安全关键多无人机系统应用受限问题,结合NAMUR、PERSIST项目经验,提出将智能体AI作为社会技术设计问题,采用以人为本的迭代方法开发可迁移的概念验证系统与评估策略。

Comments 9 pages, 4 figures, presented at the AgentCraft Workshop at IUI2026 Conference, this https URL (https://agentcraft-iui.github.io/2026/) - this http URL (http://CEUR-WS.org) proceedings forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23047 2026-08-25 cs.CL cs.AI 新提交 62%

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析

Abdul Ghafoor, Muhammad Arslan Manzoor, Yufang Hou

机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03854 2026-08-25 cs.LG 版本更新 57%

When Calibration Depends on the Scoring Rule: Quantized Biomedical LLM Classification

量化对生物医学大语言模型可靠性的影响

Anton Rasmussen, Hong Qin

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17142 2026-08-25 eess.SY 版本更新 50%

A Hybrid Discrete-Event and Agent-Based Simulation Approach to Model Circular Supply Chains in Healthcare: A Case Study of Laparoscopic Scissors

用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例

Mohd Shoaib, Antuela Tako, Shahin Rahimifard

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2608.23020 2026-08-25 cs.CL cs.AI 新提交 62%

Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality

遗忘学习不只是擦除:通过生成不平等实现时间解耦

Xunlei Chen, Qirui Ye, Yuang Li, Yi Gong, Zhaokun Wang, Wenyi Li, Shiyao Guo, Jinyu Guo

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型遗忘学习的挑战,提出基于训练的细粒度框架ADU,通过解耦上下文注意力路径实现精准遗忘,在TOFU和WMDP基准上表现最优,同时保留高模型效用并减少副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏