arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3317 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3317 篇

2604.14316 2026-04-17 cs.AI 57%

Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning

通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型

Kinhei Lee, Peiyuan Jing, Zhenxuan Zhang, Yue Yang, Tao Wang, Dominic C Marshall, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X(生物工程系和Imperial-X) Imperial College London(帝国理工学院伦敦分校) College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院) Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出GazeX模型,通过放射学家的眼动数据模拟专家推理过程,提升医学影像分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03236 2026-04-17 cs.AI 57%

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents

MAGMA:一种基于多图的代理记忆架构用于AI代理

Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

机构 * Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 MAGMA通过多图结构实现记忆表示,提升长时序推理任务的性能,提供透明推理路径和细粒度检索控制。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13757 2026-04-16 cs.AI cs.HC 57%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 57%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10398 2026-04-15 cs.AI 57%

LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries

LatentRefusal:用于无法回答的文本到SQL查询的潜在信号拒绝

Xuancheng Ren, Shijing Hu, Zhihui Lu, Jiangqi Huang, Qiang Duan

机构 * Fudan University(复旦大学) Pennsylvania State University(宾夕法尼亚州立大学) Abington College(阿宾顿学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出LatentRefusal方法,通过分析大语言模型的中间隐藏激活来预测查询可回答性,从而在文本到SQL系统中实现安全拒绝,提升系统安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05914 2026-04-15 cs.CY 57%

Designing Incident Reporting Systems for Harms from General-Purpose AI

为通用人工智能造成的伤害设计事件报告系统

Kevin Wei, Lennart Heim

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出一个概念框架,探讨AI事件报告系统的制度设计,分析九个安全关键行业案例,提出美国AI事件报告的设计考量。

Comments Published in AAAI 2026. V2: Added Executive Summary, fixed hyperref line breaking issues

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence. 40, 44 (Mar. 2026), 38016-38029

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10991 2026-04-14 cs.HC cs.AI 57%

Examining EAP Students' AI Disclosure Intention: A Cognition-Affect-Conation Perspective

审视EAP学生的AI披露意愿:一种认知-情感-动机视角

Yiran Du, Huimin He

机构 * University of Cambridge(剑桥大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究从认知-情感-动机视角探讨EAP学生使用AI工具披露意愿的影响因素,发现心理安全正向预测披露意愿,而对负面评价的恐惧则负向预测,强调了清晰政策和支持性教学环境的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 57%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :DPO(abstract);分类 cs.AI

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10316 2026-04-14 cs.CL 57%

Comparative Analysis of Large Language Models in Healthcare

医疗领域大型语言模型的比较分析

Subin Santhosh, Farwa Abbas, Hussain Ahmad, Claudia Szabo

机构 * Adelaide University(阿德莱德大学) South Australian Health and Medical Research Institute(南澳大利亚健康与医学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文通过评估多个医疗任务,比较了ChatDoctor等领域模型与Grok等通用模型的性能,发现领域模型在医疗文本生成中更准确,而通用模型在问答任务中表现更优,强调了任务特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09963 2026-04-14 cs.DC cs.AI cs.SE 57%

Rebooting Microreboot: Architectural Support for Safe, Parallel Recovery in Microservice Systems

重振微重启:用于微服务系统的安全并行恢复架构支持

Laurent Bindschaedler

机构 * Max Planck Institute for Software Systems (MPI-SWS)(马克斯·普朗克软件系统研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种安全并行恢复架构,通过分离规划与执行,利用类型化的修复计划和微内核确保安全,实验证明其在工业级数据和故障注入测试中有效减少修复带来的损害。

Comments 18 pages, 1 figure, 4 tables. Published at ARCS 2026

Journal ref Proc. 39th GI/ITG International Conference on Architecture of Computing Systems (ARCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07667 2026-04-10 cs.AI cs.MA cs.SI 57%

From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation

从辩论到决策:用于安全多智能体辩论的符合社会选择

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Aijing Gao, Guang Yang, Ziyuan Li, Qucy Wei Qiu, Fangwei Han, Hengzhi Qiu, Yajing Huang, Bing Zhu, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Conformal Social Choice方法,通过后处理层将辩论输出转化为校准的行动与升级决策,确保正确答案的概率覆盖,提升多智能体辩论的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06233 2026-04-09 cs.AI 57%

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules

盲性拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则

Cameron Pattison, Lorenzo Manuali, Seth Lazar

机构 * Vanderbilt University(范德堡大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究探讨语言模型在面对不公正规则时的拒绝行为,发现模型在无安全风险情况下仍拒绝帮助,且其拒绝行为与规范推理能力脱节。

Comments 9 pages body text, 38 pages total, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29908 2026-04-09 cs.AI 57%

C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving

C-TRAIL:用于自动驾驶轨迹规划的常识世界框架

Zhihong Cui, Haoran Tang, Tianyi Li, Yushuai Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Hong Kong Polytechnic University(香港理工大学) Aalborg University(奥尔堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出C-TRAIL框架,结合常识世界与信任机制,通过Recall-Plan-Update循环提升自动驾驶轨迹规划的可靠性,实验表明其在ADE、FDE和SR指标上均优于现有方法。

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04691 2026-04-09 cs.RO cs.AI cs.MA 57%

Before Humans Join the Team: Diagnosing Coordination Failures in Healthcare Robot Team Simulation

在人类加入团队之前:医疗机器人团队模拟中的协调失败诊断

Yuanchen Bai, Zijian Ding, Shaoyue Wen, Xiang Chang, Angelique Taylor

机构 * Cornell Tech(康奈尔科技校区) Department of Information Science, Cornell University(康奈尔大学信息科学系) University of Maryland, College Park(马里兰大学帕克分校) Imperial College London(伦敦帝国学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过模拟方法研究医疗机器人团队的协调失败问题,发现团队结构是协调的主要瓶颈,并提出安全的人机协作设计方法。

Comments Revised version incorporating new analysis and restructuring

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20906 2026-04-09 cs.CR cs.LG 57%

A Giant-Step Baby-Step Classifier For Scalable and Real-Time Anomaly Detection In Industrial Control Systems and Water Treatment Systems

大规模步长婴儿步分类器:用于工业控制系统和水处理系统中可扩展且实时的异常检测

Sarad Venugopalan, Sridhar Adepu

机构 * Swansea University(斯旺西大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于线性化非线性关系的异常检测方法,通过水处理测试平台验证,实现毫秒级异常检测,兼具速度与可解释性,准确率达97.72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09035 2026-04-09 cs.RO cs.AI cs.SY eess.SY 57%

ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers

ManeuverGPT 代理控制用于安全的自动驾驶特技动作

Shawn Azdam, Pranav Doma, Aliasghar Moj Arab

机构 * New York University(纽约大学) Tandon School of Engineering, New York University(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司) Azdam AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出ManeuverGPT框架,利用大语言模型代理生成并执行高动态特技动作,通过迭代提示法优化车辆控制参数,实现安全的J-turn等特技动作执行。

Comments 6 Pages, Submitted to IROS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06093 2026-04-08 eess.SY cs.LG cs.RO cs.SY 57%

eVTOL Aircraft Energy Overhead Estimation under Conflict Resolution in High-Density Airspaces

在高密度空域中,eVTOL飞行器在冲突解决中的能量开销估计

Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文研究了在高密度空域中,基于修改电压势算法的冲突解决对eVTOL能量消耗的影响,发现该算法在不同密度下能量开销较低,但存在右偏分布,最高密度下尾部案例开销可达44%。

Comments Accepted for presentation at the Integrated Communications, Navigation and Surveillance Conference (ICNS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04527 2026-04-07 cs.SE cs.AI cs.PL 57%

ENCRUST: Encapsulated Substitution and Agentic Refinement on a Live Scaffold for Safe C-to-Rust Translation

ENCRUST:在活体支架上进行封装替换和代理细化以实现安全的C到Rust翻译

Hohyun Sim, Hyeonjoong Cho, Ali Shokri, Zhoulai Fu, Binoy Ravindran

机构 * Korea University(高丽大学) University of Houston(休斯顿大学) State University of New York Korea(纽约州立大学韩国分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 ENCRUST通过封装替换和代理细化方法,解决C到Rust翻译中的类型不匹配和不安全构造问题,通过ABI保持封装模式和整体代码库验证,实现安全且可编译的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04426 2026-04-07 cs.AI 57%

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

ShieldNet: 针对代理系统中新兴供应链注入的网络级防护

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang, Nathaniel D. Bastian, Seyyed Hadi Hashemi, Chaowei Xiao, Wenbo Guo, Bo Li

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) University of Georgia(佐治亚大学) United States Military Academy(美国军事学院) eBay Johns Hopkins University(约翰霍普金斯大学) UCSB(加州大学圣塔芭芭拉分校) Virtue AI

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出ShieldNet,通过观察真实网络交互检测供应链注入,优于现有工具,检测性能达0.995 F-1,误报率低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00495 2026-04-07 cs.AI 57%

AI Runtime Infrastructure

AI 运行时基础设施

Christopher Cruz

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出AI运行时基础设施,通过在模型与应用之间引入执行层,主动监控和干预智能体行为,优化任务成功率、延迟、令牌效率、可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03278 2026-04-07 eess.SY cs.AI cs.SY math.OC 57%

Safe Decentralized Operation of EV Virtual Power Plant with Limited Network Visibility via Multi-Agent Reinforcement Learning

通过多智能体强化学习实现有限网络可见性的电动汽车虚拟电厂安全分布式运行

Chenghao Huang, Jiarong Fan, Weiqing Wang, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT, Monash University(蒙纳士大学信息技术学院数据科学与人工智能系) Monash Energy Institute, Monash University(蒙纳士大学蒙纳士能源研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种安全增强的虚拟电厂框架,利用多智能体强化学习在有限信息约束下协调多个电动汽车充电站,确保电压安全并维持经济运行。

Comments The 2026 IEEE Power & Energy Society General Meeting, 7 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03232 2026-04-07 cs.AI 57%

IC3-Evolve: Proof-/Witness-Gated Offline LLM-Driven Heuristic Evolution for IC3 Hardware Model Checking

IC3-Evolve: 用于IC3硬件模型检查的自动离线LLM驱动启发式进化

Mingkai Miao, Guangyu Hu, Ziyi Yang, Hongce Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 IC3-Evolve通过离线LLM提出小范围修正,实现IC3硬件模型检查的自动优化,确保正确性验证下的启发式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00580 2026-04-03 cs.RO cs.AI 57%

OmniUnet: A Multimodal Network for Unstructured Terrain Segmentation on Planetary Rovers Using RGB, Depth, and Thermal Imagery

OmniUnet:一种多模态网络,用于使用RGB、深度和热成像的无结构地形分割在火星车上的应用

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * University of Luxembourg(卢森堡大学) Universidad de Málaga(马拉加大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 OmniUnet通过整合RGB、深度和热成像数据,实现无结构地形的高效分割,利用自定义传感器设备在西班牙Bardenas半沙漠收集数据,并在资源受限设备上验证了其性能。

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10030 2026-04-02 cs.MA cs.LG 57%

Multi-agent In-context Coordination via Decentralized Memory Retrieval

通过去中心化记忆检索实现多智能体上下文协调

Tao Jiang, Zichuan Lin, Lihe Li, Yi-Chen Li, Cong Guan, Lei Yuan, Zongzhang Zhang, Yang Yu, Deheng Ye

机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Tencent(腾讯)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出MAICC方法,通过去中心化记忆检索提升多智能体强化学习中任务协调效率,实验表明其在Level-Based Foraging和SMAC等基准上表现更优。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 27, pp. 22363-22371, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29373 2026-04-01 cs.CL 57%

Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations

超越理想化患者:在医疗咨询中评估LLM在挑战性患者行为下的表现

Yahan Li, Xinyi Jie, Wanjia Ruan, Xubei Zhang, Huaijie Zhu, Yicheng Gao, Chaohao Du, Ruishan Liu

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文研究了医疗咨询中常见的挑战性患者行为,定义了四种行为类别,并提出了CPB-Bench基准测试集,评估了多种LLM在处理这些行为时的表现,发现模型在处理矛盾或医学上不合理的患者信息时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 57%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27299 2026-03-31 cs.LG 57%

From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification

从推理路由到代理编排:基于跨层验证的声明性策略编译

Huamin Chen, Xunzhuo Liu, Bowei He, Xue Liu

机构 * McGill University(麦吉尔大学)

专题命中 安全训练 :jailbreak(abstract);分类 cs.LG

AI总结 本文扩展了非图灵完备的策略语言,从单请求路由到多步骤代理工作流,通过跨层验证确保策略一致性,提升可审计性和可验证性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27194 2026-03-31 cs.RO cs.AI 57%

Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence

基于场景自适应具身智能的多无人水下机器人自组网多目标跟踪

Kai Tian, Jialun Wang, Chuan Lin, Guangjie Han, Shengchao Zhu, Ying Liu, Qian Zhu

机构 * Software College, Northeastern University(东北大学软件学院) Key Laboratory of Maritime Intelligent Network Information Technology, Ministry of Education, Hohai University(河海大学教育部海事智能网络信息技术重点实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于场景自适应具身智能的多AUV自组网架构,通过整合感知、决策与物理执行,提升多目标跟踪的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27148 2026-03-31 cs.CR cs.AI 57%

SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do

SafetyDrift: 在实际发生之前预测AI代理跨过界限的时间

Aditya Dhodapkar, Farhaan Pishori

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Santa Clara University(圣克拉拉大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出SafetyDrift模型,通过吸收马尔可夫链分析预测AI代理在有限时间内的安全违规概率,发现不同任务中违规风险差异显著,且轻量监控器在低计算成本下有效检测违规。

Comments 9 pages, 7 figures, sent to COLM conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24143 2026-03-31 cs.CL 57%

Activation Steering for Masked Diffusion Language Models

激活引导用于掩码扩散语言模型

Adi Shnaidman, Erin Feiglin, Osher Yaari, Efrat Mentel, Amit Levi, Raz Lapid

机构 * Deepkeep Technion—Israel Institute of Technology(以色列理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出激活引导方法,通过提取对比提示集的低维方向,实现对MDLMs推理过程的控制,展示了在安全拒绝任务中的有效性及跨语言迁移能力。

Comments Accepted at ReALM-GEN @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏