arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 14 篇

2602.02027 2026-02-03 cs.AI cs.LG 88%

Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron

通过单个神经元的模型自反进行轻量级对齐以提升大语言模型的安全性

Sicheng Shen, Mingyang Lv, Han Shen, Jialin Wu, Binghao Wang, Zhou Yang, Guobin Shen, Dongcheng Zhao, Feifei Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Ant Group Co., Ltd.(蚂蚁集团有限公司) BrainCog Lab., CASIA(CASIA脑认知实验室) Zhongguancun Academy(中关村学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 通过单个神经元的模型自反实现轻量级对齐,提升大语言模型的安全性和实用性

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01685 2026-02-03 cs.LG cs.AI 84%

Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment

语义感知的Wasserstein策略正则化用于大语言模型对齐

Byeonghu Na, Hyungho Na, Yeongmin Kim, Suhyeon Jo, HeeSun Bae, Mina Kang, Il-Chul Moon

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Wasserstein策略正则化方法,通过语义感知的Wasserstein距离改进大语言模型对齐效果,实验表明其优于传统KL散度方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02136 2026-02-03 cs.AI 83%

Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models

通过基于分布的细化缓解安全税在大推理模型中的影响

Yingsha Xie, Tiansheng Huang, Enneng Yang, Rui Min, Wenjie Lu, Xiaochun Cao, Naiqiang Tan, Li Shen

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区计算机科学与技术学院) Hong Kong University of Science(香港科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出DGR方法,通过基于分布的细化缓解大推理模型中的安全税,提升推理准确性和安全性。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 83%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10520 2026-02-03 cs.AI cs.CY 81%

Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment

与规范性单一体制代理告别:GRACE:一种基于原因的神经符号架构,用于安全和道德的人工智能对齐

Felix Jahn, Yannic Muskalla, Lisa Dargasz, Patrick Schramowski, Kevin Baum

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Center for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) Saarland Informatics Campus(萨尔州信息学校区) Computer Science Department, TU Darmstadt(图宾根大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 GRACE是一种基于原因的神经符号架构,用于安全和道德的人工智能对齐,通过分离规范性推理与工具性决策,确保AI代理的行为符合道德规范。

Comments 10 pages, 4 figures, accepted at 2nd Annual Conference of the International Association for Safe & Ethical AI (IASEAI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01725 2026-02-03 cs.CL cs.AI cs.LG 67%

SafePred: A Predictive Guardrail for Computer-Using Agents via World Models

SafePred: 通过世界模型为计算机使用代理构建一种预测性防护措施

Yurun Chen, Zeyi Liao, Ping Yin, Taotao Xie, Keting Yin, Shengyu Zhang

机构 * Zhejiang University, China(浙江大学) The Ohio State University, USA(俄亥俄州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SafePred通过世界模型预测未来风险,构建风险到决策的循环,提升计算机使用代理的安全性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02132 2026-02-03 cs.CL 57%

There Is More to Refusal in Large Language Models than a Single Direction

大型语言模型中拒绝行为远不止单一方向

Faaiz Joad, Majd Hawasly, Sabri Boughorbel, Nadir Durrani, Husrev Taha Sencar

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) HBKU(哈比卜大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究揭示大型语言模型中拒绝行为由多种几何方向控制,不同方向影响拒绝方式而非是否拒绝

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00950 2026-02-03 cs.AI 57%

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

MindGuard: 多轮心理健康支持中的防护分类器

António Farinhas, Nuno M. Guerreiro, José Pombal, Pedro Henrique Martins, Laura Melton, Alex Conway, Cara Dochat, Maya D'Eon, Ricardo Rei

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 57%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00399 2026-02-03 stat.ML cs.LG 57%

Reinforcement Learning for Control Systems with Time Delays: A Comprehensive Survey

具有时间延迟的控制系统强化学习:全面综述

Armando Alves Neto

机构 * Department of Electronics Eng. (DELT), UFMG(电子工程系(DELT),联邦大学米纳斯吉拉斯州分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文综述了针对控制系统中时间延迟的强化学习方法,分析了不同方法的优缺点,并提出了未来研究方向。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01916 2026-02-03 cs.RO 50%

ForSim: Stepwise Forward Simulation for Traffic Policy Fine-Tuning

ForSim:基于逐步前向模拟的交通策略微调

Keyu Chen, Wenchao Sun, Hao Cheng, Zheng Fu, Sifa Zheng

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 安全训练 :safety(abstract)

AI总结 ForSim通过逐步闭环前向模拟范式提升交通模拟的保真度,结合组相对优化微调交通策略,提高安全性与效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19016 2026-02-03 cs.CR 50%

DREAM: Dynamic Red-teaming across Environments for AI Models

DREAM: 为AI模型跨环境动态红队测试

Liming Lu, Xiang Gu, Junyu Huang, Jiawei Du, Xu Zheng, Yunhuai Liu, Yongbin Zhou, Shuchao Pang

专题命中 安全训练 :safety(abstract)

AI总结 DREAM通过动态多阶段攻击测试揭示LLM代理在跨环境安全中的关键漏洞,指出上下文脆弱性和长期恶意意图追踪不足,并提出评估工具以提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22221 2026-02-03 cs.CV 50%

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型

Jiaqi Liu, Lang Sun, Ronghao Fu, Bo Yang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01129 2026-02-03 cs.CR 50%

SMCP: Secure Model Context Protocol

SMCP: 安全模型上下文协议

Xinyi Hou, Shenao Wang, Yifan Zhang, Ziluo Xue, Yanjie Zhao, Cai Fu, Haoyu Wang

专题命中 安全训练 :prompt injection(abstract)

AI总结 SMCP通过统一身份管理、强认证和细粒度策略执行,提升智能体系统在工具调用中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏