arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-06 至 2026-02-06 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2602.02258 2026-02-06 cs.LG 83%

Alignment-Aware Model Adaptation via Feedback-Guided Optimization

通过反馈引导优化实现对齐感知的模型适应

Gaurav Bhatt, Aditya Chinchure, Jiawei Zhou, Leonid Sigal

机构 * Department of Computer Science, University of British Columbia, Location, Canada(不列颠哥伦比亚大学计算机科学系) Vector Institute of AI, Toronto, Canada(人工智能向量研究所) Stony Brook University, New York, USA(石溪大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出了一种通过反馈引导优化实现对齐感知的模型适应框架,通过自适应门控机制平衡监督与对齐梯度,减少有害输出并提升模型对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02594 2026-02-06 cs.LG cs.AI cs.SE 81%

SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents

SMARLA:一种用于深度强化学习智能体的安全监控方法

Amirhossein Zolfagharian, Manel Abdellatif, Lionel C. Briand, Ramesh S

机构 * School of Electrical Engineering and Computer Science (EECS), University of Ottawa(电气工程与计算机科学系,渥太华大学) Software and Information Technology Engineering Department, École de Technologie Supérieure(软件与信息技术工程系,高等技术学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(研发部,通用汽车)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 SMARLA是一种用于深度强化学习智能体的安全监控方法,通过状态抽象和Q值预测安全违规,实现早期检测与低假阳性率的平衡。

Journal ref in IEEE Transactions on Software Engineering, vol. 51, no. 01, pp. 82-105, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04972 2026-02-06 cs.CY 57%

Learning Context Matters: Measuring and Diagnosing Personalization Gaps in LLM-Based Instructional Design

学习上下文很重要:在基于LLM的教学设计中测量和诊断个性化差距

Johaun Hatchett, Debshila Basu Mallick, Brittany C. Bradford, Richard G. Baraniuk

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文提出了一种框架,用于测量和诊断学习上下文对基于LLM教学系统的影响,发现提供学习上下文能改善LLM的教学策略,但尚未实现可靠的个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏