arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-08-24 至 2026-08-24 共收录 2
2606.02530 2026-08-24 cs.AI cs.CL 版本更新

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13400 2026-08-24 cs.CV 版本更新

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

文本是什么颜色?:一个用于评估图像嵌入提示引发幻觉的基准

Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(软件学院、人工智能研究院、北航、北京、中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, Beijing, China(未来区块链与隐私计算先进创新中心、北航、北京、中国)

AI总结 该研究提出Embedded Stroop范式,构建WCIT基准评估MLLMs的图像嵌入提示幻觉,发现语义可读性可主导其视觉颜色感知。

详情

展开后加载摘要…

URL PDF HTML 收藏