arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-07-02 至 2026-07-02 共收录 2
2511.04694 2026-07-02 cs.CL cs.AI 版本更新

Reasoning Up the Instruction Ladder for Controllable Language Models

在指令阶梯上推理以实现可控语言模型

Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Microsoft Research(微软研究院) Allen Institute for AI(艾伦人工智能研究所)

AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10887 2026-07-02 cs.CR cs.AI 版本更新

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

嘿,那是我的模型!引入链与哈希,一种大语言模型指纹识别技术

Mark Russinovich, Yanan Cai, Ahmed Salem

机构 * Microsoft(微软)

AI总结 提出一种基于链与哈希的LLM指纹识别框架,通过加密绑定提示与响应防止碰撞,并利用随机填充和元提示配置增强鲁棒性,实现可验证的所有权证明。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏