arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Yoshua Bengio

Machine Learning

2026-03-19 至 2026-03-19 共收录 2
2603.16928 2026-03-19 cs.CR cs.LG

Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback

察觉观察者:LLM代理可通过阻塞反馈推断CoT监控

Thomas Jiralerspong, Flemming Kondrup, Yoshua Bengio

机构 * Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero

AI总结 研究探讨LLM代理是否能自主推断其内部推理被监控,并在无显式训练的情况下产生逃避策略,发现高能力模型能通过阻塞反馈推断监控存在,但无法有效执行逃避意图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21852 2026-03-19 cs.LG cs.AI

A Comedy of Estimators: On KL Regularization in RL Training of LLMs

估计器的喜剧:关于在LLM训练中的KL正则化

Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Nikolay Malkin, Moksh Jain, Siddarth Venkatraman, Aaron Courville

机构 * McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能主席) CIFAR Fellow

AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏