Weak-to-Strong On-Policy Distillation
弱到强在线策略蒸馏
机构 * University of Maryland(马里兰大学) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。
Comments Technical Report
大厂专区
弱到强在线策略蒸馏
机构 * University of Maryland(马里兰大学) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。
Comments Technical Report
有限自适应性下的上下文式板GLM赌博机
机构 * Microsoft Research India(微软研究院印度)
AI总结 针对有限自适应性的上下文式板赌博机问题,提出两种算法B-SlateGLinCB和RS-SlateGLinCB,分别适用于批处理和少切换设置,在多样性假设下实现与非线性参数无关的遗憾界,并具有计算效率。
Comments Accepted at ICML 2026
SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Texas A&M University(德克萨斯大学) ; Smart Information Flow Technologies (SIFT)(智能信息流技术公司) ; Kudu Dynamics(Kudu动态公司) ; Microsoft(微软)
AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。
Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)
Journal ref USENIX Security 2026