arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-19 至 2026-08-19 共收录 3
2603.24472 2026-08-19 cs.CL cs.LG 版本更新

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

为什么自蒸馏(有时)会降低大语言模型的推理能力?

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dohyung Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国成均馆大学) Seoul National University(首尔国立大学)

AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。

Comments Accepted to COLM 2026. Code is available at https://github.com/beanie00/self-distillation-analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16024 2026-08-19 cs.AI 版本更新

ScreenSearch: Uncertainty-Aware OS Exploration

ScreenSearch: 带有不确定性的操作系统探索

Michael Solodko, Justin Wagle

机构 * Microsoft(微软)

AI总结 ScreenSearch通过结合结构化屏幕检索与基于不确定性的PUCT图强化学习,在大规模桌面探索中有效平衡探索与承诺,生成具有跨应用多样性的探索语料库。

Comments 22 pages, 8 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08713 2026-08-19 cs.AI cs.CV cs.RO 版本更新

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight

通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型

Yifei Dong, Fengyi Wu, Guangyu Chen, Lingdong Kong, Qiyu Hu, Yuxuan Zhou, Xu Zhu, Jingdong Sun, Jun-Yan He, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Apple(苹果公司) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。

Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: https://github.com/UWMILab/UniWM

详情

展开后加载摘要…

URL PDF HTML 收藏