You Don't Need to Run Every Eval
你不需要运行每个评估
机构 * Microsoft Research, AI Frontiers(微软研究院,AI前沿)
AI总结 研究发现前沿模型在133个基准上的分数主要由两个潜在因素决定,并提出了基于秩-2矩阵补全的BenchPress方法,能用少量基准高精度预测模型在其他基准上的表现。
Comments 49 pages, 14 figures, 18 tables
大厂专区
你不需要运行每个评估
机构 * Microsoft Research, AI Frontiers(微软研究院,AI前沿)
AI总结 研究发现前沿模型在133个基准上的分数主要由两个潜在因素决定,并提出了基于秩-2矩阵补全的BenchPress方法,能用少量基准高精度预测模型在其他基准上的表现。
Comments 49 pages, 14 figures, 18 tables
视频世界模型的潜在空间记忆
机构 * Zhejiang University(浙江大学) ; Microsoft Research(微软研究院) ; Adelaide University(阿德莱德大学) ; Monash University(莫纳什大学)
AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。
Comments Project Page: this https URL (https://aka.ms/latent-spatial-memory), Code: this https URL (https://github.com/microsoft/LatentSpatialMemory)
用更少提示实现更好的提示优化
机构 * Cornell University(康奈尔大学) ; Microsoft(微软) ; Harvard University(哈佛大学) ; Databricks AI Research(Databricks AI研究)
AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。
学习与课程学习:自课程学习的可证明收益
机构 * Microsoft Research(微软研究院)
AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。
Comments 39 pages, 4 figures
更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器
机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) ; Microsoft Healthcare & Life Sciences(微软医疗与生命科学)
AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。
Comments Accepted to Findings of EMNLP 2026
OS-Marathon: 在长周期重复任务上评估计算机使用代理的基准测试
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 OS-Marathon通过建立长周期重复任务的基准测试,评估计算机使用代理在处理复杂工作流中的性能和有效性。
Comments EMNLP 2026 Main Conference, Project Page: this https URL (https://os-marathon.github.io/)