arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-06-10 至 2026-06-10 共收录 8
2606.10956 2026-06-10 cs.AI cs.CL 新提交

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10478 2026-06-10 cs.CV 新提交

3D-CoS: A New 3D Reconstruction Paradigm Based on VLM Code Synthesis

3D-CoS:基于VLM代码合成的新型3D重建范式

Yuhao Wang, Puyi Wang, Linjie Li, Zhengyuan Yang, Kevin Qinghong Lin, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Microsoft(微软) University of Oxford(牛津大学)

AI总结 提出3D代码合成(3D-CoS)范式,将3D资产表示为可执行的Blender代码,利用VLM进行程序化重建,实现高可控性和局部编辑能力。

Comments Preprint. 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10334 2026-06-10 cs.AI 新提交

Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts

通过视觉反馈的自蒸馏策略优化:连接代码与视觉工件

Haoyu Dong

机构 * Microsoft(微软)

AI总结 提出Visual-SDPO框架,利用渲染视觉反馈作为特权上下文,通过自蒸馏和视觉引导的代码信用加权优化代码生成视觉工件的质量,在图表、UI和幻灯片生成任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10209 2026-06-10 cs.AI cs.LG cs.SE 新提交

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents

更少上下文,更优智能体:面向长周期工具使用LLM智能体的高效上下文工程

Abhilasha Lodha, Mahsa Pahlavikhah Varnosfaderani, Abir Chakraborty, Abhinav Mithal

机构 * Microsoft(微软)

AI总结 针对企业工具使用场景中上下文过长导致的问题,提出选择性保留最近工具交互并添加紧凑摘要的方法,在费用明细任务上将完成率从71.0%提升至91.6%,同时大幅降低token消耗和运行时间。

Comments 17 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10944 2026-06-10 cs.LG cs.DS math.ST stat.ME stat.ML stat.TH 新提交

Express Language Modeling

Express 语言建模

Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

机构 * Cornell Tech(康奈尔科技) University of Cambridge(剑桥大学) Microsoft Research(微软研究院)

AI总结 提出 Express 工具,将非因果注意力近似转换为因果近似,结合 Thinformer 实现最优因果注意力保证,并加速语言建模中的四个资源瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09788 2026-06-10 cs.MA cs.AI cs.CL cs.HC 版本更新

TinyTroupe: An LLM-powered Multiagent Persona Simulation Toolkit

TinyTroupe:一个基于LLM的多智能体人物模拟工具包

Paulo Salem, Robert Sim, Christopher Olsen, Prerit Saxena, Rafael Barcelos, Yi Ding

机构 * Microsoft Corporation(微软公司) Dipeak Technology(迪佩克技术)

AI总结 针对现有LLM多智能体系统在细粒度人物模拟方面的不足,提出TinyTroupe工具包,支持详细人物定义和程序化控制,用于行为研究和社会模拟。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14075 2026-06-10 cs.CL 版本更新

EXCEEDS: Extracting Complex Events via Nugget-based Grid Modeling in Scientific Domain

EXCEEDS: 通过基于线索块的网格建模在科学领域中提取复杂事件

Yi-Fan Lu, Xian-Ling Mao, Bo Wang, Xiao Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对科学领域事件密集、信息形式复杂的特点,构建大规模多事件文档级数据集SciEvents,并提出端到端框架EXCEEDS,将密集线索块编码为网格矩阵,简化复杂事件提取为基于线索块的网格建模任务,取得最优性能。

Comments Accepted by ACL 2026 Main Conference, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02221 2026-06-10 cs.LG cs.AI 版本更新

MedFeat: Model-Aware and Explainability-Driven Feature Engineering with LLMs for Clinical Tabular Prediction

MedFeat: 基于模型感知与可解释性驱动的LLM特征工程用于临床表格预测

Zizheng Zhang, Yiming Li, Justin Xu, Jinyu Wang, Rui Wang, Lei Song, Jiang Bian, David W Eyre, Jingjing Fu

机构 * Microsoft Research(微软研究院) University of Oxford(牛津大学)

AI总结 提出MedFeat框架,利用模型感知和特征重要性信号迭代引导LLM生成针对性特征,在临床表格预测中平均提升超10%。

详情

展开后加载摘要…

URL PDF HTML 收藏