arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-05-04 至 2026-05-04 共收录 10
2605.00781 2026-05-04 cs.CV

Map2World: Segment Map Conditioned Text to 3D World Generation

Map2World: 基于分段地图的3D世界生成

Jaeyoung Chung, Suyoung Lee, Jianfeng Xiang, Jiaolong Yang, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出Map2World框架,通过用户定义的任意形状和尺度的分段地图生成一致且灵活的3D世界,并引入细节增强网络提升生成质量,实验证明其在可控性、一致性及内容连贯性上优于现有方法。

Comments project page: https://robot0321.github.io/Map2World/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14276 2026-05-04 cs.CV

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

ScreenParse:超越稀疏标注的完整屏幕解析监督

A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

机构 * IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世) ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉) ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学) Microsoft, Switzerland(微软公司,瑞士)

AI总结 ScreenParse通过大规模完整屏幕解析标注,训练出性能优异的ScreenVLM模型,显著提升了密集解析能力和迁移表现。

Comments Accepted at ICML 2026. 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00444 2026-05-04 cs.CV

Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

通过紧凑潜在多智能体协作实现视频理解的扩展

Kerui Chen, Jinglu Wang, Jianrong Zhang, Ming Li, Yan Lu, Hehe Fan

机构 * Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学) Guanming Lab(冠明实验室)

AI总结 本文提出MACF框架,通过解耦智能体感知预算与全局视频复杂度,实现可扩展的视频理解,保持视觉保真度,并在多种视频理解基准上优于现有方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00229 2026-05-04 stat.ML cs.LG math.OC

A unified perspective on fine-tuning and sampling with diffusion and flow models

Carles Domingo-Enrich, Yuanqi Du, Michael S. Albergo

机构 * Microsoft Research New England(微软研究新英格兰实验室) Harvard University(哈佛大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00130 2026-05-04 cs.LG

Learning Fingerprints for Medical Time Series with Redundancy-Constrained Information Maximization

学习带有冗余约束的信息最大化用于医学时间序列的指纹

Huayu Li, ZhengXiao He, Xiwen Chen, Jingjing Wang, Siyuan Tian, Jinghao Wen, Ao Li

机构 * University of Arizona, AZ, USA(亚利桑那大学) Microsoft Research, Shanghai, China(微软研究院) Clemson University, SC, USA(克莱姆森大学) Villanova University, IL, USA(维拉诺瓦大学)

AI总结 本文提出一种新的框架,通过冗余约束信息最大化学习医学时间序列的紧凑且可解释的指纹表示,结合重建损失和多样性惩罚提升表示的独立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27209 2026-05-04 cs.SE cs.AI

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

构建中的理论:协调语言模型用于研究软件,其中规范在演变

Halley Young, Nikolaj Björner

机构 * Microsoft Research(微软研究院)

AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00072 2026-05-04 cs.CV cs.AI cs.LG

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

通过间接奖励解锁零样本地理推理

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) Microsoft(微软)

AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14201 2026-05-04 cs.CR cs.AI cs.CL

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench:评估LLM代理在网络安全调查中的表现

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Security AI Research(微软安全AI研究) Tsinghua University(清华大学)

AI总结 ExCyTIn-Bench是首个评估LLM代理在网络安全调查任务中的基准,通过从调查图中生成的安全问题进行测试。该基准利用Azure租户中的SQL环境和Microsoft Sentinel日志构建威胁调查图,并生成问题以评估LLM代理的能力。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11329 2026-05-04 cs.DC cs.LG

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave:分布式大语言模型推理中的高效计算-通信重叠

Raja Gond, Nipun Kwatra, Ramachandran Ramjee

机构 * Microsoft(微软)

AI总结 TokenWeave通过优化RMSNorm与通信的融合核,实现高效计算-通信重叠,提升低token长度下的推理性能,实验显示延迟降低1.28倍,吞吐量提升1.19倍。

Comments Accepted at MLSys 2026. In Versions 1 and 2, Figure 6 erroneously reports Multimem-AllReduce bandwidth rather than Multimem Reduce-Scatter bandwidth. In Version 4, we corrected the x-axis tick labels in Figure 7

详情

展开后加载摘要…

URL PDF HTML 收藏