arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-03-31 至 2026-03-31 共收录 11
2603.28696 2026-03-31 cs.CV cs.AI

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

AdaptToken: 基于熵的自适应令牌选择用于多模态大语言模型长视频理解

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) EPFL(瑞士联邦理工学院洛桑) ETH Zurich(苏黎世联邦理工学院)

AI总结 AdaptToken通过利用模型自不确定性实现全局控制信号,提升多模态大语言模型对长视频的理解能力,通过熵信号分配令牌预算并支持提前停止,提升准确率并减少推理时间。

Comments Project page: https://haozheqi.github.io/adapt-token

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28499 2026-03-31 cs.LG cs.AI cs.GT

Next-Token Prediction and Regret Minimization

下一个标记预测与后悔最小化

Mehryar Mohri, Clayton Sanford, Jon Schneider, Kiran Vodrahalli, Yifan Wu

机构 * Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Microsoft Research(微软研究院)

AI总结 研究探讨如何在对抗性在线决策环境中利用下一个标记预测算法,分析分布是否为低后悔分布,证明无界上下文窗口下总能实现亚线性后悔,而有界上下文窗口则存在Θ(1)距离的分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25810 2026-03-31 cs.PL cs.LG

ExVerus: Verus Proof Repair via Counterexample Reasoning

ExVerus:通过反例推理进行证明修复

Jun Yang, Yuechun Sun, Yi Wu, Rodrigo Caridad, Yongwei Yuan, Jianan Yao, Shan Lu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Purdue University(普渡大学) The University of Toronto(多伦多大学) Microsoft Research(微软研究院)

AI总结 ExVerus利用反例推理指导LLM生成更准确的证明,通过自动生成和验证反例来提高证明的鲁棒性和效率。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18482 2026-03-31 physics.comp-ph cond-mat.stat-mech cs.LG stat.ML

Boltzmann Generators for Condensed Matter via Riemannian Flow Matching

基于黎曼流匹配的凝聚态物质玻尔兹曼生成器

Emil Hoffmann, Maximilian Schebek, Leon Klein, Frank Noé, Jutta Rogal

机构 * Freie Universität Berlin(柏林自由大学) Microsoft Research(微软研究院) Flatiron Institute(熨斗研究所)

AI总结 本文提出利用黎曼流匹配将周期性特征融入连续归一化流,实现高效准确的凝聚相系统平衡分布采样,验证了在单原子冰中训练大规模系统并获得高精度自由能估计的能力。

Comments Published as a workshop paper at AI4MAT, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27670 2026-03-31 cs.RO cs.AI

ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation

ProgressVLA: 用于视觉-语言机器人操控的进展引导扩散策略

Hongyu Yan, Qiwei Li, Jiaolong Yang, Yadong Mu

机构 * Peking University(北京大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 本文提出ProgressVLA模型,通过鲁棒的进展估计和可微进展引导方法提升机器人操控任务的成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27101 2026-03-31 cs.CV cs.LG

PRUE: A Practical Recipe for Field Boundary Segmentation at Scale

PRUE:一种大规模田界边界分割的实用配方

Gedeon Muhawenayo, Caleb Robinson, Subash Khanal, Zhanpei Fang, Isaac Corley, Alexander Wollam, Tianyi Gao, Leonard Strnad, Ryan Avery, Lyndon Estes, Ana M. Tárano, Nathan Jacobs, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) Microsoft AI for Good(微软人工智能公益) Washington University in St. Louis(圣路易斯华盛顿大学) Oregon State University(俄勒冈州立大学) Wherobots Clark University(克拉克大学)

AI总结 本文提出一种结合U-Net和复合损失函数的分割方法,提升田界分割的性能和鲁棒性,实现了76%的IoU和47%的object-F1,为大规模可靠田界分割提供了实用框架。

Comments 12 pages, 3 figures, supplementary material. Accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26922 2026-03-31 cs.HC cs.AI

Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles

模仿对齐与ASPECT:AI推断个人资料的评估

Ruoxi Shang, Dan Marshall, Edward Cutrell, Denae Ford

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。

Comments 20 pages (including appendix), 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26866 2026-03-31 cs.CV cs.AI

LACON: Training Text-to-Image Model from Uncurated Data

LACON:从未整理数据中训练文本到图像模型

Zhiyang Liang, Ziyu Wan, Hongyu Liu, Dong Chen, Qiu Shen, Hao Zhu, Dongdong Chen

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) HKUST(香港科技大学)

AI总结 LACON通过利用未整理数据分布,将质量信号作为条件标签,提升生成质量,证明了未整理数据的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26741 2026-03-31 cs.CV cs.AI cs.RO

Language-Conditioned World Modeling for Visual Navigation

基于语言的视觉导航世界建模

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Clemson University(克莱姆森大学) Drexel University(德雷塞尔大学) Microsoft Research(微软研究院)

AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。

Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN

详情

展开后加载摘要…

URL PDF HTML 收藏