arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-04-30 至 2026-04-30 共收录 6
2604.26837 2026-04-30 cs.LG

Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving

统一稀疏注意力与分层记忆以实现可扩展的长上下文LLM服务

Zihan Zhao, Baotong Lu, Shengjie Lin, Yizou Chen, Jing Liu, Yanqi Zhang, Ziming Miao, Ming-Chang Yang, Haiying Shen, Qi Chen, Fan Yang

机构 * University of Virginia(弗吉尼亚大学) Microsoft Research(微软研究院) Georgia Institute of Technology(佐治亚理工学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出SPIN框架,通过统一分区抽象、局部性感知的KV缓存管理器和两级元数据布局,提升稀疏注意力与分层KV存储的协同效率,实现更高的吞吐量和更低的响应时间。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26334 2026-04-30 cs.DC cs.AR cs.LG

Efficient, VRAM-Constrained xLM Inference on Clients

高效、受限于VRAM的xLM客户端推断

Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

机构 * Microsoft Corporation(微软公司) NVIDIA Corporation(英伟达公司)

AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。

Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09547 2026-04-30 cs.CV cs.AI

GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning

GoViG:通过多模态推理实现目标条件视觉导航指令生成

Fengyi Wu, Yifei Dong, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。

Comments Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21190 2026-04-30 cs.CL cs.AI

Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation

Lunguage: 用于结构化和序列化胸部X光解读的基准测试

Jong Hak Moon, Geon Choi, Paloma Rabaey, Min Gwan Kim, Jung-Oh Lee, Hyuk Gi Hong, Eun Woo Doe, Hangyul Yoon, Jiyoun Kim, Harshita Sharma, Daniel C. Castro, Javier Alvarez-Valle, Edward Choi

机构 * KAIST(韩国科学技术院) Ghent University(根特大学) Seoul National University Hospital(首尔国立大学医院) Seoul Medical Center(首尔医院) Yeungnam University College of Medicine(延世大学医学院) Microsoft Research Health Futures(微软研究院健康未来)

AI总结 本文提出LUNGUAGE基准数据集,用于结构化放射学报告生成,支持单报告评估和多研究的纵向患者评估。通过两阶段结构化框架和LUNGUAGESCORE指标,实现对放射学报告的细粒度评估。

Comments CHIL (Conference on Health, Inference, and Learning) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13729 2026-04-30 cs.LG cs.AI cs.CV cs.GR

ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models

ComboStoc: 差分生成模型中的组合随机性

Rui Xu, Jiepeng Wang, Hao Pan, Yang Liu, Xin Tong, Shiqing Xin, Changhe Tu, Taku Komura, Wenping Wang

机构 * The University of Hong Kong Work partially done at MSRA. † Corresponding authors. China The University of Hong Kong China Tsinghua University China Microsoft Research Asia China Shandong University China Texas A\&M University USA The University of Hong Kong Tsinghua University Microsoft Research Asia Shandong University Texas A\&M University

AI总结 本文研究了差分生成模型中未被充分探索但重要的组合复杂性问题,提出 ComboStoc 方法通过构建随机过程充分利用组合结构,提升训练效率并实现测试时生成的灵活控制。

Comments ACM Transactions on Graphics, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏