arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-04-17 至 2026-04-17 共收录 16
2604.15309 2026-04-17 cs.CV cs.AI cs.CL

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14941 2026-04-17 cs.CL

Text2Arch: A Dataset for Generating Scientific Architecture Diagrams from Natural Language Descriptions

Text2Arch:一个用于从自然语言描述生成科学架构图的数据库

Shivank Garg, Sankalp Mittal, Manish Gupta

机构 * IIT Roorkee, India(印度拉尔·克里希纳理工学院) Google, India(印度谷歌) Microsoft, India(印度微软)

AI总结 本文提出Text2Arch数据库,通过语言模型生成高保真的架构图,解决了文本生成架构图的效率和歧义问题,并展示了其在多个应用中的优势。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14053 2026-04-17 cs.LG cs.AI cs.CV cs.MA eess.IV

LLMOrbit: A Circular Taxonomy of Large Language Models -From Scaling Walls to Agentic AI Systems

LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04884 2026-04-17 cs.RO

Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation

嗨!- 一个用于力导向、跨视角人工 manipulation 的多模态数据集

Tim Engelbracht, René Zurbrügg, Matteo Wohlrapp, Martin Büchner, Abhinav Valada, Marc Pollefeys, Hermann Blum, Zuria Bauer

机构 * ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学) University of Freiburg(弗赖堡大学) Microsoft(微软) University of Bonn(波恩大学)

AI总结 本文提出一个结合视觉、动作和触觉的多模态数据集,包含381个人工物体在38种环境中的3048个序列,用于评估方法在人机视角间的迁移能力及探索交互力等未被研究的模态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14810 2026-04-17 stat.ML cs.LG stat.CO

Scalable Model-Based Clustering with Sequential Monte Carlo

基于序列蒙特卡洛方法的可扩展模型聚类

Connie Trojan, Pavel Myshkov, Paul Fearnhead, James Hensman, Tom Minka, Christopher Nemeth

机构 * Lancaster University(兰卡斯特大学) Microsoft Research(微软研究院)

AI总结 本文提出一种基于序列蒙特卡洛的聚类算法,通过分解问题提升效率,适用于大规模和复杂分布数据的聚类任务。

Comments Accepted at AISTATS 2026. 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14725 2026-04-17 cs.DB cs.LG

RELOAD: A Robust and Efficient Learned Query Optimizer for Database Systems

RELOAD:一种鲁棒且高效的数据库系统学习查询优化器

Seokwon Lee, Jaeyoung Sim, Sihyun Kim, Yuhsing Li, Yiwen Zhu, Kwanghyun Park

机构 * Yonsei University BDAI Lab(延世大学BDAI实验室) Microsoft Gray Systems Lab(微软Gray系统实验室)

AI总结 RELOAD通过提升查询优化的鲁棒性和效率,克服了传统查询优化器的不足,实验表明其在鲁棒性和效率上均优于现有基于强化学习的优化方法。

Comments This work is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14724 2026-04-17 cs.CV cs.LG eess.IV

HAMSA: Scanning-Free Vision State Space Models via SpectralPulseNet

HAMSA: 一种通过SpectralPulseNet实现无扫描的视觉状态空间模型

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

AI总结 HAMSA通过引入简化核参数化、SpectralPulseNet和SAGU,实现了无扫描的视觉状态空间模型,提升了效率和精度,达到85.7%的Top-1准确率,比Transformer快2.2倍,内存和能耗更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14541 2026-04-17 cs.CV

Giving Faces Their Feelings Back: Explicit Emotion Control for Feedforward Single-Image 3D Head Avatars

赋予面孔情感:面向单图像3D头像的显式情绪控制

Yicheng Gong, Jiawei Zhang, Liqiang Liu, Yanwen Wang, Lei Chu, Jiahao Li, Hao Pan, Hao Zhu, Yan Lu

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 本文提出一种显式情绪控制框架,通过双路径调节机制在不修改核心设计的情况下,将情绪作为独立控制信号注入单图像3D头像重建中,实现情绪与身份的解耦和可控情绪转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14473 2026-04-17 cs.AI

Response-Aware User Memory Selection for LLM Personalization

面向响应的用户记忆选择用于LLM个性化

Jillian Fisher, Jennifer Neville, Chan Young Park

机构 * Department of Computer Science and Engineering, University of Washington, Seattle, WA, United States of America(华盛顿大学计算机科学与工程系) Microsoft Research, Redmond, WA, United States of America(微软研究院)

AI总结 本文提出RUMS方法,通过测量记忆与模型输出的互信息选择用户记忆,提升响应质量并降低计算成本。

Comments Code at: https://github.com/jfisher52/Response_Utility_Optimized_Memory_Selection

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14465 2026-04-17 cs.AI

Improving Human Performance with Value-Aware Interventions: A Case Study in Chess

通过价值感知干预提升人类表现:国际象棋中的案例研究

Saumik Narayanan, Raja Panjwani, Siddhartha Sen, Chien-Ju Ho

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Microsoft Research(微软研究院) Georgetown University(杰斐逊大学)

AI总结 本文提出价值感知干预方法,通过识别策略与价值函数不一致的机会,提升人类在国际象棋中的表现,实验显示其在不同技能水平玩家中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14339 2026-04-17 cs.CL

Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation

重组上下文:RoPE扰动的自我蒸馏用于长上下文适应

Zichong Li, Chen Liang, Liliang Ren, Tuo Zhao, Yelong Shen, Weizhu Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

AI总结 本文提出RoPE扰动的自我蒸馏方法,通过扰动RoPE索引生成不同视角的训练序列,提升模型对位置变化的鲁棒性,实验显示在长上下文任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06296 2026-04-17 cs.LG cs.AI cs.MA cs.SE

AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent

AgentOpt v0.1 技术报告:基于LLM的代理的客户端优化

Wenyue Hua, Sripad Karne, Qian Xie, Armaan Agrawal, Nikos Pagonas, Kostis Kaffes, Tianyi Peng

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿) Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

AI总结 本文提出AgentOpt框架,用于解决LLM代理客户端资源分配问题,通过多种搜索算法优化模型选择和资源分配,提升效率与效果。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24470 2026-04-17 cs.CV cs.AI cs.CL cs.SI

Counting Without Numbers and Finding Without Words

不使用数字进行计数和不使用词语进行寻找

Badri Narayana Patro

机构 * Microsoft(微软)

AI总结 本文提出首个多模态重聚系统,整合视觉和声学生物特征,通过处理不同频率的动物声音和容忍压力导致的外观变化,实现基于生物通信原理的AI应用,帮助无语言能力的弱势群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14664 2026-04-17 cs.SD eess.AS

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

SpeechLLM-as-Judges: 向通用和可解释的语音质量评估迈进

Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出SpeechLLM-as-Judges框架,利用大语言模型进行结构化语音质量评估,构建了包含多语言语音片段的SpeechEval数据集,并开发了SQ-LLM模型,在多种任务和语言上表现出色。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03851 2026-04-17 cs.AI

MetaMuse: Algorithm Generation via Creative Ideation

MetaMuse:通过创造性构思生成算法

Ruiying Ma, Chieh-Jan Mike Liang, Yanjie Gao, Francis Y. Yan

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文研究LLM在算法生成中的应用,提出MetaMuse框架,通过三个自反思原则提升创造性构思,实验显示其在缓存替换和在线装箱问题中性能提升显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16761 2026-04-17 cs.CL

Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions

基于扩展调查数据的语言模型微调以预测公众意见分布

Joseph Suh, Erfan Jahanparast, Suhong Moon, Minwoo Kang, Serina Chang

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

AI总结 本文通过微调大型语言模型,利用调查数据的结构特性提升对公众意见分布的预测能力,实验显示在多种子群体中模型预测与人类响应的匹配度显著提高,且能泛化到未见过的调查和子群体。

Comments ACL 2025 Long Main (https://aclanthology.org/2025.acl-long.1028/)

详情

展开后加载摘要…

URL PDF HTML 收藏