arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-04-10 至 2026-04-10 共收录 11
2604.08540 2026-04-10 cs.CV cs.AI cs.CL

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08476 2026-04-10 cs.CV cs.AI

Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理

Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha, Vineeth N Balasubramanian, Tanuja Ganu

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08238 2026-04-10 cs.CV

$\oslash$ Source Models Leak What They Shouldn't $\nrightarrow$: Unlearning Zero-Shot Transfer in Domain Adaptation Through Adversarial Optimization

$\oslash$ 源模型泄露不应泄露的信息:通过对抗优化在领域适应中消除零样本转移

Arnav Devalapally, Poornima Jain, Kartik Srinivas, Vineeth N. Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

AI总结 本文研究了领域适应中源模型泄露敏感信息的问题,提出SCADA-UL方法通过对抗优化和重新标定策略实现有效消除,实验表明其在基准数据集上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08062 2026-04-10 cs.HC cs.AI

From Gaze to Guidance: Interpreting and Adapting to Users' Cognitive Needs with Multimodal Gaze-Aware AI Assistants

从注视到引导:通过多模态注视感知AI助手解读和适应用户认知需求

Valdemar Danry, Javier Hernandez, Andrew Wilson, Pattie Maes, Judith Amores

机构 * Microsoft Research(微软研究院) MIT Media Lab(麻省理工学院媒体实验室)

AI总结 本文提出一种基于注视的多模态LLM助手,通过眼动追踪提升用户阅读行为评估的准确性与个性化,实验表明其能有效提升信息回忆能力并提高交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07652 2026-04-10 cs.AI cs.HC

Bridging Natural Language and Interactive What-If Interfaces via LLM-Generated Declarative Specification

通过LLM生成的声明性规范桥接自然语言与交互式假设分析接口

Sneha Gathani, Sirui Zeng, Diya Patel, Ryan Rossi, Dan Marshall, Cagatay Demiralp, Steven Drucker, Zhicheng Liu

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院) Microsoft Research(微软研究院) AWS AI Labs(AWS人工智能实验室) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出一种两阶段工作流,通过Praxa规范语言将自然语言假设分析问题转化为交互式可视化界面,提升假设分析工具的交互性和准确性。

Comments 17 pages 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03092 2026-04-10 cs.AI cs.AR cs.DC

SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators

SnapStream: 在数据流加速器上高效处理长序列解码

Jonathan Li, Nasim Farahini, Evgenii Iuliugin, Magnus Vesterlund, Christian Häggström, Guangtao Wang, Shubhangi Upasani, Ayush Sachdeva, Rui Li, Faline Fu, Chen Wu, Ayesha Siddiqua, John Long, Tuowen Zhao, Matheen Musaddiq, Håkan Zeffer, Yun Du, Mingran Wang, Qinghua Li, Bo Li, Urmish Thakker, Raghu Prabhakar

机构 * SambaNova Systems, Inc.(SambaNova系统公司) Microsoft AI(微软人工智能) Meta Platforms, Inc.(Meta平台公司)

AI总结 本文探讨了在数据流加速器上实现长序列解码的效率与准确性,提出SnapStream方法,通过压缩KV缓存提升芯片内存利用率,减少精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06670 2026-04-10 cs.CL

PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch

PIKA:从零开始的专家级合成数据集用于训练后对齐

Shangjian Yin, Shining Liang, Wenbiao Ding, Yuli Qian, Zhouxing Shi, Hongzhi Li, Yutao Xie

机构 * University of California, Riverside(加州大学河滨分校) Microsoft AI(微软人工智能)

AI总结 PIKA通过高效的数据集提升对齐效果,仅用3万例超越大规模数据集,在AlpacaEval 2.0等基准测试中表现优异,且提供高质量偏好优化数据,降低数据需求,促进资源受限研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13993 2026-04-10 cs.CL cs.AI

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization

片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样

Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Microsoft Research Asia, China(微软亚洲研究院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)

AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15922 2026-04-10 cs.LG cs.SD eess.AS

RiTTA: Modeling Event Relations in Text-to-Audio Generation

RiTTA:文本到音频生成中的事件关系建模

Yuhang He, Yash Jain, Xubo Liu, Andrew Markham, Vibhav Vineet

机构 * Microsoft Research(微软研究院) Microsoft(微软) CVSSP, University of Surrey, UK(英国萨里大学视觉语音与信号处理中心) CS Department, University of Oxford, UK(英国牛津大学计算机科学系)

AI总结 本文系统研究文本到音频生成中事件关系建模,构建了包含所有潜在关系的语料库,并提出新评估指标和微调框架以提升模型对音频事件关系的建模能力。

Comments EMNLP25, Project Site: https://yuhanghe01.github.io/RiTTA-Proj/. Code: https://github.com/yuhanghe01/RiTTA

详情

展开后加载摘要…

URL PDF HTML 收藏