arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-05 至 2026-08-05 共收录 9
2608.02990 2026-08-05 cs.RO 新提交

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02919 2026-08-05 cs.CL 新提交

FLARE: Few-shot Learning-based Adaptive Reflective Engine

FLARE:基于小样本学习的自适应反思引擎

Dhanasekar Sundararaman, Bharat Gandhi, Aashna Garg, Minjie Li

机构 * Microsoft(微软)

AI总结 本研究提出FLARE框架,利用小样本学习与反思机制优化指令,在多基准任务中优于GEPA,数据效率更高且稳定性更强,凸显小样本学习策略优化对提升LLM性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02876 2026-08-05 cs.AI 新提交

BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

BAP-SQL:面向智能体Text-to-SQL的预算感知观测规划

Chong Peng, Pin Qian, Su Wang, Yihang Chen, Varun Sah

机构 * Microsoft(微软公司) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 BAP-SQL是面向智能体Text-to-SQL的预算感知观测规划方法,通过将观测形成作为预算控制阶段,在紧预算下提升了SQL生成成功率,同时减少了token使用量。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02831 2026-08-05 cs.SD cs.CL 新提交

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

以演化 rubric 作为奖励的强化学习用于音频推理

Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S. Yu, Ge Liu, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出 AudioRubrics 强化学习框架,以自演化的音频基 rubric 奖励监督音频推理,在三个基准上大幅优于基线,收敛至稳定推理长度,提升音频感知效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02620 2026-08-05 cs.CL 新提交

JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation

JudgeArena:用于可复现LLM-评判者评估的统一框架

Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas

机构 * University of Freiburg(弗莱堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Microsoft AI(微软人工智能部门) Cohere Labs(Cohere实验室) Prior Labs(Prior实验室)

AI总结 JudgeArena是统一主流LLM评判者基准的开源框架,支持可替换评判者,配备调优开源评判者配置,可高精度模拟LMArena Elo分数,减少对闭源模型的依赖,提升评估的透明度与可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00155 2026-08-05 cs.AI cs.LG 交叉投稿

AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

AgentStream:自进化大语言模型智能体在流式任务下的表现如何?

Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Microsoft(微软公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

AI总结 本文提出AgentStream框架,评估三种流式场景下三种基础模型的五种自进化LLM智能体方法,发现自进化表现受场景、模型能力等影响,为方法选择提供指导。

Comments Code is available at https://github.com/Jasper-Yan/AgentStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11844 2026-08-05 cs.CV 版本更新

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

超越单摄像头:体育视频理解中的智能多视角推理

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15673 2026-08-05 cs.AI cs.LG 版本更新

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

哪里出错了?基于语义状态追踪的Web智能体过程级评估

Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏