arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-27 至 2026-08-27 共收录 5
2608.23831 2026-08-27 cs.RO cs.LG 版本更新

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调

Brian Zhu, Momen Khalil, E Harrison, Emanuele Poggi, Philipp Schmitt, Bernd Kast, Philine Meister, Pranav Atreya, Qiyang Li, Finn Ferchau, Cesar Colmenero, Yash Shahapurkar, Gokul Narayanan, Melih Erdogan, Kai Wurm, Georg von Wichert, Oier Mees, Eugen Solowjow, Andrew Wagenmaker, Sergey Levine

机构 * Siemens(西门子) UC Berkeley(加州大学伯克利分校) Microsoft(微软) ETH Zurich(苏黎世联邦理工学院)

AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。

Comments 25 pages, 12 figures, project website: this https URL (https://async-rl-intermediate-information.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-27 cs.CV cs.AI 版本更新

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-08-27 cs.AI 版本更新

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15987 2026-08-27 cs.LG cs.AI 版本更新

AlgoTrace: Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

语言模型中推理的算法原语与组合几何

Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

机构 * Microsoft Research NYC(微软研究院纽约分部) Center for Theoretical Neuroscience(理论神经科学中心) Department of Psychology(心理学系) University of California Los Angeles(加州大学洛杉矶分校) Institute for Pure and Applied Mathematics(纯粹与应用数学研究所) Emory University(埃默里大学) Rice University(里士满大学) Mount Holyoke College(马里兰霍克学院) Technische Universität Berlin(柏林技术大学) BIFOLD-Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

AI总结 研究通过分析语言模型中的算法原语,揭示其推理过程的组合几何结构,并展示原语在跨任务和跨模型中的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-08-27 cs.LG cs.AI 版本更新

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments ICLR 2026; 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏