arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-26 至 2026-03-26 共收录 3 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 3 篇

2510.02315 2026-03-26 cs.CV 84%

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

FOCUS:多实体世界建模中的最优控制

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 通用世界模型 :world model(title);world model(title);分类 cs.CV

AI总结 本文提出FOCUS框架,通过将流匹配转化为随机最优控制,解决文本生成图像中多实体场景的属性泄露和身份纠缠问题,提出两种算法提升多实体对齐性能。

Comments Project Page: https://ericbill21.github.io/FOCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 83%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24541 2026-03-26 cs.CV cs.AI 82%

SEGAR: Selective Enhancement for Generative Augmented Reality

SEGAR:生成增强现实的定向增强

Fanjun Bu, Chenyang Yuan, Hiroshi Yasuda

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Toyota Research Institute(电装研究院)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 SEGAR结合扩散世界模型与定向修正阶段,实现生成增强现实中的区域特定编辑与安全区域对齐,为未来帧的生成、缓存和定向修正提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏