Motubrain: An Advanced World Action Model for Robot Control
MotuBrain: 一种先进的世界动作模型用于机器人控制
机构 * MotuBrain Team(MotuBrain团队)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
MotuBrain: 一种先进的世界动作模型用于机器人控制
机构 * MotuBrain Team(MotuBrain团队)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。
RynnWorld-Teleop:用于数字遥操作的动作条件世界模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; CUHK(香港中文大学) ; Hupan Lab(湖畔实验室) ; Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 研究针对机器人学习数据收集瓶颈,提出数字遥操作范式,用生成世界模型解耦数据收集与物理约束。以RynnWorld-Teleop系统实现,含多种技术,能实时生成,训练策略可零样本转移,还能增强数据集,是高保真可扩展数据引擎。
Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-Teleop
InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动
机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。
Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/
Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型
机构 * Tsinghua University(清华大学) ; Manifold AI
专题命中 动作与事件理解 :video generation(abstract)
AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。
Comments 36 pages
基于合成先验的世界-动作模型的高效仿真到现实迁移
机构 * Purdue University(普渡大学) ; Robotics and AI Institute(机器人与人工智能研究所)
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。
Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon
从动作到世界建模的可迁移动力学先验学习
机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) ; McGill University, Montreal, QC, Canada(麦吉尔大学,蒙特利尔,魁北克,加拿大)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 提出A2World模型,通过大规模机器人操作数据预训练动作条件世界模型,学习可迁移的交互动力学先验,支持模拟器评估和策略学习。
Comments ECCV 2026 Accepted
LaWAM: 用于高效动力学感知机器人策略的潜在世界行动模型
机构 * Tsinghua University(清华大学) ; Jilin University(吉林大学) ; Nankai University(南开大学) ; Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Zhongguancun Academy(中关村学院) ; Striding.AI ; Infinigence AI
专题命中 动作与事件理解 :video generation(abstract)
AI总结 提出LaWAM模型,通过潜在视觉子目标预测场景变化,实现动力学感知的机器人控制,在多个基准上达到最优或竞争性成功率,且推理延迟低。
FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐
机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) ; Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)
专题命中 动作与事件理解 :video understanding(abstract)
AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。
Comments 26 pages, 7 figures, 25 tables
CLAW: 通过对抗潜在正则化学习连续潜在动作世界模型
机构 * University of Chicago(芝加哥大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 提出CLAW框架,利用对抗潜在正则化和扩散视频生成,从无动作视频中端到端学习世界模型与连续潜在动作表示,支持观察模仿学习和目标导向规划。
Comments 8 pages, 15 pages of supplementary material
$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; AGIBOT Finch
专题命中 动作与事件理解 :video diffusion(abstract)
AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。
Comments Our project homepge: https://finch.agibot.com/research/tau0-wm
LaWM:基于视觉观测的最短作用世界模型用于长时间物理一致性
机构 * University of Michigan(密歇根大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 LaWM通过在视觉潜在空间中实现最小作用原理,提升长horizon视觉预测的物理一致性,改进了物理不变性、背景一致性、运动平滑度和外观几何预测指标。
DriVerse:通过多模态轨迹提示和运动对齐实现驾驶模拟的导航世界模型
机构 * Baidu Inc.(百度公司)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 DriVerse通过多模态轨迹提示和运动对齐技术,实现从单张图像和未来轨迹生成导航驱动的驾驶场景,提升了动态对象的生成精度和时间一致性。
Comments 13 pages, 5 figures
AIM: 基于意图的统一世界动作建模与空间价值图
机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。
Veo-Act:前沿视频模型在通用机器人操作中能走多远?
机构 * Tsinghua University(清华大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文探讨前沿视频模型如Veo-3在通用机器人操作中的应用,提出Veo-Act框架结合高阶运动规划与低阶执行器,提升指令跟随性能。
Comments 16 pages, 12 figures. Equal contribution by Zhongru Zhang, Chenghan Yang, Qingzhou Lu and Yanjiang Guo. Project lead: Yanjiang Guo
共演潜在动作世界模型
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文提出CoLA-World,通过关键预热阶段实现联合学习,解决世界模型与动作模型的协同问题,提升视频模拟质量和下游视觉规划性能。
EgoDemoGen:用于机器人操作中视角泛化的眼动演示生成
机构 * UCAS(中国科学院大学) ; CASIA(中国科学院自动化研究所) ; GigaAI ; Tsinghua University(清华大学) ; X-Humanoid ; FiveAges
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文提出EgoDemoGen框架,通过EgoTrajTransfer和EgoViewTransfer生成新型眼动视角下的观察-动作演示,提升机器人操作在视角变化下的成功率。
H-WM:由分层世界模型引导的机器人任务和运动规划
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McGill University(麦吉尔大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。
Comments 8 pages, 4 figures
VLAW: 视觉-语言-动作策略与世界模型的迭代共改进
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 本文提出通过迭代改进视觉-语言-动作策略与世界模型,提升真实机器人任务的性能和可靠性。
Comments Project Page: https://sites.google.com/view/vlaw-arxiv
专题命中 动作与事件理解 :long video(abstract)
机构 * Columbia University(哥伦比亚大学) ; Toyota Research Institute(丰田研究院)
专题命中 动作与事件理解 :video generation(abstract)
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 动作与事件理解 :video understanding(abstract)
机构 * State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) ; School of Computer Science, Peking University(北京大学计算机学院) ; Hong Kong University of Science and Technology(香港科技大学) ; Autonomous Driving Development, NIO(蔚来自动驾驶研发)
专题命中 动作与事件理解 :video generation(abstract)
Comments 9 pages, 3 figures
专题命中 动作与事件理解 :video generation(abstract)
专题命中 动作与事件理解 :long video(abstract)
Comments 26 pages; 8 figures; 2 tables; Rutgers University Technical Report #2020-07-001
专题命中 动作与事件理解 :long video(abstract)
放松强制:用于一致长视频生成的放松KV内存
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Imperial College London(伦敦帝国学院)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出Relax Forcing机制,通过结构化时间内存提升长视频生成的运动动态和时间一致性,减少注意力开销。
Comments Project page: see https://zengqunzhao.github.io/Relax-Forcing
径向注意力:具有能量衰减的 $O(n\log n)$ 稀疏注意力用于长视频生成
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达) ; Princeton(普林斯顿大学) ; UC Berkeley(加州大学伯克利分校) ; Stanford(斯坦福大学) ; First Intelligence(第一智能)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出径向注意力,通过能量衰减机制实现高效的长视频生成,显著提升生成速度并降低计算成本。
Comments Accepted to NeurIPS 2025, Code: https://github.com/mit-han-lab/radial-attention
机构 * NVIDIA(英伟达) ; Rutgers University(罗格斯大学) ; UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; Nanjing University(南京大学) ; KAIST(韩国科学技术院)
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV
专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)
专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://vicky0522.github.io/tokensgen-webpage/