Planning with Reasoning using Vision Language World Model
机构 * Meta FAIR
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
机构 * Meta FAIR
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
机构 * Stanford University(斯坦福大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
机构 * FZI Research Center for Information Technology, Germany(德国弗赖堡信息科技研究中心) ; Karlsruhe Institute of Technology, Germany(德国卡尔斯鲁厄理工学院)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments Daniel Bogdoll and Yitian Yang contributed equally. Accepted for publication at IV 2025
机构 * Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments 7 pages, 6 figures
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎跑实验室) ; Zhejiang University(浙江大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments Code: https://github.com/alibaba-damo-academy/WorldVLA
机构 * ByteDance Research(字节跳动研究团队) ; Tsinghua University(清华大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments ICML 2025
机构 * Tera AI ; UC Santa Cruz(加州大学圣克ruz分校) ; UC Berkeley(加州大学伯克利分校) ; California Institute of Technology(加州理工学院)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments Computer Vision, Pattern Recognition, Early-Fusion, Dataset, Data Augmentation
机构 * University of Maryland(马里兰大学) ; Department of Computer Science(计算机科学系)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world-model(abstract);world-model(abstract)
Comments Paper accepted to ICML 2025
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Johns Hopkins University(约翰霍普金斯大学) ; The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) ; University of California, San Francisco(加州大学旧金山分校)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments Technical report. Project page https://aka.ms/mineworld
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments 5 pages including references, 2 figures
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments 6 pages, 5 figures
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
Comments 9 pages
世界模型记忆,智能体遗忘:基于持续模型的强化学习中的梦境排练
机构 * Quantegra Research(Quantegra研究公司)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);model-based RL(title);分类 cs.AI、cs.LG
AI总结 研究 DreamerV3 家族智能体在任务序列训练时的遗忘问题,通过组件级探测发现是通道问题,提出分级梦境排练方法,能产生无任务标签、参数恒定的持续学习者,在多任务链保留上表现优异。
Comments 11 pages, 2 figures. Code, pre-registration trail, and run data: https://github.com/gurpnijjer/dream-rehearsal
未来动态3D重建:一种具有解耦自运动的3D世界模型
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。
Comments ICML 2026. Project page: this https URL (https://fr3d-wm.github.io)
面向协同混合交通控制的、融入物理信息世界模型的离线多智能体强化学习
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world-model(abstract);world-model(abstract)
AI总结 本研究针对混合交通中部分可观测高速瓶颈的网联自动驾驶车辆协同控制问题,提出融入物理信息世界模型的离线多智能体强化学习框架,经SUMO实验验证可提升状态重构与预测准确性。
OmniVTA: 用于接触密集机械操作的视觉-触觉世界建模
机构 * TARS Robotics(TARS机器人实验室) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; CASIA(中国科学院自动化研究所) ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院) ; Beihang University(北京航空航天大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world-model(abstract);world-model(abstract)
AI总结 本文提出OmniVTA框架,结合预测接触建模与高频触觉反馈,通过大规模视觉-触觉-动作数据集提升接触密集操作的性能与泛化能力。
Comments Project Page: https://mrsecant.github.io/OmniVTA
VERDI:检索并非持续世界模型优化的迁移
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 本文针对基础世界模型优化中策略难迁移的问题,提出VERDI框架,通过构建优化指纹、检索假设并经目标侧验证来实现持续优化,可降低搜索与GPU成本,减少负迁移并提升迁移结果预测准确率。
Comments 28pages, 13figures,conference
UniJEPA:面向任务无关视觉世界建模的统一联合嵌入预测架构
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 UniJEPA是统一JEPAs,共享潜在空间联合学习图像级与视频级预测,抗坍塌,经后训练可零样本规划,在多基准上性能相当或更优,规划速度更快。
Comments 10 pages, 7 figures; Accepted by ICML2026
GeniWorld:一种用于机器人操作的可泛化交互式世界模型
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent Robotics X(腾讯Robotics X实验室) ; The Hong Kong University of Science and Technology(香港科技大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 针对通用机器人策略在复杂环境中鲁棒性不足的问题,提出GeniWorld交互式世界模型,通过解耦本体与环境动态、构建自回归视频预测模型实现泛化,可用于策略评估并提升下游操作性能。
MoWorld:一种快速世界模型
机构 * Moxin Technology(魔心科技)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。
Comments Project Page: https://moxin-tech.github.io/moworld/
PhiZero:基于物理语言构建的世界模型
机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所NLPR)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 该研究提出围绕物理语言构建的PhiZero世界模型,采用先推理再渲染的范式,经实验验证其可建模物理连贯的世界演化,还具备交互式世界建模等应用潜力。
Comments Project page: https://phi-zero.github.io/
PAVXploreRL:具有动作探索的物理动作视觉世界模型强化学习
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Sun Yat-sen University(中山大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 研究针对动作条件世界模型泛化性差的问题,提出PAVXploreRL强化学习框架,基于预训练潜在世界模型,通过奖励驱动训练优化PAV目标,联合利用ID轨迹与OOD动作探索提升泛化能力,实验证明该方法性能更优。
Comments 9 pages, 5 figures
SAGE:用于潜在世界模型规划的子目标条件动作生成
机构 * Peking University(北京大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 研究潜在世界模型规划中提议质量受限问题,提出先验条件规划器,利用目标条件生成器预测潜在子目标,结合不同时长子目标作先验,实验证明该方法显著提升长期规划性能。
基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估
机构 * School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) ; Guangzhou Polytechnic Normal University(广州技术师范大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 研究大型语言模型隐式编码世界模型的风险,提出数据优先本体并构建DaoQL多模态数据库。通过形式化显式世界模型,对比隐式模型优势。实验展示系统性能,如在反事实实验中DaoQL+GPT-4o可组合反事实可分解性大幅提升。
Comments 20 pages, 2 figures. Code: https://github.com/zhanbolee/DaoQL-Edu
异构物流系统中世界模型感知责任分配
专题命中 通用世界模型 :world-model(title,abstract);world-model(title,abstract);world model(abstract);world model(abstract)
AI总结 研究异构物流系统中自主与非自主设备混合时的责任分配问题,提出世界模型感知责任框架WMARF,依模型质量和自动化水平动态分权限并分类死锁,通过模拟验证其有效性及随自主性提高仍有效的特性。
在紧凑世界模型中建立空间关系:指令泄漏与无目标动力学修复
机构 * Stony Brook University(纽约州立大学石溪分校) ; Westlake University(西湖大学)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 研究以语言目标为条件的紧凑世界模型中空间关系建立问题,发现指令泄漏陷阱,提出将目标排除在动力学外并监督读取路径的修复方法,适用于相关世界模型,提升关系基础的准确性。
并非所有动作都同等重要:重新思考灵巧世界模型的条件化
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shenzhen University(深圳大学) ; Beijing University of Technology(北京工业大学) ; JD Explore Academy(京东探索研究院)
专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)
AI总结 针对高自由度灵巧动作中不同分量重要性不均导致优化失衡的问题,提出DexAC-WM,通过动作标记化保留维度级语义,结合局部细化与全局调制对齐动作与视觉动态,并引入语义分支提供物体场景先验,显著提升视频预测的真实感和动作一致性。