Reparameterized Policy Learning for Multimodal Trajectory Optimization
专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based RL(abstract);分类 cs.LG
视觉与机器人
面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。
专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based RL(abstract);分类 cs.LG
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)
Comments Accepted by ICLR 2023. Project page: https://slotformer.github.io/
专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based RL(abstract);分类 cs.LG
Comments Appears in Proceedings of AAAI FSS-22 Symposium "Lessons Learned for Autonomous Assessment of Machine Abilities (LLAAMA)"
专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.LG
Comments 9 pages, 4 figures, to be published in Proceedings of the AAAI Conference on Artificial Intelligence 2021
专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.LG
专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.LG
Comments Accepted for publication in the proceedings of the 2019 Symposium of the Norwegian AI Society
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG
Comments This is an author's version. Paper has been accepted to 19th International Symposium on Neural Networks and was presented in August 2025 in China
专题命中 通用世界模型 :environment model(title);model-based reinforcement learning(abstract);分类 cs.LG
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG
Comments 20pages,5 figures
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO
Comments 16 pages, 9 figures; This article has been accepted for publication in a future issue of IEEE/CAA Journal of Automatica Sinica, but has not been fully edited. Content may change prior to final publication
Journal ref IEEE/CAA Journal of Automatica Sinica, 2025
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO
Comments accepted by IROS2022
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO
Comments the article has been accepted for publication during the 16th IEEE International Conference on Intelligent Computer Communication and Processing (ICCP 2020), 8 pages, 8 figures, 1 table
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.MA
Comments Accepted to be published in 2020 IEEE Intelligent Vehicles Symposium (IV), Las Vegas, NV, USA, October 20-23, 2020
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO
Journal ref Modelling and Simulation for Autonomous Systems. MESAS 2017
专题命中 通用世界模型 :environment model(title,abstract);分类 cs.CV
Comments 21 pages, 8 figures, accepted in: PLoS ONE (2010)
超越视觉思维链:用于主动视频推理的内化视觉思维
机构 * Apple(苹果公司)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV
AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。
ODEWorld:一种基于物理时间流的连续预测架构
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO
AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。
LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO;predictive model(abstract)
AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。
基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。
Comments 11 pages, 17 figures
VANDERER: 基于未来感知与视觉好奇心引导扩散策略的无地图探索
机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学坦登工程学院电气与计算机工程系控制/机器人研究实验室(CRRL)) ; New York University Abu Dhabi (NYUAD) Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心(CAIR))
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO
AI总结 提出VANDERER框架,利用视觉好奇心模块引导预训练扩散策略,仅依赖单目图像实现高效无地图探索,在多种模拟环境中平均探索面积比NoMaD多13.4%。
多模态模型是否想象出电羊?
机构 * Apple(苹果公司)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV
AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。
AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架
机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.MA
AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。
Comments Accepted at IntelliSys 2026
UI-Oceanus:通过合成环境动态扩展GUI代理
机构 * Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学);北京大学计算机学院) ; School of Computer Science, Peking University(北京通明湖信息技术应用创新中心) ; Beijing Tongming Lake Information Technology Application Innovation Center(腾讯微信) ; WeChat, Tencent Inc.(西蒙菲莎大学) ; Simon Fraser University(德克萨斯大学达拉斯分校) ; University of Texas at Dallas(复旦大学系统与先进计算研究所) ; Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) ; Shanghai Institute of Systems for Open Computing
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG;predictive model(abstract)
AI总结 本文提出UI-Oceanus框架,通过地面真实环境反馈掌握交互物理,解决GUI代理扩展中的数据瓶颈问题,实验表明其在离线和在线导航中均优于基线方法。
基于像素的物体中心原型符号行为推理
机构 * Donders Institute, Radboud University(多纳尔斯研究所,拉布德大学) ; Cajal Neuroscience Center, Spanish National Research Council(卡哈尔神经科学中心,西班牙国家研究理事会)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV
AI总结 本文提出了一种基于像素的物体中心深度学习架构,通过物体表示实现从感知到抽象推理的行为推理,展示了在合成环境中通过逻辑推理和连续控制任务的能力。
Comments Accepted for publication in Neural Networks journal
零溅远程协助:一种用于语义远程操作的零样本姿态估计框架
机构 * Khoury College of Computer Sciences at Northeastern University(东北大学Khoury计算机科学学院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO
AI总结 Zero-Splat TeleAssist通过整合视觉-语言分割、单目深度、加权PCA姿态提取和3DGS,实现无需标记或深度传感器的多机器人远程操作中的零样本姿态估计。
Comments Published and Presented at 3rd Workshop on Human-Centric Multilateral Teleoperation in ICRA 2025
机构 * Neuroscience Institute, Carnegie Mellon University(卡内基梅隆大学神经科学研究所) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) ; IBM Thomas J. Watson Research Center, IBM Research(IBM沃森研究中心)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO
Comments 17 pages, 7 figures
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.MA
Comments 10 pages, 1 figure
机构 * Walid Abdela(独立研究者)
专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO、cs.MA