arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 6450 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4308 篇

2307.10710 2023-07-21 cs.LG 75%

Reparameterized Policy Learning for Multimodal Trajectory Optimization

Zhiao Huang, Litian Liang, Zhan Ling, Xuanlin Li, Chuang Gan, Hao Su

专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based RL(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05861 2023-01-24 cs.CV cs.AI cs.LG 75%

SlotFormer: Unsupervised Visual Dynamics Simulation with Object-Centric Models

Ziyi Wu, Nikita Dvornik, Klaus Greff, Thomas Kipf, Animesh Garg

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV;dynamics model(abstract)

Comments Accepted by ICLR 2023. Project page: https://slotformer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16315 2022-11-30 cs.LG 75%

Learning and Understanding a Disentangled Feature Representation for Hidden Parameters in Reinforcement Learning

Christopher Reale, Rebecca Russell

专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based RL(abstract);分类 cs.LG

Comments Appears in Proceedings of AAAI FSS-22 Symposium "Lessons Learned for Autonomous Assessment of Machine Abilities (LLAAMA)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.02981 2021-04-13 cs.IR cs.LG 75%

Reinforcement Learning with a Disentangled Universal Value Function for Item Recommendation

Kai Wang, Zhene Zou, Qilin Deng, Runze Wu, Jianrong Tao, Changjie Fan, Liang Chen, Peng Cui

专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.LG

Comments 9 pages, 4 figures, to be published in Proceedings of the AAAI Conference on Artificial Intelligence 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02693 2020-02-10 cs.LG stat.ML 75%

Ready Policy One: World Building Through Active Learning

Philip Ball, Jack Parker-Holder, Aldo Pacchiano, Krzysztof Choromanski, Stephen Roberts

专题命中 通用世界模型 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02435 2019-05-16 cs.LG cs.AI cs.NE 75%

Self-Adapting Goals Allow Transfer of Predictive Models to New Tasks

Kai Olav Ellefsen, Jim Torresen

专题命中 通用世界模型 :predictive model(title,abstract);predictive models(title,abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in the proceedings of the 2019 Symposium of the Norwegian AI Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20535 2025-08-26 cs.LG 74%

DeeP-Mod: Deep Dynamic Programming based Environment Modelling using Feature Extraction

Chris Child, Lam Ngo

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG

Comments This is an author's version. Paper has been accepted to 19th International Symposium on Neural Networks and was presented in August 2025 in China

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22772 2025-06-10 cs.LG 74%

Calibrated Value-Aware Model Learning with Probabilistic Environment Models

Claas Voelcker, Anastasiia Pedan, Arash Ahmadian, Romina Abachi, Igor Gilitschenski, Amir-massoud Farahmand

专题命中 通用世界模型 :environment model(title);model-based reinforcement learning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18906 2025-02-27 cs.LG 74%

VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model

Jiani Zheng, Lu Wang, Fangkai Yang, Chaoyun Zhang, Lingrui Mei, Wenjie Yin, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG

Comments 20pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05931 2025-01-13 cs.RO 74%

Environment Modeling for Service Robots From a Task Execution Perspective

Ying Zhang, Guohui Tian, Cui-Hua Zhang, Changchun Hua, Weili Ding, Choon Ki Ahn

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO

Comments 16 pages, 9 figures; This article has been accepted for publication in a future issue of IEEE/CAA Journal of Automatica Sinica, but has not been fully edited. Content may change prior to final publication

Journal ref IEEE/CAA Journal of Automatica Sinica, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04890 2023-10-10 cs.LG 74%

Adversarial Counterfactual Environment Model Learning

Xiong-Hui Chen, Yang Yu, Zheng-Mao Zhu, Zhihua Yu, Zhenjun Chen, Chenghe Wang, Yinan Wu, Hongqiu Wu, Rong-Jun Qin, Ruijin Ding, Fangsheng Huang

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07709 2022-10-28 cs.RO 74%

Adaptive Environment Modeling Based Reinforcement Learning for Collision Avoidance in Complex Scenes

Shuaijun Wang, Rui Gao, Ruihua Han, Shengduo Chen, Chengyang Li, Qi Hao

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO

Comments accepted by IROS2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.04707 2020-12-08 eess.SP cs.CE cs.ET cs.RO cs.SY eess.SY 74%

Driver Assistance for Safe and Comfortable On-Ramp Merging Using Environment Models Extended through V2X Communication and Role-Based Behavior Predictions

Lucas Eiermann, Florian Wirthmüller, Kay Massow, Gabi Breuel, Ilja Radusch

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO

Comments the article has been accepted for publication during the 16th IEEE International Conference on Intelligent Computer Communication and Processing (ICCP 2020), 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.02298 2020-05-06 eess.SP cs.MA 74%

Reducing Uncertainty by Fusing Dynamic Occupancy Grid Maps in a Cloud-based Collective Environment Model

Bastian Lampe, Raphael van Kempen, Timo Woopen, Alexandru Kampmann, Bassam Alrifaee, Lutz Eckstein

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.MA

Comments Accepted to be published in 2020 IEEE Intelligent Vehicles Symposium (IV), Las Vegas, NV, USA, October 20-23, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06767 2019-12-17 cs.LG stat.ML 74%

Estimating Early Fundraising Performance of Innovations via Graph-based Market Environment Model

Likang Wu, Zhi Li, Hongke Zhao, Zhen Pan, Qi Liu, Enhong Chen

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.07423 2019-01-23 cs.RO 74%

An Integrated Approach to Autonomous Environment Modeling

Miroslav Kulich, Viktor Kozák, Libor Přeučil

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.RO

Journal ref Modelling and Simulation for Autonomous Systems. MESAS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1007.1398 2015-05-19 cs.CV 74%

Multi-environment model estimation for motility analysis of Caenorhabditis Elegans

Raphael Sznitman, Manaswi Gupta, Gregory D. Hager, Paulo E. Arratia, Josue Sznitman

专题命中 通用世界模型 :environment model(title,abstract);分类 cs.CV

Comments 21 pages, 8 figures, accepted in: PLoS ONE (2010)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 73%

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-18 cs.LG cs.CV cs.RO 版本更新 73%

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23969 2026-07-31 cs.RO 版本更新 73%

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO;predictive model(abstract)

AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25728 2026-07-29 cs.RO cs.AI cs.LG 新提交 73%

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航

Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。

Comments 11 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14879 2026-06-16 cs.RO cs.CV cs.LG 新提交 73%

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

VANDERER: 基于未来感知与视觉好奇心引导扩散策略的无地图探索

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami

机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学坦登工程学院电气与计算机工程系控制/机器人研究实验室(CRRL)) New York University Abu Dhabi (NYUAD) Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心(CAIR))

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO

AI总结 提出VANDERER框架,利用视觉好奇心模块引导预训练扩散策略,仅依赖单目图像实现高效无地图探索,在多种模拟环境中平均探索面积比NoMaD多13.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 73%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 73%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.MA

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02345 2026-04-06 cs.LG cs.AI 73%

UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics

UI-Oceanus:通过合成环境动态扩展GUI代理

Mengzhou Wu, Yuzhe Guo, Yuan Cao, Haochuan Lu, Songhe Zhu, Pingzhe Qu, Xin Chen, Kang Qin, Zhongpu Wang, Xiaode Zhang, Xinyi Wang, Wei Dai, Gang Cao, Yuetang Deng, Zhi Gong, Dezhi Ran, Linyi Li, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学);北京大学计算机学院) School of Computer Science, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center(腾讯微信) WeChat, Tencent Inc.(西蒙菲莎大学) Simon Fraser University(德克萨斯大学达拉斯分校) University of Texas at Dallas(复旦大学系统与先进计算研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG;predictive model(abstract)

AI总结 本文提出UI-Oceanus框架,通过地面真实环境反馈掌握交互物理,解决GUI代理扩展中的数据瓶颈问题,实验表明其在离线和在线导航中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17438 2025-12-12 cs.AI cs.CV cs.LG cs.NE 73%

Object-centric proto-symbolic behavioural reasoning from pixels

基于像素的物体中心原型符号行为推理

Ruben van Bergen, Justus Hübotter, Alma Lago, Pablo Lanillos

机构 * Donders Institute, Radboud University(多纳尔斯研究所,拉布德大学) Cajal Neuroscience Center, Spanish National Research Council(卡哈尔神经科学中心,西班牙国家研究理事会)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.CV

AI总结 本文提出了一种基于像素的物体中心深度学习架构,通过物体表示实现从感知到抽象推理的行为推理,展示了在合成环境中通过逻辑推理和连续控制任务的能力。

Comments Accepted for publication in Neural Networks journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08271 2025-12-10 cs.RO cs.CV cs.LG eess.IV 73%

Zero-Splat TeleAssist: A Zero-Shot Pose Estimation Framework for Semantic Teleoperation

零溅远程协助:一种用于语义远程操作的零样本姿态估计框架

Srijan Dokania, Dharini Raghavan

机构 * Khoury College of Computer Sciences at Northeastern University(东北大学Khoury计算机科学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV、cs.RO

AI总结 Zero-Splat TeleAssist通过整合视觉-语言分割、单目深度、加权PCA姿态提取和3DGS,实现无需标记或深度传感器的多机器人远程操作中的零样本姿态估计。

Comments Published and Presented at 3rd Workshop on Human-Centric Multilateral Teleoperation in ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00138 2025-10-27 q-bio.NC cs.AI cs.LG cs.RO 73%

Intrinsic Goals for Autonomous Agents: Model-Based Exploration in Virtual Zebrafish Predicts Ethological Behavior and Whole-Brain Dynamics

Reece Keller, Alyn Kirsch, Felix Pei, Xaq Pitkow, Leo Kozachkov, Aran Nayebi

机构 * Neuroscience Institute, Carnegie Mellon University(卡内基梅隆大学神经科学研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) IBM Thomas J. Watson Research Center, IBM Research(IBM沃森研究中心)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.RO

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11943 2025-10-21 cs.AI cs.LG cs.LO cs.MA 73%

Agentic System with Modal Logic for Autonomous Diagnostics

Antonin Sulc, Thorsten Hellert

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG、cs.MA

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10325 2025-10-14 cs.MA cs.AI cs.RO 73%

KG-MAS: Knowledge Graph-Enhanced Multi-Agent Infrastructure for coupling physical and digital robotic environments

Walid Abdela

机构 * Walid Abdela(独立研究者)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO、cs.MA

详情

展开后加载摘要…

URL PDF HTML 收藏