arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-03 至 2026-03-03 共收录 14 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 8 篇

2603.01748 2026-03-03 cs.LG cs.AI 94%

Discrete World Models via Regularization

通过正则化构建离散世界模型

Davide Bizzaro, Luciano Serafini

机构 * University of Padua(帕多瓦大学) Fonadazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 DWMR通过正则化方法实现无监督布尔世界模型学习,提高表示准确性和转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 93%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00808 2026-03-03 cs.AI 93%

MetaMind: General and Cognitive World Models in Multi-Agent Systems by Meta-Theory of Mind

MetaMind: 多智能体系统中通过元理论思维实现通用和认知世界模型

Lingyi Wang, Rashed Shelim, Walid Saad, Naren Ramakrishna

机构 * Department of Electrical(电气工程系) Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工学院)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 MetaMind通过元理论思维框架,使多智能体系统中的智能体能够自主推理他人目标与信念,实现零样本泛化与自监督学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00466 2026-03-03 cs.CV 88%

DreamWorld: Unified World Modeling in Video Generation

DreamWorld: 视频生成中的统一世界建模

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang

机构 * University of Science(科学技术大学) Shanghai Jiao Tong University, Shanghai, China.(上海交通大学) Nanjing University, Suzhou, China.(南京大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 DreamWorld通过联合世界建模范式和约束退火技术,提升视频生成的世界一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV 69%

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22643 2026-03-03 cs.RO 69%

VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search

VLA-Reasoner: 通过在线蒙特卡洛树搜索增强视觉-语言-动作模型的推理能力

Wenkai Guo, Guanxing Lu, Haoyuan Deng, Zhenyu Wu, Yansong Tang, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 VLA-Reasoner通过在线蒙特卡洛树搜索增强视觉-语言-动作模型,提升长时间轨迹任务的推理能力与执行效率。

Comments 8 pages, 6 figures, Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08166 2026-03-03 cs.AI 64%

ZeroDVFS: Zero-Shot LLM-Guided Core and Frequency Allocation for Embedded Platforms

ZeroDVFS: 面向嵌入式平台的零样本LLM引导的核心与频率分配

Mohammad Pivezhandi, Mahdi Banisharif, Abusayeed Saifullah, Ali Jannesari

机构 * Wayne State University(韦恩州立大学) Iowa State University(爱荷华州立大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 通用世界模型 :environment model(abstract);model-based reinforcement learning(abstract);分类 cs.AI

AI总结 ZeroDVFS通过基于模型的强化学习和LLM引导的语义特征提取,实现嵌入式平台的零样本核心与频率分配,显著提升能效和任务完成效率。

Comments 56 pages, 14 figures, 18 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01695 2026-03-03 cs.LG cs.AI 50%

Streaming Continual Learning for Unified Adaptive Intelligence in Dynamic Environments

流式持续学习用于动态环境中的统一自适应智能

Federico Giannini, Giacomo Ziffer, Andrea Cossu, Vincenzo Lomonaco

机构 * DEIB, Politecnico di Milano(迪埃比学院,米兰理工大学) Computer Science Department, University of Pisa(帕尔马大学计算机科学系)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文提出流式持续学习框架,结合持续学习和流式机器学习的优势,以提升动态环境中的自适应智能能力。

Journal ref IEEE Intelligent Systems 39(6) 81-85, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2510.10125 2026-03-03 cs.RO cs.AI 90%

Ctrl-World: A Controllable Generative World Model for Robot Manipulation

Ctrl-World: 一个可控制的生成世界模型用于机器人操作

Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出了一种可控的多视图世界模型,用于评估和改进通用机器人策略的指令遵循能力,通过姿态条件化记忆检索和帧级动作条件化实现长时一致性和精确动作控制,提升策略成功率44.7%。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12151 2026-03-03 cs.RO cs.LG 50%

Learning Contact Dynamics through Touching: Action-conditional Graph Neural Networks for Robotic Peg Insertion

通过接触学习动态:用于机器人圆柱体插入的基于动作的图神经网络

Zongyao Yi, Joachim Hertzberg, Martin Atzmueller

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Osnabrück University(奥斯纳布吕克大学)

专题命中 具身与机器人 :分类 cs.LG、cs.RO;dynamics model(abstract);predictive model(abstract)

AI总结 本文提出了一种基于动作的图神经网络模型,用于提升机器人圆柱体插入任务中的运动和力矩预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 3 篇

2603.01452 2026-03-03 cs.AI cs.RO 84%

Scaling Tasks, Not Samples: Mastering Humanoid Control through Multi-Task Model-Based Reinforcement Learning

通过多任务模型基于强化学习掌握人形控制

Shaohuai Liu, Weirui Ye, Yilun Du, Le Xie

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 本文提出EfficientZero-Multitask算法,通过多任务模型基于强化学习提升人形机器人控制性能,实现高效样本利用和高任务适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19305 2026-03-03 stat.ML cs.LG math.DS 74%

LD-EnSF: Synergizing Latent Dynamics with Ensemble Score Filters for Fast Data Assimilation with Sparse Observations

LD-EnSF:融合潜在动力学与集成评分滤波器用于稀疏观测的快速数据同化

Pengpeng Xiao, Phillip Si, Peng Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Yale University(耶鲁大学)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.LG

AI总结 LD-EnSF通过在潜在空间中直接演进动力学,结合改进的LDNets和历史感知LSTM编码器,实现高维稀疏观测下的高效数据同化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24482 2026-03-03 cs.LG cs.AI cs.RO 60%

Sample-efficient and Scalable Exploration in Continuous-Time RL

在连续时间强化学习中实现高效且可扩展的探索

Klemens Iten, Lenart Treven, Bhavya Sukhija, Florian Dörfler, Andreas Krause

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 本文提出COMBRL算法,通过结合外在奖励和模型不确定性,实现连续时间强化学习中的高效样本利用和可扩展性。

Comments 28 pages, 8 figures, 6 tables. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仿真与规划 1 篇

2508.11428 2026-03-03 cs.CV 86%

ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving

ImagiDrive: 一种用于自动驾驶的统一想象与规划框架

Jingyu Li, Bozhou Zhang, Xin Jin, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Eastern Institute of Technology(技术东院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 仿真与规划 :world model(abstract);world models(abstract);driving world model(abstract);world model(abstract)

AI总结 ImagiDrive通过整合视觉-语言模型和驾驶世界模型,实现自动驾驶中的统一想象与规划循环,提升场景生成和决策预测的准确性与效率。

Comments Accepted for publication in 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏