arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-04 至 2025-12-04 共收录 10 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 8 篇

2512.03429 2025-12-04 cs.RO cs.AI 94%

World Models for Autonomous Navigation of Terrestrial Robots from LIDAR Observations

基于LIDAR观测的地面机器人自主导航的World Models

Raul Steinmetz, Fabio Demo Rosa, Victor Augusto Kich, Jair Augusto Bottega, Ricardo Bedin Grando, Daniel Fernando Tello Gamarra

机构 * Universidade Federal de Santa Maria, Brazil(巴西联邦大学圣玛利亚分校) University of Tsukuba, Japan(日本筑波大学) Universidade Federal de Rio Grande(巴西联邦大学里约格兰德分校) Universidad Tecnológica del Uruguay, Uruguay(乌拉圭技术大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出基于DreamerV3算法的模型驱动强化学习框架,通过整合MLP-VAE实现高维LIDAR数据的高效编码与潜在表示学习,提升地面机器人自主导航的效率与鲁棒性。

Comments Accepted for publication in the Journal of Intelligent and Fuzzy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03556 2025-12-04 cs.RO cs.CV 94%

RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL

RoboScape-R: 通用机器人训练的统一奖励-观测世界模型

Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 RoboScape-R通过统一奖励-观测世界模型提升机器人训练的泛化能力,实现37.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03400 2025-12-04 cs.LG cs.AI 94%

Better World Models Can Lead to Better Post-Training Performance

更好的世界模型可以导致更好的训练后性能

Prakhar Gupta, Henry Conklin, Sarah-Jane Leslie, Andrew Lee

机构 * University of Michigan(密歇根大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 本研究通过比较不同世界建模策略,发现显式建模能提升Transformer的状态表示质量,从而增强强化学习后训练的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04040 2025-12-04 cs.CV 92%

RELIC: Interactive Video World Model with Long-Horizon Memory

RELIC:具有长时间记忆的交互式视频世界模型

Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, Kalyan Sunkavalli, Feng Liu, Zhengqi Li, Hao Tan

专题命中 通用世界模型 :world model(title,abstract);video world model(title);world model(title,abstract);video world model(title)

AI总结 RELIC通过统一框架实现长时记忆与实时交互,提升视频世界建模的准确性与稳定性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03000 2025-12-04 cs.CV 88%

DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling

DynamicVerse: 一种具有物理意识的多模态框架用于4D世界建模

Kairun Wen, Yuzhi Huang, Runyu Chen, Hui Zheng, Yunlong Lin, Panwang Pan, Chenxin Li, Wenyan Cong, Jian Zhang, Junbin Lu, Chenguo Lin, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Yue Huang, Xinghao Ding, Rakesh Ranjan, Zhiwen Fan

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 DynamicVerse提出了一种多模态框架,通过整合大规模视觉、几何和多模态模型,实现动态现实世界视频的4D世界建模,提升了对物理尺度测量的全局准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03058 2025-12-04 cs.LG 81%

Dynamical Properties of Tokens in Self-Attention and Effects of Positional Encoding

自注意力机制中令牌的动力学特性及位置编码的影响

Duy-Tung Pham, An The Nguyen, Viet-Hoang Tran, Nhan-Phu Chung, Xin T. Tong, Tan M. Nguyen, Thieu N. Vo

机构 * FPT Software AI Center(FPT软件AI中心) National University of Singapore(国立新加坡大学) Ho Chi Minh University of Economics(胡志明经济大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文研究了Transformer中令牌的动力学特性,揭示了位置编码对模型性能的影响,并提出了改进方法以缓解收敛问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV 81%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03055 2025-12-04 cs.LG cs.AI 53%

Physics-informed self-supervised learning for predictive modeling of coronary artery digital twins

基于物理的自监督学习用于冠状动脉数字孪生的预测建模

Xiaowu Sun, Thabo Mahendiran, Ortal Senouf, Denise Auberson, Bernard De Bruyne, Stephane Fournier, Olivier Muller, Pascal Frossard, Emmanuel Abbe, Dorina Thanou

机构 * Chair of Mathematical Data Science, EPFL, Lausanne, Switzerland(数学数据科学教授职位,苏黎世联邦理工学院,拉沃斯,瑞士) LTS4 laboratory, EPFL, Lausanne, Switzerland(LTS4实验室,苏黎世联邦理工学院,拉沃斯,瑞士) School of AI and Advanced Computing, Xi’an Jiaotong-Liverpool University, China(人工智能与高级计算学院,西安交通大学利物浦大学,中国) Cardiology Department, Lausanne University Center Hospital, Lausanne, Switzerland(心血管科,拉沃斯大学中心医院,拉沃斯,瑞士) OLV Hospital, Aalst, Belgium(OLV医院,阿尔斯特,比利时) AI Center, EPFL, Lausanne, Switzerland(人工智能中心,苏黎世联邦理工学院,拉沃斯,瑞士)

专题命中 通用世界模型 :predictive model(title);分类 cs.AI、cs.LG

AI总结 PINS-CAD通过基于物理的自监督学习框架,利用合成数据预训练图神经网络,提升样本效率并生成具有生理意义的预测模型,用于冠状动脉疾病的预测和预防。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2512.03538 2025-12-04 cs.RO 81%

AdaPower: Specializing World Foundation Models for Predictive Manipulation

AdaPower: 为预测操纵专门化世界基础模型

Yuhang Huang, Shilong Zou, Jiazhao Zhang, Xinwang Liu, Ruizhen Hu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 AdaPower通过时空测试时间训练和记忆持久性机制,将通用世界基础模型转化为专门模型,提升机器人任务成功率41%

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03256 2025-12-04 cs.RO 50%

KALIKO: Kalman-Implicit Koopman Operator Learning For Prediction of Nonlinear Dynamical Systems

KALIKO:基于卡尔曼隐式Koopman算子的学习用于非线性动力系统预测

Albert H. Li, Ivan Dario Jimenez Rodriguez, Joel W. Burdick, Yisong Yue, Aaron D. Ames

机构 * Caltech(加州理工学院)

专题命中 具身与机器人 :latent dynamics(abstract);分类 cs.RO

AI总结 KALIKO通过卡尔曼滤波隐式学习高维非线性动态系统,实现高精度预测与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏