arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-09 至 2025-12-09 共收录 10 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 8 篇

2512.07437 2025-12-09 cs.LG cs.AI cs.CV cs.NE cs.RO 94%

KAN-Dreamer: Benchmarking Kolmogorov-Arnold Networks as Function Approximators in World Models

KAN-Dreamer:基于Kolmogorov-Arnold网络作为函数近似器的世界模型基准测试

Chenwei Shi, Xueyu Luan

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 KAN-Dreamer将Kolmogorov-Arnold网络整合到DreamerV3中,通过替代MLP和卷积组件,实现了样本效率和训练速度与原始架构相当的性能。

Comments 23 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06983 2025-12-09 cs.AI cs.LG 94%

On Memory: A comparison of memory mechanisms in world models

关于记忆:世界模型中记忆机制的比较

Eli J. Laird, Corey Clark

机构 * Department of Computer Science Southern Methodist University(计算机科学系南方 Methodist 大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文通过分析几种记忆增强机制,探讨了世界模型中记忆跨度的限制,并提出了一种分类方法以提升模型在长时规划中的能力。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04441 2025-12-09 cs.CV 91%

MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving

MindDrive: 一个整合世界模型和视觉-语言模型的全功能框架,用于端到端自动驾驶

Bin Sun, Yaoguang Cao, Yan Wang, Rui Wang, Jiachen Shang, Xiejie Feng, Jiayi Lu, Jia Shi, Shichun Yang, Xiaoyu Yan, Ziying Song

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Laboratory of Intelligent Transportation System, Beihang University(北京航空航天大学智能交通系统国家重点实验室) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新院) Contemporary Amperex Technology Co., Limited (CATL)(当代电动车技术有限公司(CATL)) Research Institute of Aero-Engine, Beihang University(北京航空航天大学航空发动机研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) China Automotive Engineering Research Institute Co., Ltd.(中国汽车工程研究院股份有限公司)

专题命中 通用世界模型 :world model(title);world models(title);world model(title);world models(title)

AI总结 MindDrive通过整合世界模型和视觉-语言模型,提出了一种端到端自动驾驶框架,实现高质量轨迹生成与多目标决策推理,提升自动驾驶的安全性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 88%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20415 2025-12-09 cs.CV 81%

MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

魔法城:基于语言的美学自适应城市生成与可控3D资产和布局

Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 MajutsuCity通过可控3D资产和布局生成逼真城市,结合语言驱动和美学自适应,实现高保真度和风格多样性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07821 2025-12-09 cs.CV cs.AI 71%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 69%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23008 2025-12-09 cs.CV 69%

ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View

ARSS: 通过单视角生成视图的解码器-only 自回归视觉生成的控制

Wenbin Teng, Gonglin Chen, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 ARSS通过单视角生成视图,利用自回归模型和相机轨迹指导提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 自动驾驶 1 篇

2512.06865 2025-12-09 cs.CV 69%

Spatial Retrieval Augmented Autonomous Driving

空间检索增强的自动驾驶

Xiaosong Jia, Chenhe Zhang, Yule Jiang, Songbur Wong, Zhiyuan Zhang, Chen Chen, Shaofeng Zhang, Xuanhe Zhou, Xue Yang, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Jiao Tong University(上海交通大学) Key Laboratory of Target Cognition and Application Technology, Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室,航天信息研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出空间检索范式,通过引入离线地理图像提升自动驾驶任务性能,扩展nuScenes数据集并建立多个基准测试。

Comments Demo Page: https://spatialretrievalad.github.io/ with open sourced code, dataset, and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模型式强化学习 1 篇

2512.07528 2025-12-09 cs.LG cs.AI 76%

Model-Based Reinforcement Learning Under Confounding

基于模型的强化学习中的混杂问题

Nishanth Venkatesh, Andreas A. Malikopoulos

机构 * Department of Systems Engineering, Cornell University(系统工程系,康奈尔大学) School of Civil and Environmental Engineering, Cornell University(土木与环境工程学院,康奈尔大学)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于模型的强化学习方法,解决上下文不可观测导致的混杂问题,通过近似离策略评估和行为平均转移模型,实现一致的MDP构造和因果熵框架整合。

Comments 9 pages, 2 figures - decompressed draft

详情

展开后加载摘要…

URL PDF HTML 收藏