arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-12-05 至 2025-12-05 共收录 7 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 6 篇

2511.11520 2025-12-05 cs.RO 95%

Scalable Policy Evaluation with Video World Models

可扩展的策略评估与视频世界模型

Wei-Cheng Tseng, Jinwei Gu, Qinsheng Zhang, Hanzi Mao, Ming-Yu Liu, Florian Shkurti, Lin Yen-Chen

机构 * Nvidia Research(Nvidia 研究院) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);video world model(title);world model(title,abstract)

AI总结 本文提出利用动作条件视频生成模型进行可扩展的策略评估,通过预训练模型利用互联网视频数据,减少现实世界测试需求,提升机器人策略评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04513 2025-12-05 cs.AI 94%

BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models

BiTAgent: 一种面向任务的模块化框架,用于多模态大语言模型与世界模型之间的双向耦合

Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 BiTAgent通过双向耦合多模态大语言模型与世界模型,实现任务感知的动态联合学习,提升多任务和跨环境的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 90%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04537 2025-12-05 cs.CV 81%

X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale

X-Humanoid:将人类视频机器人化以生成大规模人形视频

Pei Yang, Hai Ci, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 X-Humanoid通过生成式视频编辑方法,将人类视频机器人化,生成大规模人形视频数据集,提升人形机器人研究的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV 81%

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15168 2025-12-05 hep-th 67%

Correlation functions in expanding universes

膨胀宇宙中的关联函数

Chanyong Park, Hanse Kim, Kyungchan Cho

专题命中 通用世界模型 :world model(abstract);world model(abstract)

AI总结 本文基于膜世界模型研究膨胀宇宙中微观和宏观关联函数的时间演化,揭示了互信息与两点函数随距离和时间的变化特性。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模型式强化学习 1 篇

2512.04856 2025-12-05 eess.SY cs.SY 72%

Safe model-based Reinforcement Learning via Model Predictive Control and Control Barrier Functions

通过模型预测控制和控制屏障函数实现安全的模型基于强化学习

Kerim Dzhumageldyev, Filippo Airaldi, Azita Dabiri

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract)

AI总结 本文提出一种安全的模型基于强化学习框架,结合模型预测控制与控制屏障函数,通过参数化方法改进安全控制策略。

Comments Submitted to IFAC WC 2026, 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏