ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model
ThinkJEPA:赋予潜在世界模型大型视觉-语言推理能力
Haichao Zhang, Yijiang Li, Shwai He, Tushar Nagarajan, Mingfei Chen, Jianglin Lu, Ang Li, Yun Fu
机构
*
Northeastern University(东北大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
University of Maryland(马里兰大学)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
University of Washington(华盛顿大学)
Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends
迈向交互式视频世界建模:前沿、挑战、基准与未来趋势
Jiuming Liu, Chaojun Ni, Mengmeng Liu, Chensheng Peng, Fangjinhua Wang, Sitian Shen, Marc Pollefeys, Masayoshi Tomizuka, Ayush Tewari, Per Ola Kristensson
机构
*
Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系)
;
Peking University(北京大学)
;
University of Twente(埃因霍温理工大学)
;
Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室)
;
ETH Zurich(苏黎世联邦理工学院)
;
Microsoft(微软公司)
;
University of Oxford(牛津大学)
机构
*
Peking University(北京大学)
;
JD Logistics(京东物流)
;
Nankai University(南开大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Rutgers University(罗格斯大学)
;
University of Texas at Dallas(德克萨斯大学达拉斯分校)
;
Institut Polytechnique de Paris(巴黎综合理工学院)
机构
*
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
Fudan University(复旦大学)
;
Microsoft Research Asia(微软亚洲研究院)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University(浙江大学)
WorldPlanner: Monte Carlo Tree Search and MPC with Action-Conditioned Visual World Models
R. Khorrambakht, Joaquim Ortiz-Haro, Joseph Amigo, Omar Mostafa, Daniel Dugas, Franziska Meier, Ludovic Righetti
机构
*
Center for Robotics and Embodied Intelligence, Tandon School of Engineering, New York University, Brooklyn, NY(机器人与具身智能中心,工程学院,纽约大学,布鲁克林,纽约)
;
FAIR at Meta(Meta的FAIR)