arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2025-11-27 至 2025-11-27 共收录 7 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 5 篇

2511.21690 2025-11-27 cs.RO cs.CV cs.LG 91%

TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos

TraceGen:在3D轨迹空间中进行世界建模,实现跨躯体视频的学习

Seungjae Lee, Yoonkyo Jung, Inkook Chun, Yao-Chih Lee, Zikui Cai, Hongjia Huang, Aayush Talreja, Tan Dat Dao, Yongyuan Liang, Jia-Bin Huang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 TraceGen通过3D轨迹空间实现跨躯体视频学习,利用紧凑的轨迹表示提升机器人任务学习效率与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20462 2025-11-27 cs.CV cs.LG 82%

STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows

STARFlow-V:基于归一化流的端到端视频生成模型

Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai

机构 * Apple(苹果公司)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 STARFlow-V基于归一化流提出端到端视频生成模型,具备端到端学习、鲁棒因果预测和原生似然估计等优势,实现了高质量自回归视频生成。

Comments 21 pages, 9 figures. Code and samples are available at https://github.com/apple/ml-starflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19386 2025-11-27 cs.CV cs.AI 82%

Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals

力提示:视频生成模型可以学习并泛化基于物理的控制信号

Nate Gillman, Charles Herrmann, Michael Freeman, Daksh Aggarwal, Evan Luo, Deqing Sun, Chen Sun

机构 * Brown University(布朗大学) Google DeepMind(谷歌DeepMind)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出力提示方法,通过物理力信号生成逼真视频,利用视觉和运动先验实现物理控制信号的泛化,提升世界模型的物理真实性。

Comments Camera ready version (NeurIPS 2025). Code and interactive demos at https://force-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21531 2025-11-27 cs.LG cs.AI cs.RO cs.SY eess.SY 69%

Predictive Safety Shield for Dyna-Q Reinforcement Learning

动态Q强化学习的预测安全护盾

Jin Pin, Krasowski Hanna, Vanneaux Elena

机构 * Departement U2IS, ENSTA Paris, Institut Polytechnique de Paris(ENSTA巴黎大学U2IS部门,巴黎理工学院) Department of Electrical Engineering and Computer Science, University of California, Berkeley, USA(加州大学伯克利分校电气工程与计算机科学系)

专题命中 通用世界模型 :environment model(abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.LG、cs.RO

AI总结 本文提出了一种预测安全护盾,通过环境模型的安全模拟本地更新Q函数,以在保持严格安全保证的同时提高模型强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07864 2025-11-27 cs.LG cs.AI 50%

Lightweight Sequential Transformers for Blood Glucose Level Prediction in Type-1 Diabetes

轻量级顺序变换器用于1型糖尿病血糖水平预测

Mirko Paolo Barbato, Giorgia Rigamonti, Davide Marelli, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication, University of Milano-Bicocca(信息学、系统与通信系,米兰-比科卡大学)

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文提出了一种轻量级顺序变换器模型,用于1型糖尿病的血糖预测,通过结合注意力机制和循环神经网络的优势,实现高效且准确的血糖预测与不良事件检测。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 2 篇

2511.20937 2025-11-27 cs.AI cs.CL cs.CV cs.RO 89%

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

ENACT:通过视角交互的世界建模评估具身认知

Qineng Wang, Wenlong Huang, Yu Zhou, Hang Yin, Tianwei Bao, Jianwen Lyu, Weiyu Liu, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21264 2025-11-27 cs.RO 69%

Sampling-Based Optimization with Parallelized Physics Simulator for Bimanual Manipulation

基于并行物理模拟器的采样优化方法用于双臂操作

Iryna Hurova, Alinjar Dan, Karl Kruusamäe, Arun Kumar Singh

机构 * University of Tartu(塔尔图大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出基于并行物理模拟器的采样优化方法,用于解决双臂操作任务,通过定制的MPPI算法和GPU加速的MuJoCo实现高效交互评估。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏