arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 5 篇

2608.22067 2026-08-25 cs.RO cs.AI cs.CV cs.LG 新提交 57%

Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21439 2026-08-25 cs.CV 新提交 57%

WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

WorldMind:用于状态感知NPC行为的解耦游戏世界模型

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究针对现有游戏世界模型中NPC行为与视频生成绑定的问题,提出首个解耦框架WorldMind,构建BOSS-140K数据集,实验显示其NPC行为更优。

Comments Project page: this https URL (https://teawhite.cn/worldmind_projectpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 57%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22403 2026-08-25 cs.RO 新提交 50%

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM:从人类视频学习世界动作模型的潜在动力学

Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

专题命中 动作与事件理解 :video generation(abstract)

AI总结 LD4WAM通过运动对齐的潜在动力学,结合语义重建与真实运动对齐训练的潜在动力学模型和MoT架构的世界动力学动作模型,在RoboTwin仿真及真实机器人上表现良好,可泛化到未见物体与背景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01027 2026-08-25 cs.RO 版本更新 50%

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

$\tau_0$-WM:一种用于机器人操作的统一视频-动作世界模型

Pengfei Zhou, Shengcong Chen, Di Chen, Jiaxu Wang, Rongjun Jin, Bingwen Zhu, Yike Pan, Songen Gu, Kuanning Wang, Shufeng Nan, Xingyu Qiu, Chenhao Qiu, Pu Yang, Yunuo Cai, Jianxiong Gao, Yifan Li, Yanwei Fu, Xiangyu Yue, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 提出$\tau_0$-WM,一个统一视频-动作世界模型,通过共享视频扩散骨干集成策略学习、视频预测和动作评估,在长时域和精细操作任务上优于基线。

Comments Our project homepge: this https URL (https://tau0-wm.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏