arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-04 至 2026-02-04 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2602.03793 2026-02-04 cs.RO cs.CV 79%

BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks

BridgeV2W: 通过具身遮罩将视频生成模型与具身世界模型 bridging

Yixiang Chen, Peiyan Li, Jiabing Yang, Keji He, Xiangnan Wu, Yuan Xu, Kai Wang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR),自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shandong University(山东大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 BridgeV2W 通过具身遮罩将视频生成模型与具身世界模型结合,解决坐标空间动作与像素空间视频的不匹配问题,并提升视频生成质量与跨具身统一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03242 2026-02-04 cs.CV 79%

InstaDrive: Instance-Aware Driving World Models for Realistic and Consistent Video Generation

InstaDrive: 为真实和一致的视频生成实例感知的驾驶世界模型

Zhuoran Yang, Xi Guo, Chenjing Ding, Chiyu Wang, Wei Wu, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) SenseAuto(感etime) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 InstaDrive通过实例感知机制提升驾驶视频生成质量,增强自动驾驶任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02444 2026-02-04 cs.IR cs.CV 74%

RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval

RANKVIDEO: 文本到视频检索中的推理重排序

Tyler Skow, Alexander Martin, Benjamin Van Durme, Rama Chellappa, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 RANKVIDEO通过基于视频内容的推理机制,提升了文本到视频检索的重排序性能,实验显示在nDCG@10上平均提升31%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01538 2026-02-04 cs.CV cs.AI cs.CL 57%

Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars

让拟人化角色互动:面向文本驱动的人-物体交互的可控对话拟人化

Youliang Zhang, Zhengguang Zhou, Zhentao Yu, Ziyao Huang, Teng Hu, Sen Liang, Guozhen Zhang, Ziqiao Peng, Shunkai Li, Yi Chen, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Xiu Li

机构 * Tsinghua University(清华大学) Tencent HY(腾讯)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出InteractAvatar框架,通过双流结构实现文本驱动的人-物体交互生成,解决环境感知与控制质量矛盾,建立GroundedInter基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏