arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-05 至 2025-11-05 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1 篇

2508.05635 2025-11-05 cs.RO cs.CV 57%

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, Liliang Chen, Shuicheng Yan, Maoqing Yao, Guanghui Ren

机构 * AgiBot Genie Team(AgiBot Genie团队) LV-NUS Lab(LV-NUS实验室) BUAA(北京航空航天大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments https://genie-envisioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频问答 1 篇

2511.02182 2025-11-05 cs.CV 57%

Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models

Jinhwan Seo, Yoonki Cho, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(成均馆大学)

专题命中 视频问答 :video reasoning(abstract);分类 cs.CV

Comments 1st place winner of Grounded Videoqa track at the ICCV2025 Perception Test

详情

展开后加载摘要…

URL PDF HTML 收藏