arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-18 至 2025-08-18 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2408.08189 2025-08-18 cs.CV 79%

FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance

Jiasong Feng, Ao Ma, Jing Wang, Ke Cao, Zhanjie Zhang

机构 * AI Research(360人工智能研究院) Beijing University of Technology(北京理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11049 2025-08-18 cs.RO cs.CV 57%

GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning

Kelin Yu, Sheng Zhang, Harshit Soora, Furong Huang, Heng Huang, Pratap Tokekar, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Published at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频问答 1 篇

2508.07597 2025-08-18 cs.CV cs.AI 57%

ShoulderShot: Generating Over-the-Shoulder Dialogue Videos

Yuang Zhang, Junqi Cheng, Haoyu Zhao, Jiaxi Gu, Fangyuan Zou, Zenghui Lu, Peng Shu

专题命中 视频问答 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频数据与评测 1 篇

2508.10922 2025-08-18 cs.CV 70%

A Survey on Video Temporal Grounding with Multimodal Large Language Model

Jianlong Wu, Wei Liu, Ye Liu, Meng Liu, Liqiang Nie, Zhouchen Lin, Chang Wen Chen

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 20 pages,6 figures,survey

详情

展开后加载摘要…

URL PDF HTML 收藏