arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-25 至 2025-09-25 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2312.04931 2025-09-25 cs.CV 92%

Long Video Understanding with Learnable Retrieval in Video-Language Models

Jiaqi Xu, Cuiling Lan, Wenxuan Xie, Xuejin Chen, Yan Lu

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频理解 :video understanding(title,abstract);video-language(title,abstract);long video(title,abstract);video reasoning(abstract)

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 3 篇

2412.07772 2025-09-25 cs.CV 83%

From Slow Bidirectional to Fast Autoregressive Video Diffusion Models

Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Fredo Durand, Eli Shechtman, Xun Huang

机构 * MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://causvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19690 2025-09-25 cs.CV 74%

From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition

Ling Lo, Kelvin C. K. Chan, Wen-Huang Cheng, Ming-Hsuan Yang

机构 * National Yang Ming Chiao Tung University(阳明交通大学) Google DeepMind(谷歌DeepMind) National Taiwan University(国立台湾大学) UC Merced(加州大学梅尔塞德斯分校)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20251 2025-09-25 cs.CV 70%

4D Driving Scene Generation With Stereo Forcing

Hao Lu, Zhuang Ma, Guangfeng Jiang, Wenhang Ge, Bohan Li, Yuzhan Cai, Wenzhao Zheng, Yunpeng Zhang, Yingcong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频数据与评测 2 篇

2509.19952 2025-09-25 cs.CV cs.AI 57%

When Words Can't Capture It All: Towards Video-Based User Complaint Text Generation with Multimodal Video Complaint Dataset

Sarmistha Das, R E Zera Marveen Lyngkhoi, Kirtan Jain, Vinayak Goyal, Sriparna Saha, Manish Gupta

机构 * Indian Institute of Technology Patna(印度帕纳布理工大学) Microsoft, India(微软印度)

专题命中 视频数据与评测 :video language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12201 2025-09-25 cs.CV 57%

OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

Yang Zhou, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Haoyu Guo, Zizun Li, Kaijing Ma, Xinyue Li, Yating Wang, Haoyi Zhu, Mingyu Liu, Dingning Liu, Jiange Yang, Zhoujie Fu, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Kaipeng Zhang, Tong He

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments https://yangzhou24.github.io/OmniWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏