arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-25 至 2025-07-25 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2507.18342 2025-07-25 cs.CV 79%

EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs

Yuping He, Yifei Huang, Guo Chen, Baoqi Pei, Jilan Xu, Tong Lu, Jiangmiao Pang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Tokyo(东京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13180 2025-07-25 cs.CV cs.AI cs.LG 57%

PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding

Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi, Triantafyllos Afouras, Tushar Nagarajan, Muhammad Maaz, Yale Song, Tengyu Ma, Shuming Hu, Suyog Jain, Miguel Martin, Huiyu Wang, Hanoona Rasheed, Peize Sun, Po-Yao Huang, Daniel Bolya, Nikhila Ravi, Shashank Jain, Tammy Stark, Shane Moon, Babak Damavandi, Vivian Lee, Andrew Westbury, Salman Khan, Philipp Krähenbühl, Piotr Dollár, Lorenzo Torresani, Kristen Grauman, Christoph Feichtenhofer

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2507.18107 2025-07-25 cs.CV 86%

T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation

Yubin Chen, Xuyang Guo, Zhenmei Shi, Zhao Song, Jiahao Zhang

机构 * San Jose State University(圣何塞州立大学) Guilin University of Electronic Technology(桂林电子科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15504 2025-07-25 cs.CV 79%

Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval via Uncertainty Minimization

Bingqing Zhang, Zhuo Cao, Heming Du, Yang Li, Xue Li, Jiajun Liu, Sen Wang

机构 * The University of Queensland, Australia(昆士兰大学) CSIRO Data61, Australia(澳大利亚CSIRO数据61)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17963 2025-07-25 cs.GR cs.CV cs.LG 70%

Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA

Rameen Abdal, Or Patashnik, Ekaterina Deyneka, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov, Daniel Cohen-Or, Kfir Aberman

机构 * Snap Research(Snap研究)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page and Video : https://snap-research.github.io/zero-shot-dynamic-concepts/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2502.06764 2025-07-25 cs.LG cs.CV 85%

History-Guided Video Diffusion

Kiwhan Song, Boyuan Chen, Max Simchowitz, Yilun Du, Russ Tedrake, Vincent Sitzmann

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments ICML 2025. Project website: https://boyuan.space/history-guidance

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2506.23825 2025-07-25 cs.CV 85%

Flash-VStream: Efficient Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Xiaojie Jin

机构 * Tsinghua University(清华大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Beijing Jiaotong University(北京交通大学) ByteDance Inc(字节跳动公司)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 2 篇

2507.18552 2025-07-25 cs.CV cs.AI 79%

VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding

Baoyao Yang, Wanyun Li, Dixin Chen, Junxiang Chen, Wenbin Yao, Haifeng Lin

机构 * Guangdong University of Technology(广东工业大学) Wechat, Tencent(微信、腾讯)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments 7 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07919 2025-07-25 cs.AI cs.CL cs.LG 50%

BEARCUBS: A benchmark for computer-using web agents

Yixiao Song, Katherine Thai, Chau Minh Pham, Yapei Chang, Mazin Nadaf, Mohit Iyyer

机构 * UMass Amherst University of Maryland, College Park(美国马里兰大学学院公园分校)

专题命中 视频数据与评测 :video understanding(abstract)

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏