arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-23 至 2025-07-23 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2506.22139 2025-07-23 cs.CV 57%

Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs

Shaojie Zhang, Jiahui Yang, Jianqin Yin, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20041 2025-07-23 cs.CV 57%

Learning Streaming Video Representation via Multitask Training

Yibin Yan, Jilan Xu, Shangzhe Di, Yikun Liu, Yudi Shi, Qirui Chen, Zeqian Li, Yifei Huang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://go2heart.github.io/streamformer

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2507.16310 2025-07-23 cs.CV 86%

MotionShot: Adaptive Motion Transfer across Arbitrary Objects for Text-to-Video Generation

Yanchen Liu, Yanan Sun, Zhening Xing, Junyao Gao, Kai Chen, Wenjie Pei

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2507.16341 2025-07-23 cs.CV 79%

Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model

Mingtao Guo, Guanyu Xing, Yanci Zhang, Yanli Liu

机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, 610065, China(合成视觉基础科学国家重点实验室,四川大学,成都,610065,中国) School of Cyber Science and Engineering, Sichuan University, Chengdu, 610065, China(网络科学与工程学院,四川大学,成都,610065,中国) College of Computer Science, Sichuan University, Chengdu, 610065, China(计算机科学学院,四川大学,成都,610065,中国)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2411.19951 2025-07-23 cs.CV cs.CL cs.LG 70%

Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation

Shukang Yin, Chaoyou Fu, Sirui Zhao, Chunjiang Ge, Yan Yang, Yuhan Dai, Yongdong Luo, Tong Xu, Caifeng Shan, Enhong Chen

机构 * USTC(中国科学技术大学) NJU(南京大学) THU(清华大学) XMU(厦门大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Project page: https://github.com/VITA-MLLM/Sparrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09577 2025-07-23 cs.CV 57%

Memory-Augmented SAM2 for Training-Free Surgical Video Segmentation

Ming Yin, Fu Wang, Xujiong Ye, Yanda Meng, Zeyu Fu

机构 * Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments Accepted in MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 4 篇

2507.16718 2025-07-23 cs.CV 79%

Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction

Yiqing Shen, Chenjia Li, Chenxiao Fan, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05328 2025-07-23 cs.CV 70%

AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs

Lidong Lu, Guo Chen, Zhiqi Li, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16151 2025-07-23 cs.CV cs.AI 57%

SPACT18: Spiking Human Action Recognition Benchmark Dataset with Complementary RGB and Thermal Modalities

Yasser Ashraf, Ahmed Sharshar, Velibor Bojkovic, Bin Gu

机构 * Department of Machine Learning(机器学习系) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13684 2025-07-23 cs.CV 57%

FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models

Minghan Li, Chenxi Xie, Yichen Wu, Lei Zhang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Broad Institute(博德研究所) Hong Kong Polytechnic University(香港理工大学) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) City University of Hong Kong(香港城市大学) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(自然与人工智能研究学院,哈佛大学)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments 24 pages, 14 figures, 16 tables

Journal ref ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏