arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1395 篇

2505.23870 2025-08-12 cs.LG cs.AI 50%

MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection

Yixian Shen, Qi Bi, Jia-Hong Huang, Hongyi Zhu, Andy D. Pimentel, Anuj Pathania

专题命中 视频理解 :video understanding(abstract)

Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09103 2025-08-12 cs.LG cs.AI 50%

MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection

Yixian Shen, Qi Bi, Jia-Hong Huang, Hongyi Zhu, Andy D. Pimentel, Anuj Pathania

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视频理解 :video understanding(abstract)

Comments 17 pages; Previously this version appeared as arXiv:2505.23870 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18805 2025-04-29 cs.CL cs.AI cs.LG 50%

Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation

Jong Inn Park, Maanas Taneja, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 视频理解 :video generation(abstract)

Comments Project page: https://minnesotanlp.github.io/scitalk-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10742 2025-04-25 cs.LG cs.CL 50%

Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing

Yudong Liu, Jingwei Sun, Yueqian Lin, Jingyang Zhang, Ming Yin, Qinsi Wang, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) Duke Kunshan University(杜克昆山大学)

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14692 2025-04-22 cs.CL 50%

OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding

Songtao Jiang, Yuan Wang, Sibo Song, Yan Zhang, Zijie Meng, Bohan Lei, Jian Wu, Jimeng Sun, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) UIUC(伊利诺伊大学香槟分校)

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06214 2025-04-09 cs.CL cs.AI cs.LG 50%

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro

机构 * NVIDIA(英伟达)

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04707 2025-04-08 cs.IR 50%

TC-MGC: Text-Conditioned Multi-Grained Contrastive Learning for Text-Video Retrieval

Xiaolun Jing, Genke Yang, Jian Chu

专题命中 视频理解 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12272 2024-12-03 cs.AI 50%

Slot State Space Models

Jindong Jiang, Fei Deng, Gautam Singh, Minseung Lee, Sungjin Ahn

专题命中 视频理解 :video understanding(abstract)

Comments Accepted to NeurIPS 2024; Project page is available at https://slotssms.github.io/ ; Code is available at https://github.com/JindongJiang/SlotSSMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01264 2024-10-08 cs.CL 50%

SignCLIP: Connecting Text and Sign Language by Contrastive Learning

Zifan Jiang, Gerard Sant, Amit Moryossef, Mathias Müller, Rico Sennrich, Sarah Ebling

专题命中 视频理解 :text-to-video(abstract)

Comments Accepted at EMNLP 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11406 2024-08-22 cs.HC 50%

Audio Description Customization

Rosiana Natalie, Ruei-Che Chang, Smitha Sheshadri, Anhong Guo, Kotaro Hara

专题命中 视频理解 :video understanding(abstract)

Comments ASSETS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09141 2022-08-16 cs.DB 50%

ExSample: Efficient Searches on Video Repositories through Adaptive Sampling

Oscar Moll, Favyen Bastani, Sam Madden, Mike Stonebraker, Vijay Gadepally, Tim Kraska

专题命中 视频理解 :video understanding(abstract)

Journal ref 2022 IEEE 38th International Conference on Data Engineering (ICDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.03630 2021-08-05 quant-ph 50%

A Quantum Convolutional Neural Network for Image Classification

Yanxuan Lü, Qing Gao, Jinhu Lü, Maciej Ogorzałek, Jin Zheng

专题命中 视频理解 :video understanding(abstract)

Comments Techniques need to be double checked

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13448 2020-10-26 cs.SD cs.CL eess.AS 50%

Audio Caption in a Car Setting with a Sentence-Level Loss

Xuenan Xu, Heinrich Dinkel, Mengyue Wu, Kai Yu

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.11780 2019-03-29 cs.LG stat.ML 50%

Wasserstein Dependency Measure for Representation Learning

Sherjil Ozair, Corey Lynch, Yoshua Bengio, Aaron van den Oord, Sergey Levine, Pierre Sermanet

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.02653 2018-07-10 cs.LG stat.ML 50%

When Work Matters: Transforming Classical Network Structures to Graph CNN

Wenting Zhao, Chunyan Xu, Zhen Cui, Tong Zhang, Jiatao Jiang, Zhenyu Zhang, Jian Yang

专题命中 视频理解 :video understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2171 篇

2403.14773 2025-04-17 cs.CV cs.AI cs.CL cs.LG cs.MM eess.IV 91%

StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text

Roberto Henschel, Levon Khachatryan, Hayk Poghosyan, Daniil Hayrapetyan, Vahram Tadevosyan, Zhangyang Wang, Shant Navasardyan, Humphrey Shi

机构 * UT Austin(德克萨斯大学奥斯汀分校) Georgia Tech(佐治亚理工学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

Comments https://github.com/Picsart-AI-Research/StreamingT2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 91%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02497 2025-06-04 cs.CV 90%

LumosFlow: Motion-Guided Long Video Generation

Jiahao Chen, Hangjie Yuan, Yichen Qian, Jingyun Liang, Jiazheng Xing, Pengwei Liu, Weihua Chen, Fan Wang, Bing Su

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Hupan Lab(虎斑实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09926 2025-03-14 cs.CV 90%

VideoMerge: Towards Training-free Long Video Generation

Siyang Zhang, Harry Yang, Ser-Nam Lim

机构 * University of Central Florida(中佛罗里达大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08605 2025-03-12 cs.CV cs.AI cs.LG 90%

Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling

Subin Kim, Seoung Wug Oh, Jui-Hsien Wang, Joon-Young Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Adobe Research(奥多比研究院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

Comments Project page with visuals: https://syncos2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18507 2025-03-25 cs.CV 90%

Can Text-to-Video Generation help Video-Language Alignment?

Luca Zanella, Massimiliano Mancini, Willi Menapace, Sergey Tulyakov, Yiming Wang, Elisa Ricci

机构 * University of Trento(特伦托大学) Snap Inc.(Snap公司) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视频生成 :video-language(title,abstract);video generation(title);text-to-video(title);分类 cs.CV

Comments CVPR 2025. Project website at https://lucazanella.github.io/synvita/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 90%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视频生成 :video generation(title,abstract);video-language(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01362 2025-09-03 cs.CV cs.MM 90%

Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement

Jiayi Gao, Changcheng Hua, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09856 2025-05-27 cs.CV cs.AI cs.LG eess.IV 90%

LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity

Hongjie Wang, Chih-Yao Ma, Yen-Cheng Liu, Ji Hou, Tao Xu, Jialiang Wang, Felix Juefei-Xu, Yaqiao Luo, Peizhao Zhang, Tingbo Hou, Peter Vajda, Niraj K. Jha, Xiaoliang Dai

机构 * Princeton University(普林斯顿大学) Meta

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV、eess.IV

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07750 2025-05-23 cs.CV 90%

Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation

Yuval Atzmon, Rinon Gal, Yoad Tewel, Yoni Kasten, Gal Chechik

机构 * NVIDIA

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments (1) Project page: https://research.nvidia.com/labs/par/MotionByQueries/ (2) The methods and results in section 5, "Consistent multi-shot video generation", are based on the arXiv version 1 (v1) of this work. Starting version 2 (v2), we extend and further analyze those findings to efficient motion transfer (3) in v3 we added: results with WAN 2.1, baselines and more quality metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13037 2026-08-17 cs.CV 版本更新 89%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交 89%

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26529 2026-07-30 cs.CV 新提交 89%

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);text-to-video(abstract)

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18789 2026-07-22 cs.CV 新提交 89%

Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

移动字母表:文本到视频生成训练数据的对照研究

Amber Yijia Zheng, Lu Liu, Raymond A. Yeh, Xi Yin

机构 * Meta Superintelligence Labs(Meta超智能实验室) Purdue University(普渡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 研究文本到视频生成中数据分布和字幕质量对模型的影响,通过移动字母表测试平台进行对照实验,发现视频内容分布、字幕质量很关键,无分类器引导等可部分恢复模型,为相关模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02553 2026-06-02 cs.CV 89%

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

LongLive-RAG: 一种用于长视频生成的通用检索增强框架

Qixin Hu, Shuai Yang, Wei Huang, Song Han, Yukang Chen

机构 * NVIDIA USC(美国大学) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏