MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine Projection
专题命中 视频理解 :video understanding(abstract)
Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(abstract)
Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 视频理解 :video understanding(abstract)
Comments 17 pages; Previously this version appeared as arXiv:2505.23870 which was submitted as a new work by accident
机构 * University of Minnesota(明尼苏达大学)
专题命中 视频理解 :video generation(abstract)
Comments Project page: https://minnesotanlp.github.io/scitalk-project-page/
机构 * Duke University(杜克大学) ; Duke Kunshan University(杜克昆山大学)
专题命中 视频理解 :video understanding(abstract)
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; UIUC(伊利诺伊大学香槟分校)
专题命中 视频理解 :video understanding(abstract)
机构 * NVIDIA(英伟达)
专题命中 视频理解 :video understanding(abstract)
专题命中 视频理解 :text-to-video(abstract)
专题命中 视频理解 :video understanding(abstract)
Comments Accepted to NeurIPS 2024; Project page is available at https://slotssms.github.io/ ; Code is available at https://github.com/JindongJiang/SlotSSMs
专题命中 视频理解 :text-to-video(abstract)
Comments Accepted at EMNLP 2024 (Main)
专题命中 视频理解 :video understanding(abstract)
Comments ASSETS 2024
专题命中 视频理解 :video understanding(abstract)
Journal ref 2022 IEEE 38th International Conference on Data Engineering (ICDE)
专题命中 视频理解 :video understanding(abstract)
Comments Techniques need to be double checked
专题命中 视频理解 :video understanding(abstract)
专题命中 视频理解 :video understanding(abstract)
专题命中 视频理解 :video understanding(abstract)
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; Georgia Tech(佐治亚理工学院)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)
Comments https://github.com/Picsart-AI-Research/StreamingT2V
锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(title);分类 cs.CV
AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) ; Hupan Lab(虎斑实验室) ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)
机构 * University of Central Florida(中佛罗里达大学) ; HKUST(香港科技大学)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)
机构 * KAIST(韩国科学技术院) ; Adobe Research(奥多比研究院)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)
Comments Project page with visuals: https://syncos2025.github.io/
机构 * University of Trento(特伦托大学) ; Snap Inc.(Snap公司) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 视频生成 :video-language(title,abstract);video generation(title);text-to-video(title);分类 cs.CV
Comments CVPR 2025. Project website at https://lucazanella.github.io/synvita/
CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(帕尔马大学) ; Amazon Prime Video(亚马逊Prime视频)
专题命中 视频生成 :video generation(title,abstract);video-language(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM
AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。
Comments EMNLP 2026
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
Comments 7 pages, 3 figures
机构 * Princeton University(普林斯顿大学) ; Meta
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV、eess.IV
Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025
机构 * NVIDIA
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments (1) Project page: https://research.nvidia.com/labs/par/MotionByQueries/ (2) The methods and results in section 5, "Consistent multi-shot video generation", are based on the arXiv version 1 (v1) of this work. Starting version 2 (v2), we extend and further analyze those findings to efficient motion transfer (3) in v3 we added: results with WAN 2.1, baselines and more quality metrics
基于推理时无梯度优化的空间接地文本到视频生成
机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) ; Obvious Research
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。
Comments Camera Ready Version
Diff-VF:基于扩散模型的免训练高质量长视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。
Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)
CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; China Telecom(中国电信) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))
专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);text-to-video(abstract)
AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。
移动字母表:文本到视频生成训练数据的对照研究
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Purdue University(普渡大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 研究文本到视频生成中数据分布和字幕质量对模型的影响,通过移动字母表测试平台进行对照实验,发现视频内容分布、字幕质量很关键,无分类器引导等可部分恢复模型,为相关模型开发提供参考。
LongLive-RAG: 一种用于长视频生成的通用检索增强框架
机构 * NVIDIA ; USC(美国大学) ; MIT(麻省理工学院)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。
Comments 20 pages, 7 figures, 4 tables