Leveraging Generative Language Models for Weakly Supervised Sentence Component Analysis in Video-Language Joint Learning
专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://hhsinping.github.io/factor
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://flowzero-video.github.io
专题命中 视频生成 :text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://livesketch.github.io/
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments 12 pages
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments Tech Report; Github: https://github.com/AILab-CVC/VideoCrafter Homepage: https://ailab-cvc.github.io/videocrafter/
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments NeurIPS 2023; Project available at: https://github.com/SooLab/Free-Bloom
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments Github: https://github.com/VideoCrafter/Animate-A-Story Project page: https://videocrafter.github.io/Animate-A-Story
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments 13 pages, 8 figures. Project page: https://doubiiu.github.io/projects/Make-Your-Video/
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Comments 9 pages, 8 figures
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV
专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV
专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV
Journal ref published in CVPR 2022
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
RAVEN-Eval:基于大语言多模态模型(LMM)偏好判断的、采用评分准则引导的AI视频生成模型自动评估框架
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract)
AI总结 本文提出RAVEN-Eval框架,基于LMM偏好判断与评分准则引导,可自动评估AI视频生成模型,已筛选任务、收集数据、评估模型与LMM并建立排行榜,为AIVGMs评估提供可扩展路径。
将音乐带入视野:音乐驱动的360°视频生成
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV、cs.MM
AI总结 【一句话总结】该研究针对音乐可视化问题,提出情感感知的音乐驱动360°视频生成流程,先预估歌曲情感轨迹,再转化为视觉引导,经SEGA框架生成关键帧,最后合成视频,能反映歌曲情感与结构。
Comments 5 pages, 1 figure
动作代理:代理视频生成与流约束扩散的结合
机构 * Intelligent Space Robotics Laboratory, Skoltech(斯克里普切尔技术大学智能空间机器人实验室)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)
AI总结 本文提出Action Agent框架,结合代理导航视频生成与流约束扩散控制,通过两阶段方法提升多体机器人导航性能,实现从语言和图像输入生成物理合理的第一人称导航视频,并在真实和仿真环境中取得高成功率。
Comments 8 pages, 5 figures
LAViG-FLOW:用于流体流动模拟的潜在自回归视频生成
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)
AI总结 LAViG-FLOW通过潜在自回归视频生成框架高效模拟流体流动,实现比传统方法快百倍的饱和度和压力场生成。
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract)
Comments 8 pages, 8 figures, 1 table
专题命中 视频生成 :text-to-video(title,abstract);video diffusion(abstract)
Comments Project website https://video-adapter.github.io/. First two authors contributed equally
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video diffusion(comments)
Comments 3D stereoscopic video generation, video diffusion, inpainting
TempJail:针对图像到视频生成模型的时序越狱攻击
机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; School of Computer Science, Nanjing University(南京大学计算机学院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。
Comments Accepted by ACM Multimedia 2026 (ACM MM '26)
StreamAV-Bench:面向流式音视频生成的综合基准测试集
机构 * BAAI(北京智源人工智能研究院) ; PKU(北京大学) ; Kling ; THU(清华大学) ; USTC(中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 该研究针对现有基准无法捕捉流式音视频生成特性的问题,推出首个综合基准StreamAV-Bench,构建含双赛道的评估框架并评估13个系统,揭示当前模型的缺陷并给出模型开发见解。
KeyID:用于身份保留视频生成的解耦草稿生成与关键帧编辑
机构 * Guangdong University of Technology(广东工业大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 KeyID是无需训练的IPVG框架,通过解耦视频动态合成与身份注入,解决身份一致性问题,在ACM MM 2026 IPVG挑战赛获亚军,可扩展至多主体参考及复杂序列动作生成。
Comments Accepted by ACM MM 2026
Delta Forcing:交互式自回归视频生成中的信任区域引导
机构 * Texas A\&M University(德克萨斯A&M大学) ; University of Washington(华盛顿大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。
Comments preprint
机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) ; NVIDIA(NVIDIA公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
Journal ref International Conference on Learning Representations (ICLR), 2026
Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。
视频生成模型作为世界模型:高效的范式、架构和算法
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。