Video-to-Audio Generation with Hidden Alignment
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted for The 39th Annual AAAI Conference on Artificial Intelligence 2025 in Main Track, 19 pages, 24 figures
专题命中 视频生成 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Video Editing
GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作
机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) ; University of Liverpool(利物浦大学) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地球科学国家重点实验室,自动化与智能感知学院)
专题命中 视频生成 :video generation(title)
AI总结 研究旨在将生成视频转换为机器人可执行操作轨迹。核心方法是GenVid2Robot框架,通过采样语义锚点、跟踪验证运动等步骤实现。主要贡献是提高了生成视频引导操作的可靠性,通过多种手段建立视觉运动先验。
Comments Preprint
PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成
机构 * HKUST(GZ)(香港科技大学(广州)) ; Tencent(腾讯)
专题命中 视频生成 :video generation(title)
AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。
Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos
Camera Artist: 一种多智能体框架用于电影语言叙事视频生成
机构 * School of Information and Communication Engineering, Communication University of China(中国传媒大学信息与通信工程学院) ; State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
专题命中 视频生成 :video generation(title)
AI总结 Camera Artist通过引入专门的 cinematography shot agent,增强了镜头间叙事连贯性和电影语言表达,提升了视频叙事的连贯性和表现力。
EmboAlign:通过组合约束对齐视频生成以实现零样本操控
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(title)
AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。
Bob的彩纸:音乐和视频生成中的语音记忆攻击
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of California San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频生成 :video generation(title)
AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。
机构 * Nanyang Technological University(南洋理工大学) ; Beijing Jiaotong University(北京交通大学) ; National University of Singapore(国立新加坡大学) ; Beihang University(北航) ; Sun Yat-sen University(中山大学)
专题命中 视频生成 :text-to-video(title)
Comments 33 pages, 9 figures
专题命中 视频生成 :video generation(title)
驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征
机构 * Technical University of Munich(慕尼黑技术大学) ; Huawei Hilbert Research Center(华为希利伯特研究中心) ; Huawei Riemann Lab(华为里曼实验室) ; Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。
Comments Accepted to ACM MM 2026
SparSTAR:用于时空自回归视频合成的稀疏注意力机制
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。
基于同步感知跨模态稀疏注意力的高效视听生成
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba Cloud Computing(阿里巴巴云计算) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。
上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性
机构 * NVIDIA(英伟达) ; University of Surrey(萨里大学)
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出上下文匹配蒸馏(CMD)框架,解决现有视频蒸馏中教师监督与学生因果信息集不一致的问题,实现了自回归视频生成的最先进性能及对相机控制的更好依从性。
Comments Project Page: https://hmrishavbandy.github.io/cmd-site/
观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐
机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) ; School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。
Sekai2:从世界探索到交互式世界建模
机构 * Alaya Lab(Alaya实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。
Comments Sekai2 dataset technical report. Developed at Alaya Lab
Surg-UniWorld:具有多模态控制专家的统一外科世界模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; the University of Sydney(悉尼大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。
LeapTalk:打破说话头生成中的延迟-质量权衡
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。
MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。
Comments Project page: https://mvhoi.hirotong.fun
深入探究视频VAE的潜在频谱偏置以实现更优的可扩散性
机构 * Zhipu AI, Beijing, China(智谱AI,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文通过统计分析发现视频VAE潜在空间的频谱特性对扩散训练至关重要,提出局部相关正则化和潜在掩码重建两种轻量级正则化器,实现3倍收敛加速和10%视频奖励提升。
Timeripple:通过理解潜在空间中的时空相关性加速视频扩散变换器
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Qizhi Institute(上海启智研究院) ; Huawei Technologies Co.,Ltd(华为技术有限公司) ; Institute of Computing Technology, Chinese Academy of Science(中国科学院计算技术研究所)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对视频生成中vDiT模型推理延迟问题,利用潜在空间时空相关性,提出轻量级自适应重用策略,通过重用相关令牌部分注意力分数近似计算,相比现有技术计算节省85%,且视频质量损失小。
ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑
机构 * HKUST(香港科技大学) ; Kling Team(克林团队) ; NJU(南京大学) ; UCAS(中国科学院大学) ; PKU(北京大学) ; HKU(香港大学)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。
Comments Project Page: https://rebind-mrv2v.github.io/
VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Huazhong University of Science and Technology(华中科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video understanding(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。
Comments Home page: https://zhxie0117.github.io/VideoRAE
深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战
机构 * The University of Sydney(悉尼大学) ; University of Melbourne(墨尔本大学) ; City University of Hong Kong(香港城市大学) ; Wuhan University(武汉大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。
Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/
OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏
机构 * Meituan(美团) ; HKUST(香港科技大学) ; City University of Hong Kong(香港城市大学)
专题命中 视频生成 :video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。
Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V
生成细化网络用于视觉合成
机构 * ByteDance(字节跳动)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出生成细化网络(GRN),通过近无损分层二进制量化解决离散化瓶颈,结合全局细化机制和熵引导采样策略,提升图像生成质量与效率。
Comments code: https://github.com/bytedance/GRN
InverseCrafter:作为潜在域逆问题的高效视频重新捕捉
机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) ; EverEx, South Korea(韩国EverEx公司) ; Korea University, South Korea(韩国国立庆熙大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。
Comments ECCV 2026
$\nabla$NABLA:邻域自适应块级注意力
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。
Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026