Robot Shape and Location Retention in Video Generation Using Diffusion Models
专题命中 视频生成 :video generation(title,abstract)
Comments 8 pages, 10 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract)
Comments 8 pages, 10 figures
专题命中 视频生成 :video generation(title,abstract)
Comments Full paper of the homonym paper published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"
Journal ref Abstract version published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"
专题命中 视频生成 :text-to-video(title,abstract)
专题命中 视频生成 :video generation(title,abstract)
Journal ref Workshop at ACM CHI 2024 (HCI and Human Factors Joining Forces to Meet the AI Interaction Challenge)
专题命中 视频生成 :video generation(title,abstract)
Comments NeurIPS 2023, Project Website: https://universal-policy.github.io/
2025感知测试挑战:挑战总结及统一视觉问答扩展
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; University of Bristol(布里斯托大学) ; University of Oxford(牛津大学)
专题命中 视频生成 :video generation(abstract);video-language(abstract);long video(abstract);分类 cs.CV
AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。
VideoFlexTok: 可变长度粗到细视频标记化
机构 * Apple(苹果公司) ; Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校(EPFL))
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
AI总结 VideoFlexTok通过可变长度粗到细标记化结构,实现更高效的视频生成,相比传统3D网格标记化,模型更小且生成质量相近。
Comments project page at https://videoflextok.epfl.ch/
TRANSPORTER:从VLM流形转移视觉语义
机构 * University of Twente, NL(荷兰特温特大学)
专题命中 视频生成 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。
Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER
SPDMark:基于选择性参数位移的鲁棒视频水印技术
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Michigan State University (MSU)(密歇根州立大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。
Comments CVPR 2026
EraseAnything++: 通过多对象优化实现Rectified Flow Transformers中的概念擦除
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 EraseAnything++通过多目标优化实现图像和视频扩散模型中的概念擦除,提升生成质量与时间一致性。
LTX-2:高效的音频-视觉联合基础模型
机构 * Lightricks(利光科技)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。
机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) ; Kling Team, Kuaishou Technology(快手技术 Kling 团队) ; CPII under InnoHK(创新香港 CPII) ; Zhejiang University(浙江大学) ; Dalian University of Technology(大连理工大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project Page: https://wkbian.github.io/Projects/RelightMaster/
机构 * Meituan LongCat Team(美团LongCat团队)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
机构 * Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
机构 * Xi’an Jiaotong University(西安交通大学) ; National University of Singapore(国立新加坡大学) ; Nanyang Technological University(南洋理工大学) ; Cleveland State University(克利夫兰州立大学)
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Accepted by ICCV2025
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.MM
Comments Accepted by RepL4NLP 2025 @ NAACL 2025
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments Serious updates are needed
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project page: https://vita-group.github.io/4DGen/
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
Comments Project webpage: https://depthcrafter.github.io
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments 11 pages, 2 figures, 2 tables
Tora3:基于轨迹的音频视频生成与物理一致性
机构 * Alibaba Cloud Computing(阿里巴巴云 computing) ; Fudan University(复旦大学)
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。
Comments accepted by ACM MM 2026
VidCRAFT3: 面向图像到视频生成的相机、物体与光照控制
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Zhejiang University(浙江大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Westlake University(西湖大学) ; School of Data Science and MOE Frontiers Center for Brain Science, Fudan University(复旦大学数据科学学院和脑科学前沿中心) ; Fudan ISTBI–ZJNU Algorithm Centre for Brain-inspired Intelligence, Zhejiang Normal University(复旦大学-浙江师范大学脑启发智能算法中心)
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
AI总结 提出VidCRAFT3框架,通过显式建模几何、运动与光照的跨因素交互,实现对相机运动、物体运动和光照方向的独立或联合控制,在控制精度和视觉一致性上达到最优。
Comments Accepted to TVCG 2026
AutoMV: 一种自动多智能体系统用于音乐视频生成
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanjing University(南京大学) ; Queen Mary University of London(伦敦大学女王学院) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Manchester(曼彻斯特大学)
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
Comments revised
机构 * University of Science and Technology of China(中国科学技术大学) ; HiDream.ai Inc.(HiDream.ai公司)
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
Comments CVPR 2025. Project page: https://zhw-zhang.github.io/MotionPro-page/
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
Comments WACV2025, 11 pages, 7 figures, demo page: https://DabFusion.github.io
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
Comments Accepted by SIGGRAPH Asia 2024, Project and Codes: https://github.com/HITsz-TMG/Anim-Director
专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV