arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2158 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2158 篇

2512.22310 2025-12-30 cs.CV 79%

MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation

MoFu: 多主体视频生成的尺度感知调制与傅里叶融合

Run Ling, Ke Cao, Jian Lu, Ao Ma, Haowei Liu, Runze He, Changwei Wang, Rongtao Xu, Yihua Shao, Zhanjie Zhang, Peng Wu, Guibing Guo, Wei Feng, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Xingwei Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MoFu通过尺度感知调制和傅里叶融合解决多主体视频生成中的尺度不一致和排列敏感性问题,提升生成质量。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21252 2025-12-29 cs.CV 79%

DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation

DreaMontage:任意帧引导的一次生成视频

Jiawei Liu, Junqiao Li, Jiangfan Deng, Gen Li, Siyu Zhou, Zetao Fang, Shanshan Lao, Zengde Deng, Jianing Zhu, Tingting Ma, Jiayi Li, Yunqiu Wang, Qian He, Xinglong Wu

机构 * Intelligence Creation Team, ByteDance(字节跳动智能创作团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreaMontage通过任意帧引导生成技术,实现高效且高质量的一次生成视频,提升电影制作的视觉表现力和内容连贯性。

Comments Project Page: https://dreamontage.github.io/DreaMontage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21338 2025-12-29 cs.CV 79%

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成

Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua

机构 * Meta AI Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。

Comments Project Page: http://haonanqiu.com/projects/HiStream.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21559 2025-12-23 cs.CV 79%

X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning

X-CoT:基于LLM链式推理的可解释文本到视频检索

Prasanna Reddy Pulakurthi, Jiamian Wang, Majid Rabbani, Sohail Dianat, Raghuveer Rao, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 X-CoT通过基于LLM的链式推理实现文本到视频检索的可解释性,提升检索性能并提供详细的推理依据。

Comments 12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)

Journal ref Proc. EMNLP 2025, pages 31172-31183, Suzhou, China, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13704 2025-12-23 cs.CV 79%

TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models

TiViBench: 用于视频生成模型的视频推理基准测试

Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, Rongjin Guo, Yu Cheng, Ying-Cong Chen

专题命中 视频生成 :video reasoning(title);video generation(abstract);分类 cs.CV

AI总结 TiViBench提出用于评估视频生成模型的推理能力,结合VideoTPO提升推理性能,揭示商业与开源模型在推理潜力上的差异。

Comments Project: https://haroldchen19.github.io/TiViBench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15716 2025-12-18 cs.CV cs.AI 79%

Spatia: Video Generation with Updatable Spatial Memory

基于可更新空间记忆的视频生成

Jinjing Zhao, Fangyun Wei, Zhening Liu, Hongyang Zhang, Chang Xu, Yan Lu

机构 * The University of Sydney(悉尼大学) Microsoft Research(微软研究院) HKUST(香港科技大学) University of Waterloo(滑铁卢大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Spatia通过可更新的空间记忆机制,实现视频生成中的长期空间与时间一致性,支持动态实体生成和3D交互编辑。

Comments Project page: https://zhaojingjing713.github.io/Spatia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13492 2025-12-16 cs.CV 79%

Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$

训练变换器:加速 naive 4K 视频生成超过 10$\times$

Jiangning Zhang, Junwei Zhu, Teng Hu, Yabiao Wang, Donghao Luo, Weijian Cao, Zhenye Gan, Xiaobin Hu, Zhucun Xue, Chengjie Wang

机构 * Youtu Lab, Tencent(腾讯优设实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 T3-Video 通过优化全注意力机制,显著提升 4K 视频生成效率,实现性能与速度的双重突破

Comments Project page: https://zhangzjn.github.io/projects/T3-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13465 2025-12-16 cs.CV 79%

PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence

PoseAnything: 通用姿态引导视频生成与部分感知时间一致性

Ruiyan Wang, Teng Hu, Kaihui Huang, Zihan Su, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 79%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 79%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 79%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 79%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10286 2025-12-12 cs.CV 79%

ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

ShotDirector: 电影化可控多镜头视频生成

Xiaoxue Wu, Xinyuan Chen, Yaohui Wang, Yu Qiao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ShotDirector通过整合参数级相机控制和分层编辑模式感知提示,实现了电影化可控的多镜头视频生成。

Comments Project Page: https://uknowsth.github.io/ShotDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09363 2025-12-12 cs.CV 79%

StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

StereoWorld: 一种基于几何的单目到立体视频生成方法

Ke Xing, Xiaojie Jin, Longfei Li, Yuyang Yin, Hanwen Liang, Guixun Luo, Chen Fang, Jue Wang, Konstantinos N. Plataniotis, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Dzine AI University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StereoWorld通过几何感知正则化和时空拼接方案,实现高效高质量的单目到立体视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 79%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07831 2025-12-09 cs.CV 79%

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07821 2025-12-09 cs.CV cs.AI 79%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07802 2025-12-09 cs.CV 79%

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

OneStory: 通过自适应记忆实现连贯的多镜头视频生成

Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, Tian Xie

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。

Comments Project Page: https://zhaochongan.github.io/projects/OneStory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06905 2025-12-09 cs.CV 79%

Scaling Zero-Shot Reference-to-Video Generation

缩放零样本参考到视频生成

Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming Ren, Zhiheng Liu, Xiaoke Huang, Kam Woh Ng, Tian Xie, Xiao Han, Yuren Cong, Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, Sen He

机构 * Meta AI King's College London

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。

Comments Website: https://franciszzj.github.io/Saber/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09476 2025-12-08 cs.CV 79%

Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses

视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Chengming Xu, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。

Comments Project page: https://rain152.github.io/CoFE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03453 2025-12-04 cs.CV 79%

GeoVideo: Introducing Geometric Regularization into Video Generation Model

GeoVideo: 在视频生成模型中引入几何正则化

Yunpeng Bai, Shaoheng Fang, Chaohui Yu, Fan Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(鸿篇实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeoVideo通过引入几何正则化损失,提升视频生成的时空一致性和几何结构合理性。

Comments Project Page: https://geovideo.github.io/GeoVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03451 2025-12-04 cs.CV cs.AI cs.LG 79%

GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers

GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成

Zhiye Song, Steve Dai, Ben Keller, Brucek Khailany

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV 79%

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 79%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 79%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02273 2025-12-03 cs.CV cs.AI 79%

Progressive Image Restoration via Text-Conditioned Video Generation

通过文本条件视频生成实现渐进式图像修复

Peng Kang, Xijun Wang, Yu Yuan

机构 * Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本研究通过微调CogVideo,利用文本条件视频生成实现图像渐进式修复,提升感知度量并展示强泛化能力。

Comments First two authors contributed equally to this work. IEEE ICNC Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01960 2025-12-02 cs.CV cs.HC 79%

SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation

SpriteHand: 实时多样的手-物体交互与自回归视频生成

Zisu Li, Hengye Lyu, Jiaxin Shi, Yufeng Zeng, Mingming Fan, Hanwang Zhang, Chen Liang

机构 * HKUST (Guangzhou)(香港科技大学(广州)) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00832 2025-12-02 cs.CV 79%

PanFlow: Decoupled Motion Control for Panoramic Video Generation

PanFlow:全景视频生成的解耦运动控制

Cheng Zhang, Hanwen Liang, Donny Y. Chen, Qianyi Wu, Konstantinos N. Plataniotis, Camilo Cruz Gambardella, Jianfei Cai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PanFlow通过解耦动态摄像机旋转与输入光学流,提升全景视频生成的运动控制精度和质量。

Comments Accepted by AAAI. Code: https://github.com/chengzhag/PanFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14712 2025-12-02 cs.CV 79%

FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation

FreeSwim: 重新审视滑动窗口注意力机制以实现无训练超高清视频生成

Yunfeng Wu, Jiayi Song, Zhenxiong Tan, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 FreeSwim通过无训练滑动窗口注意力机制实现超高清视频生成,提升效率并保持视觉细节。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23475 2025-12-01 cs.CV 79%

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏