arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2602.09883 2026-02-11 cs.CV 57%

AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization

AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿

Shaoqiu Zhang, Zizhong Ding, Kaicheng Yang, Junyi Wu, Xianglong Yan, Xi Li, Bingnan Duan, Jianping Fang, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。

Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09268 2026-02-11 cs.CV 57%

Rethinking Global Text Conditioning in Diffusion Transformers

重新思考扩散变换器中的全局文本条件化

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。

Comments Accepted at ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20240 2026-02-11 cs.CV 57%

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

无条件先验很重要!改进细调扩散模型的条件生成

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。

Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17616 2026-02-10 cs.CV 57%

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

通过谱约束的长跳连接实现稳定高效的扩散变换器

Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01723 2026-02-03 cs.CV 57%

FastPhysGS: Accelerating Physics-based Dynamic 3DGS Simulation via Interior Completion and Adaptive Optimization

FastPhysGS: 通过内部补全与自适应优化加速基于物理的动态3DGS仿真

Yikun Ma, Yiqing Li, Jingwen Ye, Zhongkai Wu, Weidong Zhang, Lin Gao, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学智能系统工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Guangdong Provincial Key Laboratory of Fire Science(广东省消防科学与智能应急技术重点实验室) Guangdong Provincial Key Laboratory of Robotics(广东省机器人与数字智能制造技术重点实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FastPhysGS通过内部补全与自适应优化,实现了基于物理的动态3DGS仿真的高效与稳健,提升了仿真精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01340 2026-02-03 cs.CV 57%

MTC-VAE: Multi-Level Temporal Compression with Content Awareness

MTC-VAE:具有内容意识的多级时间压缩

Yubo Dong, Linchao Zhu

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MTC-VAE通过多级时间压缩技术提升视频压缩效率,结合内容意识方法实现高效压缩与性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01329 2026-02-03 cs.CV 57%

FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching

FlowCast: 为可扩展的零成本推测性流匹配进行轨迹预测

Divya Jyoti Bajpai, Shubham Agarwal, Apoorv Saxena, Kuldeep Kulkarni, Subrata Mitra, Manjesh Kumar Hanawal

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of California, Berkeley(加州大学伯克利分校) Inception Labs(Inception实验室) Adobe Research India(Adobe印度研究)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FlowCast通过利用流匹配模型保持恒定速度的特性,实现无需训练的高效推理,提升图像生成等任务的速度2.5倍,同时保持质量。

Comments Accepted at International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00440 2026-02-03 cs.CV cs.LG cs.RO 57%

DISK: Dynamic Inference SKipping for World Models

DISK:用于世界模型的动态推理跳过

Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang

机构 * Purdue University, West Lafayette, United States(普渡大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DISK通过动态推理跳过技术,在无需训练的情况下提升自回归世界模型的视频和轨迹预测效率,同时保持预测精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16272 2026-01-30 cs.CV 57%

GR3EN: Generative Relighting for 3D Environments

GR3EN: 生成式3D环境光照

Xiaoyan Xing, Philipp Henzler, Junhwa Hur, Runze Li, Jonathan T. Barron, Pratul P. Srinivasan, Dor Verbin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Amsterdam(阿姆斯特丹大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 GR3EN通过将视频到视频扩散模型输出蒸馏到3D重建中,实现对房间尺度场景的可控3D光照调整,无需解决逆渲染问题,适用于复杂现实场景。

Comments project page: https://gr3en-relight.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20857 2026-01-29 cs.CV 57%

FreeFix: Boosting 3D Gaussian Splatting via Fine-Tuning-Free Diffusion Models

FreeFix: 通过无微调扩散模型提升3D高斯散射

Hongyu Zhou, Zisen Shao, Sheng Miao, Pan Wang, Dongfeng Bai, Bingbing Liu, Yiyi Liao

机构 * Zhejiang University(浙江大学) University of Maryland, College Park(马里兰大学学院 park 分校) Huawei(华为)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FreeFix通过无微调扩散模型提升3D高斯散射,实现高质量视图合成与强泛化能力。

Comments Our project page is at https://xdimlab.github.io/freefix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05150 2026-01-29 cs.CV 57%

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: 在大模型上实现一步生成的自对抗流

Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin

机构 * Inclusion AI Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。

Comments arxiv v1, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11497 2026-01-29 cs.CV 57%

QVGen: Pushing the Limit of Quantized Video Generative Models

QVGen:推动量化视频生成模型的极限

Yushi Huang, Ruihao Gong, Jing Liu, Yifu Ding, Chengtao Lv, Haotong Qin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港理工大学) Beihang University(北京航空航天大学) SenseTime Research(商汤科技研究院) Monash University(墨尔本大学) Nanyang Technological University(南洋理工大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 QVGen通过量化感知训练框架在极低比特下实现高性能视频生成模型,首次达到全精度质量并优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08931 2026-01-28 cs.CV cs.AI cs.LG 57%

Astra: General Interactive World Model with Autoregressive Denoising

Astra:通用交互世界模型与自回归去噪

Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, Yuan Gao, Xin Tao, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 Astra提出了一种通用交互世界模型,通过自回归去噪和动作感知适配器实现长周期视频预测与多样化交互。

Comments Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16984 2026-01-27 cs.CV 57%

HiCache: A Plug-in Scaled-Hermite Upgrade for Taylor-Style Cache-then-Forecast Diffusion Acceleration

HiCache: 一种基于赫尔米特多项式的插件式泰勒风格缓存加速框架

Liang Feng, Shikang Zheng, Jiacheng Liu, Yuqi Lin, Qinming Zhou, Peiliang Cai, Xinyu Wang, Junjie Chen, Chang Zou, Yue Ma, Linfeng Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 HiCache通过基于赫尔米特多项式的插件式方法,提升扩散模型的推理速度和预测精度,实现5.55倍的加速并保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14172 2026-01-26 eess.IV 57%

TaQ-DiT: Time-aware Quantization for Diffusion Transformers

TaQ-DiT: 时感知量化用于扩散变换器

Xinyan Liu, Huihong Shi, Yang Xu, Zhongfeng Wang

专题命中 视频扩散模型 :video generation(abstract);分类 eess.IV

AI总结 TaQ-DiT通过引入时感知量化方法,解决扩散变换器中权重和激活的非收敛问题及不同层的量化敏感性差异,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23494 2026-01-23 cs.CV cs.GR 57%

Yesnt: Are Diffusion Relighting Models Ready for Capture Stage Compositing? A Hybrid Alternative to Bridge the Gap

Yesnt:扩散重照明模型是否准备好用于捕获阶段合成?一种混合方法用于弥合差距

Elisabeth Jüttner, Janelle Pfeifer, Leona Krath, Stefan Korfhage, Hannah Dröge, Matthias B. Hullin, Markus Plack

机构 * University of Bonn(波恩大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种混合重照明框架,结合扩散先验与物理约束,实现更稳定的视频重照明效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15221 2026-01-22 cs.CV 57%

ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation

ScenDi: 3D到2D场景扩散级联用于城市生成

Hanlei Guo, Jiahao Shao, Xinya Chen, Xiyang Tan, Sheng Miao, Yujun Shen, Yiyi Liao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ScenDi通过整合3D和2D扩散模型,解决3D城市生成中外观细节与相机可控性的平衡问题,实现高质量场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14255 2026-01-21 cs.CV cs.AI 57%

VideoMaMa: Mask-Guided Video Matting via Generative Prior

VideoMaMa: 通过生成先验进行掩码引导的视频磨皮

Sangbeom Lim, Seoung Wug Oh, Jiahui Huang, Heeji Yoon, Seungryong Kim, Joon-Young Lee

机构 * Korea University(韩国大学) Adobe Research(Adobe研究) KAIST AI(韩国科学技术院人工智能)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VideoMaMa通过生成先验和分割提示,实现从粗糙掩码到精确磨皮的转换,并构建大规模伪标签数据集提升视频磨皮研究

Comments Project page: https://cvlab-kaist.github.io/VideoMaMa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06803 2026-01-15 cs.CV 57%

DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation

DyDiT++: 带时间步和空间动态的扩散变换器用于高效的视觉生成

Wangbo Zhao, Yizeng Han, Jiasheng Tang, Kai Wang, Hao Luo, Yibing Song, Gao Huang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 DyDiT++通过动态调整时间步和空间计算,提升视觉生成效率,减少计算成本并拓展应用范围。

Comments This paper was accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) on January 9, 2026. arXiv admin note: substantial text overlap with arXiv:2410.03456

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07396 2026-01-13 cs.CV 57%

Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers

预测主成分,稳定残差:面向高效扩散变换器的子空间感知特征缓存

Guantao Chen, Shikang Zheng, Yuqi Lin, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) South China University of Technology(华南理工大学) Jilin University(吉林大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出SVD-Cache方法,通过子空间感知的特征缓存技术提升扩散变换器的推理效率,实现近无损效果并支持多种加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03178 2026-01-07 cs.CV 57%

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成

Jiajun jiao, Haowei Zhu, Puyuan Yang, Jianghui Wang, Ji Liu, Ziqiong Liu, Dong Li, Yuejian Fang, Junhai Yong, Bin Wang, Emad Barsoum

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02646 2026-01-07 cs.CV cs.AI 57%

DreamLoop: Controllable Cinemagraph Generation from a Single Photograph

DreamLoop:从单张照片生成可控的cinemagraph

Aniruddha Mahapatra, Long Mai, Cusuh Ham, Feng Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DreamLoop通过训练视频扩散模型实现从单张照片生成可控cinemagraph,提供灵活的运动路径控制,生成高质量且符合用户意图的动画。

Comments Project Page: https://anime26398.github.io/dreamloop.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01914 2026-01-06 cs.CV 57%

Learning Action Hierarchies via Hybrid Geometric Diffusion

通过混合几何扩散学习动作层次结构

Arjun Ramesh Kaushik, Nalini K. Ratha, Venu Govindaraju

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

AI总结 本文提出HybridTAS框架,通过混合欧几里得和双曲几何提升时间动作分割的层次结构建模能力,实验表明其在多个数据集上达到最优性能。

Comments Accepted at WACV-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23983 2026-01-01 cs.CV 57%

DriveExplorer: Images-Only Decoupled 4D Reconstruction with Progressive Restoration for Driving View Extrapolation

DriveExplorer: 基于图像的解耦4D重建与渐进修复用于驾驶视角外推

Yuang Jia, Jinlong Wang, Jiayi Zhao, Chunlam Li, Shunzhou Wang, Wei Gao

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省级超高清沉浸媒体技术重点实验室) School of Electronic and Computer Engineering(电子与计算机工程学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DriveExplorer通过图像解耦和渐进修复实现驾驶视角外推,利用4D高斯框架和扩散模型提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03119 2026-01-01 cs.CV 57%

Controllable Human-centric Keyframe Interpolation with Generative Prior

可控的人本关键帧插值与生成先验

Zujin Guo, Size Wu, Zhongang Cai, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。

Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21905 2025-12-29 cs.CV 57%

High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer

高保真长时长人类图像动画

Shen Zheng, Jiaran Cai, Yuansheng Guan, Shenneng Huang, Xingpei Ma, Junjie Cao, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang, Xiao-Ping Zhang

机构 * Guangzhou Quwan Network Technology(广州 quirwan 网络技术公司) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出基于扩散变压器的框架,通过混合引导信号和位置移适应模块,实现高保真长时长人类图像动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 57%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16900 2025-12-19 cs.CV 57%

FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction

FlashPortrait: 6倍更快的无限人物动画生成

Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Kai Qiu, Chong Luo, Zuxuan Wu

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tencent Inc.(腾讯公司) Tongyi Lab, Alibaba Group(阿里云通义实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FlashPortrait通过归一化面部表情块和动态滑动窗口方案,实现6倍加速的无限长人物动画生成,保持身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16023 2025-12-19 cs.CV 57%

CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion

CoVAR: 通过多模态扩散生成视频与动作用于机器人操作

Liudi Yang, Yang Bai, George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06833 2025-12-19 cs.CV 57%

ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search

ConsistTalk: 可控强度的时序一致说话头生成与扩散噪声搜索

Zhenjie Liu, Jianzhang Lu, Renjie Lu, Cong Liang, Shangfei Wang

机构 * The corresponding author.(通讯作者)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ConsistTalk通过引入光流引导时间模块、音频到强度模型和扩散噪声初始化策略,实现了可控强度和时序一致的说话头生成,有效减少闪烁并提升音频视频同步质量。

Comments AAAI26 poster

详情

展开后加载摘要…

URL PDF HTML 收藏