Audio-Visual Cross-Modal Compression for Generative Face Video Coding
音频-视觉跨模态压缩用于生成式面部视频编码
专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM
AI总结 本文提出AVCC框架,通过联合压缩音频和视频流,提升生成式面部视频编码的率-失真性能。
Comments Accepted as a PAPER and for publication in the DCC 2026 proceedings