Audio-Visual Cross-Modal Compression for Generative Face Video Coding
音频-视觉跨模态压缩用于生成式面部视频编码
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.MM
AI总结 本文提出AVCC框架,通过联合压缩音频和视频流,提升生成式面部视频编码的率-失真性能。
Comments Accepted as a PAPER and for publication in the DCC 2026 proceedings