论文导读
清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院联合提出实用隐式神经图像编解码器PIC,用一次前向计算准备全部网络信息,把编码速度做到20 FPS,并用优化解码器达到2000 FPS。论文称其在相近率失真表现下超过JPEG解码速度。速度来自作者实现和指定硬件环境,不能直接当作所有设备上的通用成绩。
神经压缩画质能打,编码却常常太慢
隐式神经表示可以把一张图存成小型网络或紧凑参数,解码时按像素位置还原颜色。它的解码计算有机会很轻,但传统做法往往要针对每张图片反复优化网络,编码一张图就要迭代许多轮。对相册、网页和实时媒体链路来说,编码端等不起。
PIC把这一步改成前馈编码:输入图片只通过一次网络,就得到重建所需的多层潜在信息。潜在块经过离散余弦变换、量化、零点移除和Huffman编码,网络权重也一起压进码流。解码端再逆向恢复这些信息并合成图片。
图1:论文Figure 1展示潜在编码、DCT量化、Huffman码流与轻量解码合成的完整数据路径。
把解码器当作图像表示的一部分
常见学习式压缩模型会让编码器和解码器都很重。PIC让主要计算留在编码侧,并把解码网络设计成能直接充当图像表示的结构。不同分辨率的潜在特征被切成8×8小块后连接、压缩,解码时按层恢复,再用调制信息控制合成网络。
这套设计追求三项同时成立:编码足够快、解码比传统格式更快、画质与码率不能明显掉队。单看2000 FPS没有意义,若文件大很多或画质差很多,速度就失去比较基础。因此论文同时报告率失真曲线和运行时间。
20 FPS编码与2000 FPS解码
作者实现达到20 FPS编码和2000 FPS解码。按单张处理换算,解码进入亚毫秒量级;在论文给出的相近率失真区间,解码速度超过JPEG。速度图还把PIC与多种学习式或隐式表示方案放在同一坐标中,展示快速端的差距。
图2:论文运行时间图比较多种压缩方法的编码和解码耗时,PIC位于高速区域。
图3:论文率失真曲线在不同码率下比较重建质量,避免只用速度评价压缩器。
这里的FPS依赖论文使用的GPU、实现优化、图片大小和批处理方式;JPEG在CPU、专用硬件和浏览器中的成熟优化也不能被一项实验概括。PIC证明的是学习式编码器可以把三项指标推进到更实用的组合,并非已经替代所有JPEG部署。
下一步要面对真实格式生态
压缩算法进入产品,需要的不只是论文模型。码流要有稳定规范,旧版本解码器要能读取新文件,还要处理任意分辨率、色彩空间、元数据和损坏恢复。移动端功耗、内存占用与首张解码延迟也比峰值FPS更贴近用户体验。若PIC能在CPU、手机NPU或浏览器环境复现接近的画质与速度,并提供长期兼容的解码器,它才可能从研究代码变成可交换的图片格式。
参考资料
https://arxiv.org/abs/2609.09020