论文导读
中国科学技术大学与微软亚洲研究院提出PULSE,把学习型图像压缩的解码端压缩到5.2 kMAC/像素,并用整数线性CDF预测器实现跨平台逐比特一致的熵编码。论文测试中,单线程CPU解码一张1080p图像耗时126毫秒;该数字依赖具体硬件、图像和编码设置。
神经压缩效果进步了,CPU成本却一直是门槛
学习型编解码器可以根据数据优化率失真表现,但很多方案依赖复杂卷积、注意力和自回归熵模型。在服务器GPU上,这些计算尚可接受;到了手机、笔记本或边缘设备,解码延迟与内存就可能抵消压缩率优势。PULSE把优化重点放在接收端,因为一张图片只编码一次,却可能被大量不同设备解码。
图1:论文展示的压缩重建视觉对比。
它的神经接收器复杂度只有5.2 kMAC/像素,通过轻量分析/合成变换和超先验保留必要的信息流。为了让不同CPU和GPU得到完全相同的码流,团队没有依赖容易受浮点误差影响的复杂概率网络,而是用整数线性CDF预测器和meta prior完成熵编码。
把极低算力预算变成架构搜索的硬约束
接收器越轻,压缩质量越容易下降。团队引入由启发式探针引导的“智能体进化”过程,让人和大模型迭代修改架构,再用实验反馈淘汰无效设计。最终框架把分析变换、熵编码和合成变换拆开,重点压缩解码侧,同时保留可跨平台复现的概率计算。
图2:PULSE使用轻量神经解码器、两步熵模型与整数CDF预测。
这种方法的价值不只在“AI设计AI”。真正可核验的是严格预算下得到的结构与实测:PULSE-S、PULSE和感知优化版本覆盖不同复杂度与视觉质量,代码也由微软GenCodec仓库公开,便于复现实验。
下一步:让神经压缩真正进入普通终端
论文汇总图显示,PULSE在手机、笔记本和服务器上都能进行逐比特一致的熵编码。核心结果是在测试平台上,单线程CPU解码1080p图像耗时126毫秒,压缩性能与传统HM相当;经过感知优化后,PULSE还能与更大的感知编解码器竞争。
图3:三类平台的1080p编解码耗时及率失真对比。
126毫秒不能直接换算成所有设备上的固定帧率,批量、线程数、图片内容和实现优化都会影响速度。论文讨论的是静态图像,也不是视频实时编解码。即便如此,它说明学习型压缩不必永远绑定高端GPU:如果把低复杂度与位精确实现作为一开始的设计目标,神经编解码器可以更接近普通终端的实际部署。真正落地还要比较启动内存、能耗、移动端温升和不同指令集表现,并验证编码器升级后旧设备能否长期稳定解码同一码流。
只有纳入完整端到端成本,126毫秒才会转化为真实体验优势。
参考资料
https://arxiv.org/abs/2609.18602