论文导读
凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学和德州大学奥斯汀分校提出OASIS,让传感器附近的小编码器先提取任务信息再传输。特定视觉唤醒模型配置把数据量压到原始8比特图像的1/18816,系统能耗降低约2至4.5倍;部分芯片结果来自仿真与7纳米投影。
摄像头最浪费的可能是搬像素
许多低功耗视觉设备并不需要保存完整照片,只想知道画面里有没有人、手在哪里或眼睛朝哪看。传统流程仍会把高分辨率像素从传感器搬到处理器,通信和存储消耗可能超过真正的识别计算。感内计算希望在数据离开传感器前就做第一轮筛选,但紧邻CMOS传感器的逻辑芯片计算和内存都很紧。
论文图:传感器侧轻量编码器生成紧凑表示,再传给任务处理器或联想记忆分类器。
OASIS用小编码器输出与任务相关的潜在表示,并以任务、熵和重建目标一起训练。解码器只在训练时帮助保留信息,部署时不需要把图像还原出来。
两条路线适配不同任务
第一条路线保留空间结构,对潜在表示做4比特量化和霍夫曼编码,适合分类及手部、眼部跟踪等密集预测。概率更高的符号使用更短编码,让实际传输量随数据分布下降。
论文图:视觉唤醒与手部任务中的符号概率集中,可分别节省约60.82%和66.13%的编码位数。
第二条路线用基于Sobol的超维计算,把潜在表示映射成固定长度二进制超向量,再由联想记忆完成分类。它牺牲了还原完整空间图的能力,却能把分类所需信息压得更小,适合视觉唤醒这类输出简单的任务。
18816倍对应一个明确配置
在基于SwinViT的视觉唤醒模型中,3×3×8潜在表示映射为64维超向量。相比128维配置,通信再减少1.77倍,准确率损失不到1个百分点;与原始8比特图像传输相比,总压缩达到18816倍。
论文图:不同潜在维度与空间尺寸下的手部跟踪精度对比。
团队在AMD Xilinx Zynq UltraScale+ FPGA上实现数字近传感器流水线,并进行板级功耗测量;CIS与7纳米ASIC部分结合电路仿真和投影。视觉唤醒、手部跟踪和眼部跟踪中,系统总能耗降低约2至4.5倍,同时保持有竞争力的准确率。
论文图:不同压缩配置下的视觉唤醒测试准确率。
下一步落在常开摄像头
门铃、耳机、机器人和可穿戴设备都需要常开视觉,却受电池与隐私约束。只传任务表示还能减少完整图像离开传感器的机会。接下来应在真实集成芯片、不同光照和持续运行中验证功耗、温度与精度,并清楚区分实测和投影数字。只有任务切换时也能复用编码器,这条路线才会从单任务原型走向通用传感平台。