TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI
TRINE: 一种面向多模态AI的令牌感知、运行时自适应FPGA推理引擎
机构 * University of California, Irvine(加州大学尔湾分校) ; Purdue University Northwest(北达科他州立大学) ; Qualcomm(高通) ; Samsung(三星)
AI总结 针对多模态AI中不同计算/内存模式导致嵌入式平台实时性不足的问题,提出TRINE,一种无需重配置的单比特流FPGA加速器与编译器,通过统一层映射、运行时模式切换、令牌剪枝和依赖感知层卸载,实现端到端多模态推理,在Alveo U50和ZCU104上相比RTX 4090和Jetson Orin Nano分别降低延迟22.57倍和6.86倍,功耗仅20-21W。
Comments Accepted to DAC 2026