TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI
Comments Accepted to AAAI 2026. Camera-ready version