TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Accepted to AAAI 2026. Camera-ready version
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Accepted to AAAI 2026. Camera-ready version
机构 * HKUST(香港科技大学) ; NTU(国立台湾大学) ; SYSU(南方科技大学) ; NUS(国立新加坡大学) ; Alibaba Group(阿里巴巴集团)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.CV
Comments Project Page: https://livioni.github.io/OmniVGGT-official/