MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents
MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽
机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO、cs.AI
AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。
Comments Accepted as main conference paper at ACL 2026