LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models
LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标
机构 * Soongsil University(崇实大学) ; Chung-Ang University(中央大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.LG
AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。
Comments Accepted to EMNLP 2026 (Main Conference). Code and benchmark: https://github.com/cau-hai-lab/LIBERO-Para