AI 中文总结
本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。
AI 中文摘要
健身动作质量评估(AQA)对智能体育训练十分重要,但多模态大语言模型(MLLMs)在该场景下的能力仍未得到充分探索。现有基准依赖于动作特定的标注方案,且主要关注最终评估输出,难以深入了解模型如何评估动作质量。我们推出FitAQA,这是一个用于评估MLLMs在健身AQA任务中的系统性基准,包含2219个视频和5512个问答实例,覆盖30种自重训练动作。我们与体育科学专家合作,开发了统一的动作错误分类体系,定义了6个互补质量维度(对齐、对称、稳定、协调、节奏、完整性)中的38种常见动作错误,该分类体系为不同动作提供了共享评估框架。FitAQA进一步设计了三项评估任务:感知任务用于识别相关视觉证据,判断任务用于结合该证据与领域知识评估动作执行正确性,时间定位任务用于随时间定位动作错误。大量评估表明,当前MLLMs仍难以全面评估动作质量并精确定位动作错误。控制实验进一步显示,视觉感知是关键瓶颈,当提供真实感知证据时,判断性能会显著提升。该数据集和评估代码将公开可用。
英文摘要
Fitness Action Quality Assessment (AQA) is important for intelligent sports training, yet the capabilities of Multimodal Large Language Models (MLLMs) in this setting remain underexplored. Existing benchmarks rely on action-specific annotation schemes and focus primarily on final assessment outputs, offering limited insight into how models assess exercise quality. We introduce FitAQA, a systematic benchmark for evaluating MLLMs in fitness AQA, containing 2,219 videos and 5,512 QA instances across 30 bodyweight exercises. In collaboration with experts in sports science, we develop a unified form error taxonomy that defines 38 recurring form errors within six complementary quality dimensions: alignment, symmetry, stability, coordination, tempo, and completeness. This taxonomy provides a shared assessment framework across different exercises. FitAQA further formulates three evaluation tasks: perception for recognizing relevant visual evidence, judgement for combining that evidence with domain knowledge to assess execution correctness, and temporal grounding for localizing form errors over time. Extensive evaluation shows that current MLLMs still struggle to assess exercise quality comprehensively and localize form errors precisely. Controlled experiments further indicate that visual perception is a key bottleneck, as judgement performance improves substantially when ground-truth perceptual evidence is provided. The dataset is available at https://huggingface.co/datasets/Kelly0510/FitAQA.