Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos
用于从视频理解复杂装配动作的组合上下文微调视觉语言模型
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; The University of Auckland(奥克兰大学)
专题命中 指令微调 :language model(title,abstract);LLM(comments)
AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。
Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly