Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning
面向LEGO空间物理推理的样本高效后训练
机构 * HKUST(GZ)(香港科技大学(广州)) ; CUHK(香港中文大学) ; ZODA
专题命中 视觉推理 :VLM(abstract);grounding(abstract);分类 cs.AI、cs.LG
AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。
Comments Technical Report V2, 20 pages, 7 figures, 9 tables