How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
视觉-语言模型距离构建现实世界还有多远?一个物理生成推理的基准测试
机构 * Salesforce AI Research(Salesforce 人工智能研究院)
AI总结 本文提出DreamHouse基准测试,评估视觉-语言模型在物理生成推理能力上的不足,通过住宅木构架建造领域验证模型在结构、施工可行性等约束下的生成能力。