香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%,主要瓶颈落在精确编辑3D世界。
过去的文字生成3D评测多是单个物体或简单场景,输入和答案相对固定。开放世界请求可能同时要求“中央公园、移除末端两棵树、增加环形步道”,智能体既要找到合适资产,又要理解数量、方位、碰撞和整体风格,最后还要确认场景能够交互。
智能体在Blender沙盒里反复观察和修改
VibeWorlding将资产检索、添加、删除、旋转、缩放和多视角渲染封装成MCP工具。模型先规划场景,再调用工具实际改变3D环境;渲染反馈返回后,它可以检查物体是否遮挡、布局是否符合描述,并继续多轮修正。
VibeWorlding从用户查询出发,经过工具调用、渲染观察和反思生成3D世界。
最终产物不是一张看起来像3D的图片,而是带独立资产和空间关系的可编辑场景。用户可以继续移动物体或进入仿真。系统目前依赖沙盒提供的既定工具与资产库,无法凭空获得库中不存在的精细模型。
2616个资产和323个种子世界组成评测底座
团队构建VWE-Bench,包含2616个高质量3D资产、323个人工标注种子世界和6828条反向合成的多模态查询。部分任务有明确真值,另一部分由细分评分规则检查物理可行性与意图满足程度。
VWE-Bench样例展示多种资产、种子世界和用户编辑请求。
评测不仅看最终渲染图相似度,还检查高度、碰撞、生态合理性、3D理解、资产检索和空间推理。这样可以区分模型是选错了物体、放错了位置,还是整体场景虽好看却无法满足用户指定条件。
前沿模型仍卡在精确3D编辑
论文报告,GPT-5.5和Qwen3.8-Max等前沿模型成功率均低于60%。按能力拆分后,精确修改位置、尺寸和结构比提出大致布局更困难。多轮反思能修复部分问题,也会出现反复调整同一物体、破坏已经正确区域的情况。
不同模型在VWE-Bench各能力维度上的结果对比。
团队还构建VibeWorlding-Gym,用规则与多模态评估结合的奖励训练开放模型。论文称8B版本可接近前沿模型,30B-A3B版本在其评测中取得最高总体Pass@1。这是同一工具沙盒和基准下的结果,不等于对任意3D软件都具备相同能力。
低于60%的成功率揭示了工具型智能体的组合难题。模型可能正确理解“一圈树”,却选错资产;也可能资产无误,但坐标和尺度让树木互相穿插。每一步单独看都像合理操作,累积后却无法满足最终要求。VWE-Bench把高度、碰撞、资产匹配和空间关系拆开评分,因此能指出失败究竟发生在哪一层。
训练专用模型带来的提升也说明,熟悉工具协议本身就是一种能力。通用前沿模型拥有更广知识,却未必见过特定Blender操作的反馈规律;VibeWorlder在同一沙盒中反复学习动作与渲染结果的对应关系,更容易形成稳定策略。不过一旦换成Unreal、Unity或企业内部资产系统,接口和反馈分布变化,仍需重新验证。
项目开放了基准与训练环境,便于复现实验,但用户生成的复杂需求可能超出固定评分规则。例如“更有未来感”没有唯一空间真值,审美偏好也难用碰撞检测衡量。因此确定性约束和主观质量最好分开:前者由几何规则检查,后者保留给用户选择与多轮修改。
一个场景构建案例展示智能体多轮调用工具和修正布局。
从游戏原型扩展到空间设计助手
VibeWorlding适合快速制作游戏关卡、教育仿真和空间方案草稿。相比一次生成完整场景,智能体式流程保留了每个工具操作,设计者能够回退、替换资产并检查失败发生在哪一步。
下一步需要接入更丰富的建模工具、材质和物理属性,同时缩短多轮渲染成本。若能让用户直接修改中间计划,并把尺寸、碰撞和安全规范转成确定性检查,它更可能成为设计软件中的协作助手,而不是只展示一次成功案例的生成Demo。
参考资料
https://arxiv.org/abs/2608.15265