腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。
论文图1:同一框架处理3D理解、文本生成、局部编辑和部件生成。
四个任务共享一个3D语言模型
以往3D系统常把理解、生成和编辑拆成不同模型。Buffalo以Hunyuan3D-VLM处理语义、结构和空间关系,再把这些条件交给Hunyuan3D DiT生成几何。编辑时还会输入原物体表示,目标是保留未被指令涉及的区域。
这种统一并非把四个接口简单并排。3D理解产生的语义条件会参与生成;文本生成训练也会影响编辑。论文的一个实验只增加1000个“鸡”相关文本到3D样本,没有加入新的编辑数据,模型随后能完成“把物体头部换成鸡头”的编辑指令。
论文图4:Nano3D-v2生成的指令编辑配对,同时保留原物体和编辑结果。
1200万编辑配对由数据流水线扩出来
3D编辑数据比图文配对更难收集:改动后要符合指令,还要保持几何一致,未编辑区域不能一起漂移。团队用Nano3D-v2构造编辑对,先选择可编辑部件、生成指令,再产生修改后的3D对象,并把失败或结构不一致的样本过滤掉。
论文图2:文本到3D语料经过资产清洗、几何处理和多层描述生成。
8700万条语料中,文本到3D配对占比最大。论文为每个资产生成六层描述,从简短类别名到包含结构、材质和部件关系的详细文字,让模型同时学习粗粒度语义和局部属性。
成绩来自论文基准,距离产品仍有一段
作者报告Buffalo在文本到3D和3D编辑基准上取得领先或接近最佳的成绩,也给出了多轮编辑、部件生成和形状编辑案例。视觉结果显示,模型能在改变指定结构时保留更多原始外形。
论文图9:不同方法按同一指令修改3D形状,Buffalo强调编辑响应与前后几何一致性。
这些结果由作者团队在自选基准和案例中报告。论文没有证明模型已能稳定处理任意复杂拓扑,也没有给出在线产品的速度、价格或开放范围。Buffalo目前更适合被理解为统一3D建模路线的一次研究验证。