arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯把3D理解、生成和编辑塞进一个模型,训练数据达8700万

arXiv 2608.02711 cs.CV

腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。

Hunyuan3D-Buffalo的四类能力概览

论文图1:同一框架处理3D理解、文本生成、局部编辑和部件生成。

四个任务共享一个3D语言模型

以往3D系统常把理解、生成和编辑拆成不同模型。Buffalo以Hunyuan3D-VLM处理语义、结构和空间关系,再把这些条件交给Hunyuan3D DiT生成几何。编辑时还会输入原物体表示,目标是保留未被指令涉及的区域。

这种统一并非把四个接口简单并排。3D理解产生的语义条件会参与生成;文本生成训练也会影响编辑。论文的一个实验只增加1000个“鸡”相关文本到3D样本,没有加入新的编辑数据,模型随后能完成“把物体头部换成鸡头”的编辑指令。

Hunyuan3D-Buffalo的统一模型结构

论文图4:Nano3D-v2生成的指令编辑配对,同时保留原物体和编辑结果。

1200万编辑配对由数据流水线扩出来

3D编辑数据比图文配对更难收集:改动后要符合指令,还要保持几何一致,未编辑区域不能一起漂移。团队用Nano3D-v2构造编辑对,先选择可编辑部件、生成指令,再产生修改后的3D对象,并把失败或结构不一致的样本过滤掉。

文本到3D训练语料的构建流程

论文图2:文本到3D语料经过资产清洗、几何处理和多层描述生成。

8700万条语料中,文本到3D配对占比最大。论文为每个资产生成六层描述,从简短类别名到包含结构、材质和部件关系的详细文字,让模型同时学习粗粒度语义和局部属性。

成绩来自论文基准,距离产品仍有一段

作者报告Buffalo在文本到3D和3D编辑基准上取得领先或接近最佳的成绩,也给出了多轮编辑、部件生成和形状编辑案例。视觉结果显示,模型能在改变指定结构时保留更多原始外形。

Hunyuan3D-Buffalo与基线的形状编辑对比

论文图9:不同方法按同一指令修改3D形状,Buffalo强调编辑响应与前后几何一致性。

这些结果由作者团队在自选基准和案例中报告。论文没有证明模型已能稳定处理任意复杂拓扑,也没有给出在线产品的速度、价格或开放范围。Buffalo目前更适合被理解为统一3D建模路线的一次研究验证。

参考资料

https://arxiv.org/abs/2608.02711

https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/