arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

浙江大学等提出Block3D,文生3D从25.71秒压到4.99秒

arXiv 2608.19567 cs · cs.CV

文本生成3D要么逐个预测形状Token,速度慢且前面出错后难以修正;要么反复更新完整3D表示,计算量随精度增加。浙江大学、加州大学伯克利分校、武汉大学等机构提出Block3D,把形状序列切成连续块,块之间自回归、块内并行去噪。

在TRELLIS-500K的100个留出对象上,Block3D把平均端到端生成时间从微调Cube基线的25.71秒降到4.99秒,提速5.15倍,同时在论文采用的几何指标上保持竞争力。

从逐个Token改成逐块生成

离散3D生成器会把网格压成一串形状代码。传统自回归方法一次决定一个代码,1024个位置就形成很长的串行链;代码一旦提交,后面只能在错误前缀上继续预测。

Block3D把1024个形状位置分为连续块。模型仍按从左到右的顺序提交各块,因此保留清晰的因果依赖;进入当前块后,所有位置可同时查看块内上下文并行去噪。串行步骤由Token数量降为块数量。

Block3D生成的多视角3D场景

项目页将多个生成资产组合进同一场景,并从不同视角渲染。

完成的前缀块会被冻结并缓存,后续不再重复计算。方法并未消除自回归暴露偏差:如果前一块整体错误,之后仍会受影响;它缩短的是顺序生成长度。

当前块提交前允许修正低置信度代码

并行填充块内位置虽然快,但多个位置可能互相依赖。Block3D使用置信度引导的块内修正:先把掩码位置填上候选代码,再重新检查已经填入但置信度较低的位置,在块冻结前替换它们。

每轮设置确定性的最小揭示配额,保证有限步数内所有掩码都会被移除。分类器自由引导负责提出候选,条件分支的概率决定是否接受,避免引导系数直接抬高阈值。

Block3D生成资产案例一

项目页视频帧展示了文本条件下生成的独立3D资产。

这种修正只发生在当前块。已经提交的前缀不会重新打开,因此计算量受控,也意味着全局结构错误不能无限回滚。

4.99秒成绩来自固定硬件与协议

实验在100个留出对象上比较几何距离、文本对齐和延迟。Block3D平均端到端时间为4.99秒,微调后的Cube基线为25.71秒。5.15倍是两者在论文配置中的比值,不是对全部文生3D系统的统一加速倍数。

Block3D生成资产案例二

同一生成流程可输出不同类别和几何结构的网格资产。

延迟会受GPU、块大小、去噪步数、解码器和网格复杂度影响。论文使用固定长度的Cube形状表示,其他3D表示若Token数量和解码方式不同,不能直接套用4.99秒。

定性比较中,Block3D在多组前后视图上保持了完整结构,部分基线出现缺面或畸变。作者也明确指出,结果限于选定数据和指标,尚未用大规模人工偏好证明所有生成物在视觉上更好。

应用与下一步:面向可编辑资产和低延迟3D流水线

分块结构天然提供局部编辑入口。给定已有前缀,系统可以只处理受影响的当前区域;结合边界框条件后,还可能控制资产尺寸和局部形状。项目页展示的网格可进入Blender等常见工具继续处理。

Block3D生成资产案例三

项目帧显示生成网格的细节和多视角一致性。

游戏原型、影视预演和机器人仿真需要快速生成大量候选资产,5秒级研究结果比几十秒更接近交互式迭代。但从单个物体到可直接使用的生产资产,还涉及拓扑、材质、碰撞体和版权审核。

下一步可以研究动态块大小和跨块回滚:简单区域用大块提速,细节区域用小块并允许有限修正。这样才能在速度、全局一致性和局部几何之间取得更细的平衡。

还需要补充跨数据集和不同显卡的公开测试,把编码、生成、网格解码分别计时。只有拆开端到端的4.99秒,开发者才能判断瓶颈来自模型计算还是资产后处理,并评估批量生成时的吞吐变化。

参考资料

https://arxiv.org/abs/2608.19567

https://alexandertsui.github.io/block3d/