arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

复旦、字节让AI边看工程图边修CAD代码,可执行率做到99.33%

作者:arXivDaily编辑部 arXiv 2608.24020 cs · cs.AI · cs.CV

从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。

CADExpert基准上,基于Qwen3.5-9B的IterCAD达到91.61%体积IoU、99.33%代码可执行率,平均Chamfer距离为0.5387。实验最多允许4轮修复,结果来自标准基准,不等同于复杂工业图纸已经可直接投产。

一次生成没有机会纠正前面的错

传统方案把三视图和尺寸一次性映射为完整代码。即使中间模型已经明显尺寸不对或布尔操作失败,系统也不会看到渲染结果。IterCAD把最终目标拆成状态序列:每轮都保留当前可执行代码与对应CAD形状,再与目标视图比较。

论文Figure 1:一次生成可能执行失败或几何错误,IterCAD检查中间状态后输出REVISE或STOP。

模型每轮输出思考、决策和代码。若形状已经满足目标,输出STOP;若仍有结构或参数偏差,输出REVISE和新代码。达到4轮上限也会终止,系统随后取最后一个有效CAD状态计算结果。

训练数据包含“该改”和“不该再改”

团队建立IterCAD-RS,从正确结构化CAD状态出发,注入一到两个几何扰动,制造仍可执行但尺寸、拓扑或边缘处理错误的中间状态。修复样本配有差异分析、REVISE决策和正确代码;已正确或语义等价的状态则配STOP。

论文Figure 2:初始代码生成、修复—停止监督学习和多轮强化学习依次训练完整策略。

第一阶段学习从工程图生成初稿,第二阶段学习针对中间状态修复或停止,第三阶段用GRPO优化完整多轮轨迹。奖励以最终几何质量为主,同时加入格式、语法和决策项,避免模型靠输出无效代码或过早停止取巧。

99.33%可执行率要和几何质量一起看

只要代码能运行,并不表示形状正确。论文同时报告IoU、平均与中位Chamfer距离、可执行率。IterCAD-Q3.5的IoU为91.61%,高于CME-CAD的80.71%;可执行率99.33%,CME-CAD为98.25%。

基于Qwen3-VL-8B的版本也达到85.10% IoU和97.31%可执行率。两个骨干都从多轮训练获益,说明改进不只来自更强基础模型。

论文实验图:两种骨干的IoU随轮次提升,累计停止比例逐轮接近100%,右侧对比单轮与多轮推理耗时。

消融里,Qwen3.5基础初始生成的IoU为57.42%;完整三阶段与多轮推理组合达到91.61%。只加入部分阶段有时会降低可执行率,说明“会修改”与“知道何时停止”必须一起训练。

从基准图纸走向工程验证

参数化CAD代码比点云或网格更适合继续编辑、尺寸检查和制造流程,IterCAD的中间状态也便于工程师审阅。它可以用于给草图生成初稿、修复常见参数错误,或在正式建模前提供候选构造顺序。

真实部署还要处理多零件装配、公差、材料、标准件和企业CAD内核差异。下一步应在未见过的复杂图纸上验证,并加入确定性的几何约束和单元测试,让模型的REVISE决策由可复核规则辅助,而不是只依赖视觉判断。

工程验证还需要把错误拆得更细。代码能执行但孔位、厚度或倒角不对,和脚本语法失败是两类问题;前者要靠尺寸约束与几何比较,后者可以由编译器直接定位。若每一轮都记录错误类型、修改范围和验证结果,工程师才能判断模型是在逐步收敛,还是反复改动已经正确的特征。

此外,四轮上限只是论文评测协议,不代表复杂零件的最佳交互次数。真实系统可以在低风险草稿阶段允许更多候选,但在进入制造前必须设置确定的停止条件:关键尺寸全部通过、布尔结构可重建、CAD内核无异常,并由人工确认装配与工艺约束。多轮生成的价值应体现在减少返工,而不是单纯增加模型调用次数。

参考资料

https://arxiv.org/abs/2608.24020

https://arxiv.org/html/2608.24020

https://arxiv.org/pdf/2608.24020