发表机构
Sun Yat-sen University(中山大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
DrawingsDreamer提出统一LLM驱动的多视图工程图纸生成框架,通过序列建模和层次化后缀标记化,实现高几何保真度与句法准确性的条件及无条件生成。
AI 中文摘要
可缩放矢量图形(SVG)对于现代工业计算机辅助设计(CAD)至关重要。然而,现有的自回归SVG生成模型主要针对艺术创作而设计,难以维持工程图纸所需的严格几何保真度和跨视图空间对齐。为弥合这一差距,我们提出了DrawingsDreamer,一种由大型语言模型(LLM)驱动的统一框架,用于多视图基于矢量的工程图纸生成。通过将多视图工程图纸的生成纯粹表述为序列建模任务,我们消除了对光栅图像编码器的需求。我们提出了一种利用层次化后缀标记化的流线型表示方法,该方法引导模型在分配语义边界之前建立局部几何坐标。通过渐进式任务感知课程调度进行优化,DrawingsDreamer在统一模型中有效地从局部结构修复过渡到宏观生成。大量实验表明,我们的统一模型在各种条件和非条件生成任务中,在几何保真度和句法准确性方面均取得了强劲性能。
英文摘要
Scalable Vector Graphics (SVG) are essential for modern industrial Computer-Aided Design (CAD). However, existing autoregressive SVG generation models are predominantly tailored for artistic creation and struggle to maintain the rigorous geometric fidelity and cross-view spatial alignment required for engineering drawings. To bridge this gap, we introduce \textbf{DrawingsDreamer}, a unified Large Language Model (LLM)-driven framework for multi-view vector-based engineering drawings generation. By formulating the generation of multi-view engineering drawings purely as a sequence modeling task, we eliminate the need of raster image encoders. We propose a Streamlined Representation utilizing hierarchical postfix tokenization, which guides the model to establish local geometric coordinates before assigning semantic boundaries. Optimized via a progressive task-aware curriculum schedule, \textbf{DrawingsDreamer} effectively transitions from localized structural repair to macroscopic generation in a unified model. Extensive experiments demonstrate that our unified model achieves strong performance in both geometric fidelity and syntactic accuracy across diverse conditional and unconditional generation tasks.