SketchVLM: Vision language models can annotate images to explain thoughts and guide users
SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户
机构 * Auburn University(阿伯拉罕大学) ; Adobe Research(Adobe研究)
AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。
Comments Accepted at EMNLP 2026 (Main Conference)