arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

百度牛津等推出Diagram-MMU:AI能看懂科研图,却很难把它画成可编辑代码

arXiv 2608.12262 cs.AI · cs.CV

多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求改图能力。

科研写作工具正在加入“截图生成LaTeX图”的功能。结果若只在外观上相似,却丢掉坐标、连线关系或图例,生成的代码很难继续编辑。传统视觉问答分数无法说明模型是否真的掌握图的结构。

三类任务覆盖从理解到重新绘制

Diagram-MMU设置图转代码解析、图转代码编辑和图表问答三类任务。解析要求模型把原图重建为可执行代码;编辑给出图与修改指令,检查模型能否只改变指定元素;问答则测试对节点、趋势、标注和空间关系的理解。

Diagram-MMU收录的复杂科研图表示例

Diagram-MMU收录的复杂科研图表示例。

每类任务还提供Agent设置,允许模型使用工具、运行代码并根据结果迭代。这样的流程更接近真实科研工作区:第一版代码不完美时,Agent可以编译、观察渲染差异,再修复线型、位置或文本。

3700张图跨越六个学科

数据集覆盖六个领域,共有3700张图、1.83万道人审问题。科研图不仅包含折线和柱状图,还包括流程、结构、节点关系和多面板组合。相同视觉元素在不同学科中可能有不同语义,模型需要理解标题、图例、标注和几何布局。

科研图与模型生成代码结果的对照

科研图与模型生成代码结果的对照。

问题经过人工验证,减少自动生成问答中常见的答案歧义。图转代码部分关注可执行表示,而非只让模型输出一段自然语言描述。代码一旦结构化,研究者才能继续移动节点、替换数据或统一论文样式。

可执行代码还暴露了视觉相似度看不到的问题。两张图表面接近,生成代码却可能把所有元素画成固定坐标,稍改标签就整体错位;结构良好的TikZ会保留节点、边和相对布局。基准由此检查模型是否产出真正可维护的科研资产。

12个模型会答题,却不一定会画图

团队评测12个多模态模型,发现图转代码解析和编辑显著难于图表问答。模型可能知道两条线相交,却无法生成正确坐标与绘制顺序;也可能完成整体重画,却在局部编辑时意外改变无关元素。

Diagram-MMU中的图表编辑任务及目标结果

Diagram-MMU中的图表编辑任务及目标结果。

Agent工具能提高多数模型的解析和编辑成绩,但在问答上反而出现下降,说明更长工具链会引入额外决策误差。论文报告Claude-4.6 Opus在三类Agent任务中都保持提升。该结论限定于此基准与当时测试版本,不能扩展成所有科研任务的综合排名。

另一类科研图的代码生成与视觉表现

另一类科研图的代码生成与视觉表现。

下一步让科研图真正可复用

Diagram-MMU可用于筛选科研写作Agent:模型不仅要看懂上传图片,还要输出能编译、可编辑、结构清楚的代码。论文团队、教育工具和无障碍系统都可以利用同一评测,分别检查图形复刻、按指令修改和内容问答。

后续若加入更多绘图库、三维图和超大复合图,还能测出工具调用在不同格式下是否稳定。基准已经把“看懂”和“重画”分开计分,使开发者能够定位问题究竟来自视觉理解、代码规划还是编译后的几何布局。

实际工作区还可以把编译错误、元素重叠和指令遵循分别记录。模型若能回答图中内容却无法生成代码,应补强结构解析;代码能运行但修改错对象,则要优化局部编辑与状态保持。Diagram-MMU提供的三任务划分正好对应这些不同修复方向。

科研协作还要求生成代码遵守模板规范,例如统一字体、线宽、颜色和图注位置。未来基准可以加入跨图风格迁移:先读取论文已有图形规范,再把新草图转换成同一套可编辑代码。这样才能检验模型是否既还原信息,又能融入真实排版流程。

参考资料

https://arxiv.org/abs/2608.12262

https://vi-ocean.github.io/projects/diagram-mmu