论文导读
深圳大学、中国科学院深圳先进技术研究院、中国科学院大学和中国铁塔推出ReFigBench,让多模态编码智能体把1000张真实arXiv概览图重建成可编辑PPT。实验覆盖10种模型与工作流配置:专用流程常让截图更像原图,却在所有配置中抹掉原生连接器,暴露“视觉保真”与“真正可编辑”的冲突。
截图看起来像,不代表PPT内部结构正确
把论文图交给AI重做,最简单的方法是把原图整张贴进幻灯片。外观几乎完全一致,却没有任何可编辑价值。真正的任务要求文字仍是文本框、形状能单独移动、箭头保持连接关系、层级和布局也接近原图。它同时考验视觉理解、代码规划和PPT文件结构。
图1:生成结果可能外观接近,但内部连接或对象关系已经错误。
现有智能体评测常只看工具调用轨迹或最终截图。如果分数低,很难判断是模型没看懂图片、规划错误,还是周围的执行框架在渲染和文件处理时拖了后腿。ReFigBench把模型外的工具、上下文管理和执行环境统称为harness,并单独比较它的影响。
1000张真实论文图,模型和工作流组合成10种配置
基准从arXiv论文中检索1000张带完整来源的概览图。四个模型家族分别使用直接代码生成和专用PPTX流程;最强模型还放进两个商业harness中,合计10种配置。输出先经过文件有效性、渲染和对象结构等确定性检查,再由两类评判模型重复评分,并加入盲评人工比较。
图2:模型生成PPTX后,同时接受确定性检查、自动量表和人工盲评。
结果显示,视觉感知仍是主要瓶颈,反复渲染只能部分弥补。更值得注意的是,同一模型使用专用流程,在一个harness里得分提高,在另一个里反而下降;即使提示词相同,换执行框架也会改变结果。因此不能把模型名称当作唯一变量。
下一步:让文档智能体同时通过视觉与结构验收
专用工作流生成的幻灯片在多数人工对比中更受偏好,说明它确实改善了外观。但它在所有测试配置中都消除了原生连接器:线条可能被画成普通形状,或方向、锚点和拓扑关系错误。图中一个向后的箭头,截图上或许只差一点,编辑时却无法跟随节点移动。
图3:重建PPT中箭头方向错误被明确标出。
ReFigBench只针对科学概览图,不能代表AI制作所有演示文稿的能力。它提出的验收原则却很通用:文档智能体的产物不能只用截图评估,还要检查文件能否打开、文本与形状是否原生、连接关系是否保留。对实际用户而言,“更像”与“更好编辑”需要同时量化,而不是二选一。下一步还应加入字体替换、跨软件兼容、重新排版和协作编辑测试,让生成文件在PowerPoint、Keynote或在线办公套件中继续可用。