把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,API成本低于3美元,并在PosterBench上取得78.32分。
过去的“论文转海报”常被当成一次生成任务:模型读完PDF,输出一张图片或一段HTML,结果不好只能从头再来。AutoDesign把重点从单次提示词转向可持续优化的Design Harness,也就是围绕模型的一整套资料提取、设计、渲染、检查和返工机制。
不只生成海报,而是让整条设计流水线学会进步
AutoDesign的内层循环负责具体作品。系统先提取论文元数据、章节结构、关键结论和图表,设计Agent生成可编辑的HTML,再由规则校验器检查标题、密度、布局与资源引用,视觉评论模型查看渲染结果。没有通过验收的版本会收到局部反馈,修改后重新预览,最终保留得分最高且满足硬性规则的候选稿。
AutoDesign从论文输入到设计、校验和视觉评审的完整流程。
更关键的是外层循环。团队把上述流程本身写成可修改的Harness,由优化Agent阅读多次运行记录,每轮只调整一个功能组件,再到训练集和开发集上复测。只有训练表现提升且开发集不退步的修改才能被接受。模型参数没有变化,变强的是模型如何取证、何时调用工具、怎样检查成品的工作方式。
海报仍是可编辑网页,错误可以局部返工
不少多模态系统能输出“看上去像海报”的静态图,却很难继续改字、换图或修复某一栏。AutoDesign要求产物保留为可编辑HTML,论文中的图片和证据也继续与来源相连。视觉评论指出某个模块太挤时,Agent只重写对应代码,不必重新生成整张海报,减少一处修改破坏其他区域的概率。
AutoDesign生成的可编辑会议海报实例。
这套机制把审美评价与可执行约束分开:规则适合检查缺图、越界、文本溢出等明确问题,视觉模型负责信息层级、可读性和整体观感。二者共同形成验收门,而不是让一个模型既当设计师又给自己打分。人工也可以在外层循环中改变搜索方向,把偏好转化为下一轮可复用的工作流改动。
PosterBench 78.32分,七种配置平均提升12.4分
团队建立PosterBench,用100篇论文评估信息忠实度、覆盖度、密度、视觉证据、布局、可读性和美观度。主配置达到78.32分,比Claude Design高7.45分。把学到的Harness迁移到七种模型与编码Agent组合后,平均分从54.99升至67.39,提升12.4分,说明收益并非只绑定某一个模型。
AutoDesign在PosterBench上的流程优化轨迹与配置增益。
一次代表性任务中,系统进行了24轮外层优化;最终单篇海报约用40分钟、253次工具调用和11次有效编辑,成本低于3美元。这里的成绩来自固定论文集合、评测规则和指定模型配置,不能直接等同所有学科海报都能一次交付,但它让时间、成本和质量首次可以放在同一张账单上比较。
AutoDesign与多种设计Agent在人工偏好和成本上的比较。
下一步从会议海报扩展到整套学术传播物料
AutoDesign展示的4×4案例已经覆盖海报、幻灯片、论文网页和会议视频。它们共享论文证据,却需要不同的信息密度和阅读节奏:海报强调扫读,幻灯片强调讲述顺序,网页适合自主浏览,视频还要处理时间轴。只要为每种媒介补上渲染器和验收标准,外层优化就有机会学习新的制作流程。
更现实的落地方向是人机协作。研究者先让系统完成资料整理与初稿,再用自然语言指出“放大消融实验”“减少背景介绍”或“保持实验图不裁切”,系统把反馈落实为局部编辑。开源代码与可追踪的运行记录,也让团队能够审计每张图、每个数字来自论文哪里。未来若加入机构模板、字体授权和印刷检查,它可能从演示型Agent走向真正的科研设计工作台。