谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3.7至6.2分。
团队先对14名用户做形成性研究:所有参与者看过第一版后都提出了进一步修改,86%认为改过的图更令人满意。这说明科学制图很难靠一条提示一次完成,但现有生成系统的评测往往只看首轮结果。
292张图记录3518条修改要求
一张论文图既要准确表达研究关系,又要满足作者对颜色、布局、标注和阅读顺序的偏好。作者经常先说“突出主流程”,看到结果后才发现箭头太挤、模块层级不清,继而提出下一轮要求。多轮过程中的每个修改都可能影响之前已经正确的部分。
MTPaperBananaBench收集292张图和3518条用户要求,用于测试系统能否持续满足累积指令。为降低大规模真人评测成本,团队还构造用户模拟器:每一轮识别尚未满足的要求,再把其中若干条转成自然语言反馈,形成可重复的对话轨迹。
图:论文原始示例展示初稿、用户反馈和多轮改图结果。
两种常见故障:越改越差与改新忘旧
基线系统暴露出两个稳定问题。第一是质量漂移:模型为了响应局部指令,不断叠加元素,整体版式和可读性反而逐轮下降。第二是遗忘:新一轮修好字体或位置,却把上一轮已经落实的颜色、图例或结构要求又改回去。
这两种故障说明,多轮改图不能只把全部聊天记录塞给生成模型。系统需要显式检查哪些要求已经满足、哪些仍未满足,还要在修改局部时保护其他正确区域。评价也因此同时覆盖逐条要求满足度与整体图表质量,而不是只看最后一轮是否回应了最新一句话。
图:论文方法图展示多个智能体如何检查要求、批评当前图并执行精修。
先内部挑错,再把修改交给生成器
PaperBanana-Interact采用多智能体批评—精修循环。系统先读取当前图和累积要求,内部评估未完成项及潜在退化,再生成更聚焦的修改指令。每轮不是完全重画,而是围绕明确问题更新,并再次检查旧要求是否仍然成立。
实验中,这套流程在多轮推进时保持质量上升,较基线提高11.9至18.6分;遗忘指标改善3.7至6.2分。论文还按不同轮次和维度拆分结果,显示改进来自持续控制,而不是偶然在某一轮生成了更漂亮的图。评测规模为292张图,并使用用户模拟器,因此不能替代各学科作者的长期真实使用验证。
图:论文结果图比较各系统在不同轮次、不同评价维度上的变化。
科学制图工具走向持续协作
这项工作的直接价值,是把“写一次提示生成一张图”推进到可连续沟通的制图流程。作者可以先确认信息结构,再逐步调整视觉层级;系统则需要保留需求清单和版本状态,避免每轮从头猜测。
下一步要接受更严格的事实检查:图中数值、因果箭头和实验名称不能因为视觉优化被改错;真实作者也可能给出相互冲突的要求,需要系统提出取舍而不是默默覆盖。项目页公开后,跨学科用户研究将决定这种多轮提升能否延伸到复杂公式图、密集统计图和期刊规范。
版本追踪也应成为产品的一部分。每次修改可以记录具体满足了哪条要求、改变了哪些元素,并允许作者回退单个局部,而不是只能恢复整张旧图。对于合作论文,这份变更记录还能区分视觉偏好与事实修订,减少不同作者的反馈相互覆盖。
最终评价应加入真实编辑时间:系统分数提高多少之外,作者完成一张可投稿图片需要几轮、是否频繁手工修补、导出后是否仍可编辑。只有这些指标同步改善,多智能体精修才真正节省科研沟通成本。