论文导读
牛津大学、斯坦福大学、新加坡国立大学等机构提出PaperDoctor,让AI不再只给论文打分,而是定位原文、解释问题并给出修改方案。30篇在写论文的作者共评估1299条反馈,对其中证据判断的接受率为70.6%。这套系统还会检查代码和按优先级重跑实验,把投稿前体检推进到可核查、可执行的层面。
从一句评语拆成“哪里错、为什么、怎么改”
普通自动审稿系统更像门卫:读完论文,给出接收或拒绝倾向,再附一段理由。作者真正需要的却是导师式反馈——具体指出哪句话、哪条公式、哪段代码或哪项实验有问题,并说明修改动作。
PaperDoctor把每条反馈固定成三部分:观察到的问题、可回到原文核查的证据位置、可执行的修改建议。严重且确定的问题标为错误,存在不确定性的项目标为警告,作者能逐条接受、拒绝或补充意见。
论文Figure 1:系统从论文与代码中提取材料,经分层检查后生成带证据位置和修改建议的诊断报告。
三层检查,从排版一路走到复现实验
第一层处理成本低、规则清楚的问题,包括文字、版式、参考文献和可验证主张提取。第二层把主张分给不同检查器:代码分支对照实现与论文描述,理论分支重新推导,文献分支核对新颖性,实验分支检查设计是否足以支撑结论。
论文Figure 5:左侧保留论文位置,右侧展示问题类型、证据、原因和修改建议。
第三层才动手运行代码。系统先把实验拆成计划,记录命令、目标数字、所需资源和优先级,由作者确认预算后再执行。论文报告的40篇带代码稿件中,平均每篇14.5项计划只有18.0%最初处于可运行状态;补齐部分阻塞后,平均7.7项真正执行,5.1项得到通过或警告结果。这个数字也暴露了现实:自动复现常卡在缺少说明、依赖不全或结果对不上。
论文附录案例:系统把复现实验的观察、代码或结果证据与修改建议放在同一条记录中。
70.6%不是“AI审稿准确率”
作者研究邀请25名研究生提交30篇在写论文,共得到1299条反馈。作者逐条判断证据是否成立、建议是否有效:证据接受率为70.6%,30篇论文各自接受率的均值为68.5%,中位数为71.1%。所有论文对整体帮助度都给出正分。
这个实验衡量的是稿件作者是否认可具体诊断,不是会议录用预测,也不能证明AI比专家更准确。Figure Review的接受率只有42%,说明视觉模型面对复杂排版和密集图表仍容易误读。系统覆盖面越大,错误反馈也会增加,作者审核没有被取消。
投稿前工具未来还要补上可控复现
PaperDoctor适合接在写作与正式投稿之间:先扫清引用、代码、图表和实验设计问题,再把高成本复现交给作者批准。下一步需要更稳定的环境封装、清楚的算力与数据预算,以及对同一问题多次运行的一致性记录。论文已经把“审稿意见”变成可追踪任务清单,能否进入真实研究流程,将取决于误报率和复现成本是否可控。