自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。
在作者构建的30主题DAS-Bench上,DAS四个评价维度的总体均分为4.34,最强对手为4.03。专家盲评中,它在27个主题上优于Naive RAG,在与AutoSurvey共有的21个计算机主题中赢下19个。该成绩属于作者的基准和评审协议,不能等同于系统已经能直接产出可投稿综述。
先把论文分析做成可复用资产
常见自动综述流程围绕一个问题临时检索、摘要、分节和写作。换一个主题,即使使用同一批论文,也会重复解析,并可能因为提示词变化得到不一致的论文描述。DAS把这一层独立出来,在DAS-2M元数据湖中保存面向综述的论文表示,规模约200万篇并动态更新。
论文示意图比较一次性生成流程与DAS的有状态闭环,后者允许局部内容回退修订。
专题任务开始后,系统不直接把检索结果塞进长提示词,而是先形成候选支撑的分类体系。随后采用“论文到章节”的反向路由:先判断每篇论文能支撑哪些章节,再据此调整章节边界,减少先定目录、再硬塞材料造成的空泛小节。
论文层表示与专题层结构分离后,同一篇论文可以服务不同综述,同时保留事实出处。它也方便更新:新增论文进入知识池后,只需重新判断与现有专题的关系,不必无条件重写整篇稿件。
四类状态决定哪里需要返工
DAS维护文献、组织、写作和最终化四类显式状态。文献状态记录候选与证据,组织状态管理分类和章节,写作状态保存论点、引用与段落,最终化状态负责全篇装配与格式检查。每一步的输入输出都能被后续审查定位。
DAS把文献选择、结构规划、写作审查和最终装配放进共享且可修订的状态。
语义审查发现问题时,系统只重新激活受影响的写作状态。例如某个论点缺少证据,它会回到相关论文与章节,不必让模型从头再写全部内容。确定性验证则检查可机械判断的项目,如引用映射、章节完整性和稿件装配。
这类局部闭环解决的是工程可靠性,并不自动保证学术判断正确。分类体系是否合理、研究争议是否被公平呈现、负结果是否被遗漏,仍依赖候选覆盖、评价标准和专家复核。
16项指标分开看引用、结构和成稿
DAS-Eval把质量拆成学术引用、分类综合、层级论述和稿件装配四个维度,共16项标准。作者在30个主题上对多套系统统一评估,DAS总体得分4.34,最强竞争系统为4.03;在匹配的21个计算机主题子集上,排序保持一致。
论文实验汇总比较多套系统在引用、分类、论述和稿件装配上的得分。
盲评结果提供了另一层证据。专家在30个主题中有27个更偏好DAS而非Naive RAG;与AutoSurvey共享的21个计算机主题里,DAS获偏好的主题为19个。偏好并非论文接受率,也没有验证每个领域长期更新后的事实完整性。
项目同时公开DAS-2M数据资源与代码入口,为复现实验提供条件。公开材料能让外部研究者检查数据更新、引用对应和系统输出,但完整复现还要考虑检索源变化、模型版本和评审成本。
下一步是持续更新与专家协作
DAS更适合被理解为综述生产流水线,而不是替代领域专家的写作按钮。它可以先完成候选整理、章节草拟和引用配对,再把争议判断、经典工作遗漏和结论边界交给研究者审核;局部状态让人工修改后只重算受影响部分。
实际部署还要记录版本:哪一天的论文池、哪个模型、哪些搜索结果产生了当前稿件。对于快速变化领域,后续评价应增加更新延迟、撤稿处理、跨数据库去重和引用真实性。DAS已经把“能生成长文”推进到“能定位并修复长文”,离可靠学术出版仍隔着独立事实核验与同行判断。
参考资料
https://arxiv.org/abs/2608.18034
https://zhikaixu24.github.io/projects/DAS/