论文导读
DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等机构提出Large Knowledge Model(LKM),把论文拆成问题、推理步骤、结论与证据,再跨论文连成可检索地图。固定回答模型时,LKM检索将ChemBench、PubMedQA、SciBench准确率分别提升9.30%、4.20%和14.69%。
找到同一个词,不等于找到同一个科学问题
传统论文检索主要依靠关键词、摘要语义或引用网络。两篇论文可能使用不同术语研究同一问题,也可能提到同一对象,却在回答完全不同的科学疑问。只用段落向量找相似文字,很容易忽略论文中“为什么做”、“怎么验证”和“什么条件下成立”。
LKM先将每篇论文表示为有来源的推理图。图中的节点不只是文字块,而是研究问题、子问题、实验流程、证据、结论和适用条件。每个对象都保留回到原论文的路径,使用者能检查系统为什么把两条证据连在一起。
图:Figure 1以哈勃常数张力为例,将原始论文的推理链对齐到问题、工作流和证据三个地图视图。
三张地图分别管问题、做法和证据
问题地图把研究疑问与子问题按科学意图组织起来,用来发现同一宏观问题下的不同切入点。工作流地图对齐可复用的科学步骤,例如不同论文里相似的数据处理和验证程序。证据地图则将结论与支持证据、分歧和成立条件放到同一坐标里比较。
搜索时,系统既能沿图结构遍历,也能在同一批对象上做语义检索。回答科学问题时,它不只返回文献列表,还能把对应的论点、证据和条件一起提供给回答模型。
图:Figure 2对比裸模型、Web搜索、arXiv、Science Navigator与LKM等检索来源在ChemBench、PubMedQA和SciBench上的准确率。
未来应用:固定回答模型,只看检索换了什么
实验固定了生成答案的模型,把变量集中在检索与知识组织。与对照检索方案相比,LKM在ChemBench、PubMedQA和SciBench上的准确率分别提升9.30%、4.20%和14.69%。论文还测试了检索质量和证据综合工作流,检查系统是否能把与问题有关、可支撑结论的资料排到前面。
图:Figure 3将统一API基线与重排证据综合工作流并列,比较检索表现和引用质量。
这些提升仅来自三个基准,不代表所有学科、文献类型和开放研究问题都能获得同样改善。下一步的实用性取决于推理对象的提取准确率、新论文更新速度和跨学科术语对齐,以及使用者能否快速追回原文核对关键证据。
这种结构化检索最适合证据链较长、同一问题存在多种方法与冲突结论的研究场景。它能帮助模型找到“为什么这篇论文相关”,但不能替代对原文实验设计和统计口径的审查。若地图在抽取阶段把条件、否定或证据强度标错,后续回答会把结构化错误放大。因此实际应用还需要保留从地图节点回到原文段落的路径,并把新增论文、撤稿和结论修订纳入持续更新。