把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的方案在85%的成对比较中优于“只看标量摘要”的版本。
多数AI科学家擅长调用代码和处理表格,却看不到实验对象本身。研究者必须先把图像、声音或视频压成少量数值,再交给Agent。这个过程可能提前丢掉纹理、形状、时间变化等关键线索,也把人类的特征选择偏好写进了研究起点。
让AI先看原始数据,再决定该测量什么
OmniScientist支持图像、信号、音频、视频、3D对象、轨迹、表格、公式和图结构等输入。感知模块先浏览数据样本与元信息,形成对可见模式的描述;研究Agent据此提出问题和假设,再选择统计方法、视觉分析或代码工具验证,而不是一上来只围绕预设字段做回归。
OmniScientist可直接读取的图像、音频、视频与3D科学数据。
直接感知并不排斥数值工具。模型可以先从原始图像发现某种形态差异,再用程序批量测量;也可以听到音频中的节奏变化后计算频谱。视觉语言模型负责发现候选线索,传统计算负责把线索变成可复核指标,两者在同一研究循环中互补。
三个Agent分工:构思、实验与论文写作
系统由研究构思、实验执行和写作三个角色组成。构思Agent阅读数据与已有上下文,生成具有可检验性的研究问题;实验Agent编写和运行分析代码,检查结果是否支持假设;写作Agent整理方法、图表、结果和引用,形成完整稿件。中间产物会保留,便于追踪结论来自哪次分析。
OmniScientist从多模态感知到研究构思、实验和论文的流程。
为了减少“一次跑通就算成功”,框架设置了多层检查,包括数据读取、代码执行、数值一致性和论文结构。错误会回到相应环节修正,而不是由写作模型用顺畅语言掩盖。36个案例全部走完了整条流水线,覆盖医学、生态、材料等5类学科情境。
直接感知在85%比较中胜出,论文平均得分6.3
团队比较两种设置:一组Agent直接访问原始多模态数据,另一组只能读取预先提取的标量特征。在85%的成对评价中,直接感知版本被认为更好,说明原始模态确实提供了额外科学线索。最终36篇自动生成论文的平均评估得分为6.3。
OmniScientist对研究过程与结论进行逐层检查。
OmniScientist分析胸部X光数据的完整研究案例。
这里的“写成论文”是完成具有方法、实验与结论的稿件,并经过论文设定的自动或专家评估,不等同36篇都通过期刊同行评审。它更适合被理解为科研探索速度测试:AI能否从陌生数据走到可供研究者检查的初步研究报告。
下一步成为科研人员的多模态探索搭档
OmniScientist最有潜力的用法不是替研究者签署结论,而是把大量原始数据的初筛变成可交互过程。科学家可以要求系统比较不同样本、寻找异常形态、生成候选指标,再审查代码、图表与证据。对于跨学科项目,它还能快速暴露“哪些模态值得进一步测量”,缩短从拿到数据到形成假设的距离。
未来若接入实验仪器和版本化数据仓库,系统可以在新数据到达后重复既有分析,并明确报告哪些结论发生变化。更严格的统计检验、引用核查和领域安全规则也能作为独立验收器加入。OmniScientist已经证明多模态基础模型可以进入研究链路前端,下一步是把这种速度与人类科研所需的可重复、可解释和责任边界结合起来。
科研机构还可以把它用于“盲点扫描”:同一数据交给多组独立Agent,各自提出假设,再由研究者比较重合与冲突之处。所有发现都必须绑定原始样本、代码版本和运行环境,才能从漂亮的自动报告变成可重复实验。这样,36个案例展示的全流程能力才可能稳定扩展到更大课题。