arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

电脑Agent开始考“科研实操”:OSWorld-Science盯上真实软件工作流

作者:arXivDaily编辑部 arXiv 2609.39903 cs · cs.AI

论文导读

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“看起来做完”与“结果可复查”的差距。

任务从一句指令延伸到可验收成果

传统电脑基准常把目标简化为打开菜单或修改一个设置。科研工作却要求理解领域约束、操作多步界面、运行计算并导出合格文件。OSWorld-Science由专家提出任务,再按多样性、难度和科学价值过滤;执行端为不同学科配置虚拟机,评测端同时保留逐步检查与最终二元验收。

图:总览图连接专家任务设计、虚拟机中的Agent循环、自动评分和行为分析。

做对计算还不够,导出格式也必须对

OpenFOAM案例展示了典型陷阱:成功轨迹发现VTK数组精度不足,转而读取原生高精度字段并检查行数与物理范围;失败轨迹完成了求解,却用六位精度文件交付,还在自检暴露差异后宣告完成。评测因此关注结果来源、格式和验证过程,而不只看界面动作数量。

图:成功轨迹核对原生字段后导出,失败轨迹忽略精度要求,说明完整验收为何必要。

不同科研软件暴露不同类型的脆弱点

基准覆盖图像分析、统计、化学、地理信息和工程软件。QGIS任务要求从航拍图中正确描绘建筑与道路;有的Agent能覆盖主要路网,却漏掉小棚或部分支路。此类错误不能靠文本答案掩盖,因为交付几何可直接叠回原图检查。论文还分析无交付、错误内容、无效文件和流程未完成等失败类别。

图:黄色几何叠在航拍底图上,不同Agent对小建筑和完整路网的覆盖差异清楚可见。

科研Agent落地要先建立可验证交付

这套基准最值得借鉴的是验收思路:每个任务先定义产物、精度、格式和可自动检查的门槛,再让Agent执行。后续仍需扩大软件版本、操作系统与领域任务,防止模型只记住固定界面。真实科研使用还必须保存输入、命令、文件哈希和人工复核记录,让结果可追踪而非只可演示。

实验室若要引入类似Agent,可以从低风险、易验收的工作开始,例如批量格式转换、图表导出与已有脚本复跑。每一步都应把输入文件设为只读,输出写入独立目录,并由领域检查器验证单位、精度和行数。随着任务变长,还要记录许可证、软件版本和随机种子,避免今天能复现、明天升级后失效。最终衡量标准不应是界面操作多像人,而是交付物能否被另一位研究者独立打开、复算并追溯来源。

涉及仪器控制或真实实验时,还必须把权限隔离和紧急停止设为硬门槛。

参考资料

https://arxiv.org/abs/2609.39903

https://discoailab.github.io/osworld-science-page/

↑