arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

网页会搜、SQL会写,顶级AI合起来却只过一半

作者:arXivDaily编辑部 arXiv 2609.09410 cs · cs.CL

论文导读

Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet 4.6与GPT-5在困难子集的Pass@8约为50%至54%;结果受数据库、网页语料和智能体脚手架限制,不代表所有深度研究能力。

单项工具都会,难点出在把上一站的条件带到下一站

现实研究任务很少只靠搜索引擎或一张表完成。分析员可能先在数据库找到符合销量条件的公司,再去网页核对它的产品事件;也可能先从公开资料确定人物或机构,随后把名字转换成SQL筛选条件。只要实体名称、时间范围或角色约束在交接时丢失,两个单项答案都对,最终结论仍会错。

HybridDeepResearch设置三种信息流。SQL2S先跑数据库,再把查到的实体交给网页搜索;S2SQL反过来,先从网页恢复实体或条件,再写入SQL;Parallel让两边独立求解,最后取交集。每道题都锁定成“只用一个工具无法完整回答”,避免模型绕开跨工具步骤。

图1:数据库到搜索、搜索到数据库和并行求交三种混合推理路径。

380道题先从双重落地实体出发,再人工复核

团队以LiveSQLBench-Base-Lite数据库和公开网页语料为基础,先寻找同时存在于结构化表和公开文本中的实体。系统围绕同一实体分别生成SQL子问题和搜索子问题,再组合成最终问题。筛选过程会移除网页线索过时、实体有歧义或单边就能猜出完整答案的样本。

图2:一个数据库种子实体如何扩展成网页线索,并组成必须跨工具求解的问题。

最终基准有380个工具依赖任务,覆盖自动检查与人工审核。评测既使用真实网页后端,也准备固定语料后端,方便复现。答案可以自动核对,但智能体仍要决定先用哪个工具、怎样传递中间实体,以及失败后是否回到前一步修正。

顶级模型Pass@8约过半,方向性交接比并行求交更难

论文比较多种开源与闭源模型和智能体框架。代表性顶级模型GLM-5.2、Claude Sonnet 4.6与GPT-5在困难子集上,即使允许八次尝试,Pass@8也约为50%至54%。若看更严格的平均八次表现,图中代表性模型整体成功率仍低于30%。

图3:代表性模型在困难子集三种混合推理路径上的Avg@8表现。

模型在并行求交上相对好些,因为两路任务可以分开完成;需要把一边结果转成另一边查询条件时,错误明显增多。失败轨迹包括搜索已经找到正确实体,却在SQL里写错筛选条件;也包括数据库先查对对象,网页搜索随后丢掉时间或角色限制。它测到的是工具交接能力,不是单纯的搜索质量或SQL语法水平。

企业研究智能体落地需要显式保存约束和证据链

要把这类智能体用于业务分析,系统应把中间实体、字段含义、时间范围和来源证据保存为结构化状态,而不是只塞进越来越长的对话。每次工具切换后还可以检查:新查询是否保留了上一阶段全部条件,最终答案是否来自两边证据的真实交集。后续基准若加入动态网页、更复杂数据库和长链任务,才能继续检验这种状态管理是否在真实研究流程里有效。

参考资料

https://arxiv.org/abs/2609.09410

https://arxiv.org/html/2609.09410

https://github.com/Snowflake-AI-Research/HybridDeepResearch

https://huggingface.co/datasets/Snowflake/HybridDeepResearch