arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

前沿模型做BI还不到50分,微软智能体最高拉升40个百分点

作者:arXivDaily编辑部 arXiv 2609.20886 cs · cs.AI · cs.CL · cs.DB · cs.LG

论文导读

伊利诺伊大学厄巴纳-香槟分校、微软研究院和微软提出BI-Agent,让智能体自己找表、转换数据、建立关联并回答商业问题。前沿模型在BI-Bench准确率不足50%,专用智能体最高提升40个百分点,完整流程而非单次查询成为评测对象。

企业BI难在答案之前的数据准备

商业问题很少对应一张干净表。分析人员往往先定位多个数据源,理解字段含义,处理日期和缺失值,再判断客户表、订单表与产品表如何连接。通用聊天模型即使会写SQL,也可能在前置步骤选错表或建立错误关系。

BI-Bench把这条链路整体纳入评测。它从整理后的公开BI项目构建100个案例,要求系统面对真实风格的数据模型完成准备和问答,而不是只在已经给定数据库结构的条件下生成查询。

图:论文示例展示商业问题需要经过找表、转换和关联才能得到答案。

智能体按步骤调用专用数据工具

BI-Agent把搜索、连接和转换做成可调用工具。语言模型负责规划:先根据问题寻找候选表,检查列和样例值,再执行清洗与关系建立,最后生成答案。中间结果会反馈给后续步骤,而不是一次性猜完整查询。

这种分工把擅长语言理解的模型与确定性数据操作连接起来。若连接后行数异常、关键列大量为空,工具结果可以提示模型回退并换一条关系。相比只给模型一段模式描述,真实执行能暴露更多错误。

图:论文架构图呈现智能体如何编排表搜索、转换、关联和问答工具。

最高40个百分点来自系统能力,不只是更大模型

论文报告,前沿模型直接处理BI-Bench时准确率低于50%。加入BI-Agent后,最高提升达到40个百分点;对模型进行面向该流程的后训练,还可最高增加30个百分点。结果说明企业数据任务需要操作反馈和专门训练,而非只靠模型参数规模。

不过,100个基准案例仍无法覆盖企业里的权限、脏数据、指标口径冲突和实时数据变化。准确回答也不表示过程可审计:如果智能体选错过滤条件却碰巧得到正确数字,部署后仍会留下风险。

图:论文说明专用轨迹如何用于后训练并改善多步骤BI操作。

应用方向:把每一步变成可复核的数据血缘

落地时,系统不应只输出一句答案,还应保存所用表、字段转换、连接键、过滤条件和执行时间。分析人员能沿着这条血缘检查数字,发现口径不一致时只重跑受影响步骤,而不必重新相信一段不可见推理。

下一轮评测可以增加权限受限、同名指标、多版本维表和数据延迟场景,并把答案正确率与成本、耗时、重试次数一起报告。涉及财务、人事等敏感数据时,智能体还必须遵循最小权限,禁止为了找表而遍历无关数据源。

BI-Agent展示的是一条更现实的企业智能体路线:模型负责理解与规划,数据工具负责执行与校验,人负责定义指标和批准高风险动作。只有三者责任边界清楚,自动化才会从演示里的正确答案变成可持续的分析流程。

参考资料

https://arxiv.org/abs/2609.20886

https://github.com/Hu-Chuxuan/bi-agent