首页 博客 经验与观点 数据科学工具…
经验与观点
数据科学工具选型:当大模型能一句话出答案,还剩下什么

数据科学工具选型:当大模型能一句话出答案,还剩下什么

数据科学工具选型,正在被一个新问题重写:既然大模型已经能一句话给出分析结果,为什么还要买一套工具?

这篇文章不替任何一类工具辩护,也不推荐任何一款产品。下面只做一件事:把「哪一部分工作被 AI 拿走了、哪一部分没有、为什么」讲清楚,包括对工具厂商不利的那一部分。

数据科学工具选型,指的是在大模型已能直接生成分析结果的前提下,重新判断一套数据分析平台还需要承担哪些无法被对话替代的职责。

数据科学工具选型:先看被拿走的是哪一部分

过去两年,「一句话出答案」从演示变成了日常。有三条事实值得单独列出来。

第一,对话式代码执行已经成熟。主流大模型产品普遍提供了沙箱代码执行能力,配合可交互的独立看板输出,能在几分钟内完成一次完整的探索性分析:读文件、清洗、建模、出图、给结论。

第二,研究原型正在变成企业级产品。微软的 Data Formulator 常被当成实验项目,但 2026 年 5 月发布的 0.7 版本不是原型了:它带了面向 Superset、Kusto、PostgreSQL、MSSQL、S3、Azure Blob、BigQuery 等的持久化数据连接器,支持 SSO 与目录懒加载,有 agent 引导的探索、会话与工作区持久化、30 多种图表类型,以及中英双语界面,全部开源。

第三,自然语言问数正在变成免费功能。Databricks 把 AI/BI 打包进平台不另外收费,Snowflake 提供 Cortex Analyst,微软把 Copilot 铺进整个 Fabric 生态。

第三条比前两条更要紧。它意味着「让你用自然语言问数据」这件事,正在从一个可以卖钱的产品,退化成数据平台的免费附加功能。任何以此为主要卖点的独立产品,都在和免费的东西竞争。

被实际拿走的工作,列清楚就是四项:写取数和清洗的胶水代码;一次性的探索分析和画图;把结果整理成一份可读的说明;以及学会使用工具本身

最后一项对可视化编程工具最致命,而且最少被提及。这类工具最大的隐性资产之一,是「已经学会了它的那批人」,也就是培训体系、认证、社区和内部推荐。这套网络效应的前提是「学习它有门槛,但比写代码的门槛低」。当写代码的门槛降到零,中间这一层的存在理由就被抽掉了。关于这一层到底还剩多少价值,可以对照可视化工作流的适用边界再判断。

一句话出答案的真实边界,藏在基准测试里

文本转 SQL 是「自然语言问数」最核心的一环。它在学术基准 Spider 1.0 上的准确率长期在九成上下,精确匹配约 91.2%。这是「AI 已经会写 SQL 了」这个印象的来源。

Spider 2.0 出现之后,画面完全变了。

Spider 2.0 用的是真实企业场景:632 个来自 Google Analytics、Salesforce 等实际应用的问题,数据库常常超过 1000 列,一项研究给出的平均值约 800 列,分布在 BigQuery、Snowflake、SQLite、DuckDB、PostgreSQL 等多种系统上,要求模型读懂长文档、跨库推理、生成常常超过 100 行的多段 SQL。

同一件事,两个基准,两个世界
学术基准与企业基准之间的落差,是「一句话出答案」目前最真实的天花板。
91.2%Spider 1.0 精确匹配准确率
21.3%Spider 2.0 多步 agent 成功率
46.7%2026 年新方法在 SQLite 子集上的最好成绩

2026 年的新方法把 Spider2-SQLite 推到了 46.67%,此前最强基线是 34.81%。这是巨大的进步,但也就是说:在真实企业数据库上,最好的公开方法答对一半的题都做不到。

还有一层更微妙。有研究用形式化验证复查「答对了」的题目,发现某个子集上按执行结果算是 42.2% 正确,按形式化验证只有 36.3%,也就是有一部分「正确」是运气,换一批数据就会露馅。另一项研究更进一步,指出 Spider 2.0 的题目和标准答案本身就存在大量歧义与错误,官方的一轮修订只解决了很小一部分。

请注意最后这一点意味着什么。它不是「模型还不够聪明」,而是:在真实企业数据里,「正确答案」这件事本身往往就没有被定义清楚。

「上个月的销售额」含不含退货?含不含内部调拨?按下单时间还是按发货时间?含税还是不含税?这些不是语义问题,是组织约定。模型没法从数据里推导出组织约定,因为它根本不在数据里。

关键事实:可核验的数字与出处

事实项 取值与口径
Spider 1.0 准确率约 91.2%,非 agent 的精确匹配评测
Spider 2.0 成功率约 21.3%,多步 agent 评测口径
Spider 2.0 最新公开成绩46.67%,2026 年方法,Spider2-SQLite 子集,高预算档
Spider 2.0 题库规模632 个真实企业问题,来源含 Google Analytics、Salesforce
企业库复杂度常超 1000 列,一项研究测得平均约 800 列
Data Formulator 版本稳定版 0.7,2026 年 5 月 28 日发布;0.8 处于 beta
语义层的行业定位Gartner 在 2025 年 BI 与分析技术成熟度曲线中将其列为必要基础设施
平台厂商策略Databricks 的 AI/BI 随平台打包不另收费;Snowflake 提供 Cortex Analyst

行业的应对方式,暴露了真正的瓶颈

如果瓶颈只是模型能力,行业的应对应该是等更强的模型。但实际发生的事完全不同。2025 到 2026 年,整个数据行业在做同一件事:造语义层。

  • dbt Labs 开源了 MetricFlow
  • Snowflake 牵头推 OSI 开放语义互换作为跨厂商标准
  • Databricks 推出 Metric Views,接进 Unity Catalog 治理
  • 微软把 Power BI 的「数据集」改名为「语义模型」,作为 Fabric AI 战略的地基
  • Tableau 发布 VizQL Data Service,让 agent 能查询已发布数据源
  • ThoughtSpot 在 2026 年 3 月发布 Spotter Semantics

语义层是什么?就是把「收入」「活跃用户」「留存」这些词,连同口径、粒度、关联路径、权限规则,由人事先写死,让所有下游(仪表盘、自助分析、AI agent)用同一套定义。

这件事的含义是反直觉的:AI 越强,对「人类事先写死的、确定性的业务定义」的需求就越强,不是越弱。

厂商侧的数据也指向同一个方向:有平台厂商称,在提供了描述每张表含义的语义模型之后,自然语言问数准确率能到九成以上。差别不在模型,在模型有没有被告知规则。这也是面向 AI 的数据准备在这两年被重新重视的原因。

顺带说一句读者该保持警惕的地方:语义层该放在哪里,现在是一场没有定论的争夺战。BI 厂商说该放在 BI 工具里,数据平台厂商说该放在平台里,独立厂商说放进任何一家产品都是新的锁定。三方的论证都有自利成分,包括那些写得最像技术分析的文章。

价值迁移地图:什么被拿走,什么没有

左半区是过去十五年数据工具卖钱的主要部分,右半区是剩下的部分。诚实地说:右半区比左半区小,而且不是增长最快的那一块。

三类玩家,各自的真实处境

可视化分析平台

最脆弱的恰恰是它们最引以为豪的原始卖点:「无需写代码,业务人员也能做分析」。这条卖点的存在理由是写代码门槛高,而这个前提已经消失。

转型方向是清楚的,也已经在做:变成 AI agent 的运行时和治理层。以 KNIME 为例,它从 5.5 版起提供 agent 与 tool 节点,支持把已有工作流变成 agent 可调用的工具,支持 MCP 协议部署为服务,用 Giskard 节点做 LLM-as-a-judge 护栏,三百多个连接器变成 agent 的数据入口。AI 智能体在工作流里的落地形态基本都是这个路子。

但要看清这次转型的性质:这是从「面向业务人员的产品」变成「面向平台团队的基础设施」。用户基数变小,销售路径变长,增长故事变弱。客单价可能上升,但那是靠深耕少数大客户,不是靠扩张。这是一次收缩型转型,不是升级。把它讲成「拥抱了 AI 所以更强大了」是自欺。

AI 原生分析工具

赢在入口和探索速度,这是真优势,不是噱头。常被拿来攻击它们的弱点是「产出是一次对话,不是一项资产」,会话结束逻辑就散了,没法复现,没法交给别人接手。这个批评在今天成立。

但要提醒一件事:这是工程缺陷,不是结构性缺陷。Data Formulator 从 0.5 到 0.7,一年之内就补上了会话持久化、工作区、数据血缘与受治理的连接器。任何把长期判断建立在「AI 工具不可复现」上的论证,都是在押注对手的临时缺口,这个赌注的有效期通常只有 12 到 18 个月。

数据平台自带的 AI

从结构上看,这是最可能的赢家。它离数据最近、离权限体系最近、离语义定义最近,而且能把这个能力免费送出去当作留客手段。独立工具被夹在中间:上面是能免费送的平台,下面是体验更好的 AI 原生入口。

真正拿不走的,只有三条

一、口径的组织约定。语义层的本质是政治,不是技术。让财务、业务、IT 三方对「收入」的定义达成一致,难点从来不是写不出一份配置文件。AI 不参与这个过程,因为它不参与承担分歧的后果。

二、可重复执行的资产。一次性回答,和一条每月 5 号自动跑、跑完有人看的流程,是两种东西。前者的价值随对话结束归零,后者会累积。

三、责任归属。监管报送、审计、准备金计算、税务申报,错了要有名字在文件上。大模型厂商在结构上给不出责任主体,这不是能力问题,是法律主体问题。审计数据分析这类场景之所以迁移得最慢,原因就在这里。

但第三条要加一句诚实的注脚:这不是技术优势,是当前法律与组织结构的产物。随着监管逐步接受 AI 参与的输出、审计准则更新、责任保险产品出现,这条护城河会被稀释。把它当永久壁垒是错的,它更像一个窗口期。

数据科学工具选型,最终只剩三个问题

不管你在做工具评估、还是在判断要不要继续投入现有工具,面对任何一个分析需求,问这三个问题就够了。

问题一:这个答案下个月还要不要用完全相同的口径再跑一遍?要,你需要的是一条可固化的流程,不是一次对话。不要,用大模型就够了,别买工具。

问题二:这个答案错了,谁在文件上签字?有具体的人,你需要一条可以被逐步审查的执行路径,而不是一个黑箱结论。没有人,准确率八成可能完全够用,别为剩下的两成付十倍的钱。

问题三:数据能不能离开这栋楼?不能,这决定的是部署形态,不是工具优劣。别把合规约束当成产品优势来理解。

这三个问题不偏向任何一家厂商,包括做工具的那些。数据科学工具选型,本质上就是回答完这三个问题之后剩下的那个选项。

结论

回到标题。当大模型能一句话出答案,数据科学工具剩下的不是「更强的分析能力」,那一块已经输了,而且输得很干脆。

剩下的是把分析变成可交付、可重复、可追责的东西的能力。这个空间真实存在:Spider 2.0 上两成到四成的成功率、整个行业转头去造语义层、企业里「收入到底怎么算」至今没有技术解法,都证明它存在。但它比过去小,增长更慢,客户更少更难搞,而且它的一部分是有时效的。

所以,任何一家告诉你「AI 时代我们的工具反而更重要了」的厂商,包括做这一行的所有人,你都应该先要求他们回答上面那三个问题,并展示产品在哪一条上真的做到了,而不是停留在路线图上。

常见问题

需要,但理由变了。过去选可视化工作流是为了降低写代码门槛,这个理由已经被大模型消解。现在的理由是流程可被重复执行、可被逐步审查、可交接给他人维护。如果一个分析只跑一次、没人签字,那么不需要工作流。
看用哪个基准。学术基准 Spider 1.0 上约 91.2%,企业级基准 Spider 2.0 的多步 agent 评测约 21.3%,2026 年最新方法在其 SQLite 子集上达到 46.67%。差距来自真实企业库常超 1000 列、需跨库推理并生成上百行 SQL。
因为「收入含不含退货」这类问题是组织约定,不在数据里,模型推不出来。语义层把口径、粒度、关联路径、权限规则由人事先写死,模型才有规则可依。这也是 dbt、Snowflake、Databricks、微软在 2025 至 2026 年集体投入语义层的原因。
不会完全取代,但会取代其中的探索性部分。一次性的问数、画图、写结论基本已被拿走。没有被拿走的是口径定义、可重复执行的流程,以及出错时的责任归属。后者决定了工具在受监管行业里仍有位置。
先问「这个答案下个月要不要用完全相同的口径再跑一遍」。答案是「要」,才需要一套工具;答案是「不要」,直接用大模型更划算。这个问题比任何功能清单都更能快速筛掉不必要的采购。

主要参考来源:Spider 2.0 基准 spider2-sql.github.io;Data Formulator 0.7 发布说明 Microsoft Research;KNIME 的 agent 能力说明 knime.com。文中所有数字均可在上述来源核对,本文未使用任何无出处的效果百分比。

想用这三个问题过一遍自己的场景?
我们不提供「AI 替你做决定」的承诺。能提供的是一条可以被逐步审查、可重复执行、可在本地环境内跑完的分析流程。
预约演示 免费下载试用

搜索文章

返回博客列表
iModel 专属客服
在线留言或电话联系
在线留言

留下您的问题和联系方式,我们会在一个工作日内回复。

手机与邮箱至少填一项

4008568196 拨打此号码联系我们

微信扫码咨询

iModel 微信咨询二维码

使用微信扫描上方二维码