首页 博客 未来趋势 数据科学 A…
未来趋势

数据科学 Agent:五类产品的现状、边界与选型要点

数据科学 Agent,指能理解自然语言任务、自行生成并执行数据处理或建模代码,并根据结果调整下一步的 AI 系统。本文把这类产品按性质分成五类,逐一核对截至 2026 年 9 月 16 日的现状、能力边界与部署限制。写给正在评估这类工具的数据团队负责人与技术选型人员。

要点速览
  • 数据分析与建模类 Agent 分为数据平台内置、机器学习平台、BI 助手、开发框架、研究原型五类。
  • Databricks、Snowflake、Google Cloud 的数据科学类 Agent 均以公有云服务提供,前提是数据已在对应平台上。
  • H2O.ai 与 DataRobot 均称支持本地与隔离网络部署,这一点来自厂商自述。
  • Microsoft AutoGen 自 2025 年 10 月起处于维护模式,新项目应评估其继任者 Microsoft Agent Framework。
  • Agent 能让分析代码跑通,但不会判断统计方法和结论是否成立,这一环节仍需人来把关。

数据科学 Agent,先按性质分成五类

过去两年,数据与 AI 厂商普遍给产品加上了「Agent」标签。平台里的对话助手、写代码用的开源框架、论文里的研究原型,都被叫作 Agent。

名字相同,东西差别很大。选型时真正要回答的是三个问题:它能直接处理我的数据吗?它产出的分析过程能复现和审计吗?它明年还在不在维护?

第一类直接读取平台上的数据与元数据,前提是数据已在该平台上。第二类由 AutoML 厂商转型而来,把已有建模能力接入 Agent。第三类面向 BI 工具的使用门槛,严格说不算数据科学类工具。

第四类不直接分析数据,而是提供搭建 Agent 的零件。第五类有参考价值,但大多不是为企业生产环境设计的。把这五类放在一起排名没有意义,本文只说明每类的现状、边界与适用对象。

五类产品一览与关键事实

下表信息核实于 2026 年 9 月 16 日。标注「厂商自述」的内容来自厂商公开材料,未经独立验证。

名称类别部署形态当前状态适合对象
Databricks Genie Code / Agent Bricks数据平台内置公有云服务活跃数据在 Databricks 上的团队
Snowflake CoCo(原 Cortex Code)数据平台内置公有云服务活跃数据在 Snowflake 上的团队
Google Colab Enterprise Data Science Agent数据平台内置公有云服务活跃使用 BigQuery 的团队
H2O.ai(h2oGPTe 等)机器学习平台云、本地、隔离网络(厂商自述)活跃数据不能出域的大型企业
DataRobot Agent Workforce Platform机器学习平台云、本地、隔离网络(厂商自述)活跃已有 DataRobot 模型资产的企业
Spotfire CopilotBI 附加能力随 Spotfire 部署活跃,免费,不含维护现有 Spotfire 用户
LangChain / LangGraph开发框架自建活跃有工程能力、需求高度定制的团队
Microsoft Agent Framework开发框架自建活跃,AutoGen 的继任者微软技术栈团队
DeepSeek Harness开发框架自建开发者预览技术储备观察
LAMBDA研究原型自建论文已发表教学与研究
AutoGPT通用 Agent 平台托管或自托管活跃通用流程自动化

关键事实

事项事实(核实于 2026-09-16)
Databricks Genie Code2026 年 3 月推出,面向湖仓平台内的数据工程、数据科学与分析任务
Snowflake Cortex Code2025 年 11 月推出,现名 Snowflake CoCo,按 token 消耗计费
Google Data Science Agent仅在 Colab Enterprise 环境可用;BigQuery 场景不支持 CMEK
H2O.ai 与 DataRobot 部署均称支持本地与隔离网络部署(厂商自述)
Microsoft AutoGen2025 年 10 月起维护模式,只修复缺陷与安全问题
Microsoft Agent Framework由 AutoGen 与 Semantic Kernel 合并而来,2026 年 4 月发布 1.0 版
DeepSeek Harness2026 年 8 月 13 日开源,处于开发者预览,会有不兼容变更
LAMBDA 结构programmer 与 inspector 两个核心 Agent,论文发表于 JASA
Convergence ProxySalesforce 于 2025 年 6 月 11 日完成收购,不再独立提供

第一类:数据平台内置的 Agent

Databricks:Genie Code 与 Agent Bricks

Databricks 于 2026 年 3 月推出 Genie Code。它定位为在湖仓平台内完成数据工程、数据科学与分析任务的 Agent,覆盖管道构建、调试、模型部署与看板交付。

2026 年 6 月的 Data + AI Summit 上,Agent Bricks 从 Agent 质量优化工具扩展为完整的开发平台。面向业务人员的 Genie One 也在同期正式发布。Genie Code 与 Agent Bricks 已进入 Databricks 免费版。

在让 Agent 直接操作数据与代码这件事上,Databricks 投入较深。但这些能力建立在 Unity Catalog 统一治理之上,数据不在 Databricks 上,大部分能力就用不上。

Snowflake:CoCo(原 Cortex Code)

Snowflake 的 Cortex Code 于 2025 年 11 月推出,现已更名为 Snowflake CoCo。官方说明更名后功能与架构不变,按 token 消耗计费。

它直接在 Snowflake 内工作,利用企业已治理的数据、元数据与权限生成代码。网页界面 Snowsight 与命令行都能使用。2026 年 3 月的更新加入了 Agent Teams,可把大任务拆成多个并行子任务。

Snowflake 在官方博客中点出了通用编程助手的短板。这类助手会写代码,但不了解表结构、数据目录、血缘与访问策略,生成的代码常需大量人工修正。厂商自述超过一半的客户已在使用 Cortex Code。

Google Cloud:Colab Enterprise Data Science Agent

Google 在 Colab Enterprise 笔记本中内置了 Data Science Agent,可在 BigQuery 与 Vertex AI 环境中使用。它先按提示生成分析计划,用户可以修改计划,再由 Agent 生成并执行代码。

默认情况下,它生成使用 sklearn 等开源库的 Python 代码。在提示中加入特定关键词,可改用 BigQuery ML、BigQuery DataFrames 或 Spark 处理大规模数据。

需要提前评估的限制:据 Google Cloud 官方文档,该 Agent 只在 Colab Enterprise 环境中可用。BigQuery 场景下不支持客户管理的加密密钥(CMEK),Spark 代码只按 4.0 版本生成。

这一类的共同特点

数据科学 Agent,离不开数据本身的上下文。三家的 Agent 都直接读取平台上的表结构、权限与血缘信息,这是它们相对通用编程助手的核心差异。

代价同样明确。三者均以公有云服务提供,价值与「数据已经在哪」强相关,国内企业还需结合数据出境相关合规要求单独评估。数据在交给 AI 之前如何整理到可用状态,可以参考面向 AI 的数据准备

第二类:机器学习平台厂商的 Agent

H2O.ai

H2O.ai 的产品线包括 h2oGPTe、Driverless AI、Super Agent、Agents Builder 与开源框架 H2O-3。其中 h2oGPTe 面向 Agent 与生成式 AI,Driverless AI 是 AutoML 工具。

与数据分析直接相关的是 h2oGPTe 里的 Data Science Agents。它可以用自然语言发起 AutoML 实验与统计分析,并调用 Driverless AI 完成建模。

H2O.ai 常被笼统称作开源平台,但开源的是 H2O-3 等基础组件。Driverless AI 与 h2oGPTe 是商业产品。它的差异化方向是本地部署与物理隔离网络部署,适合数据不能出域的金融、电信与公共部门。

厂商自述在 2026 年 Gartner 数据科学与机器学习 AI 平台魔力象限中位列「远见者」。厂商还称 h2oGPTe 曾在 2025 年 3 月登上 GAIA 基准榜首。需要注意,GAIA 考察的是通用助手能力,不等同于数据科学任务表现,且排行变化很快。

DataRobot

DataRobot 已不再以 AutoML 为核心定位,而是自称专注 Agentic AI 的平台厂商,主推与 NVIDIA 联合开发的 Agent Workforce Platform。

厂商自述 2026 年连续第三年在 Gartner 数据科学与机器学习平台魔力象限中位列「领导者」。厂商强调平台可在公有云之外运行,包括本地、隔离网络与私有云。

选型时要留意战略重心的变化。如果看中的是传统预测建模,需要确认这部分在新产品线中的投入与定价方式是否仍然匹配。

两家做的是同一件事:把过去积累的 AutoML 与模型治理能力,变成 Agent 可以调用的工具。与第一类相比,它们支持本地部署(厂商自述),与数据平台的绑定程度也更低。

第三类:BI 平台的 AI 助手

Spotfire 已不再以 TIBCO 品牌出现,现为 Cloud Software Group 旗下的业务单元。它的 AI 能力主要是 Spotfire Copilot。

Spotfire Copilot 是免费扩展,按现状提供,不含维护服务与担保。它可以接入不同来源的大模型,官方测试过 GPT-4o、Gemini 2.5 与 Claude Sonnet 4.5。2026 年 6 月发布的 2.3.4 版本,开始向外部 Agent 开放筛选、标记等操作接口。

Spotfire 本质上是可视化分析与 BI 平台。Copilot 解决的是「不熟悉工具的人如何更快出图」,不是建模与统计推断。它适合现有 Spotfire 用户,不建议为了数据科学用途专门采购。

第四类:Agent 开发框架

开发框架不直接分析数据,而是提供搭建 Agent 的零件。代码执行沙箱、权限控制、结果校验与日志审计,都要团队自己设计和维护。

其中,Agent 访问数据库与外部系统时的凭据管理尤其容易被忽视,具体做法可参考企业 AI 中智能体凭据的管理方式

LangChain 与 LangGraph

LangChain 是开源框架,用于把大模型、外部工具、检索与记忆串联成应用。复杂的 Agent 编排主要依托同一团队开发的 LangGraph。它适合有工程能力、需求高度定制、不想绑定平台的团队。

Microsoft Agent Framework(AutoGen 的继任者)

AutoGen 曾是知名度很高的多 Agent 框架。据 AutoGen 官方仓库说明,它已进入维护模式,只修复缺陷与安全问题,不再增加新功能,时间是 2025 年 10 月。

微软把 AutoGen 与 Semantic Kernel 合并为 Microsoft Agent Framework。它于 2026 年 4 月发布 1.0 正式版。AutoGen 的原作者另在社区维护一个分支 AG2。

结论很明确:新项目不应再基于 AutoGen 启动。已有项目迁移时,要预期部分代码需要重写,而不只是替换引用。

DeepSeek Harness

DeepSeek 于 2026 年 8 月 13 日开源了官方 Agent 框架 DeepSeek Harness(dsh)。它采用「一切皆插件」的架构,本身不带模型,需要使用者自行接入。

DeepSeek Harness 官方仓库明确说明,项目处于开发者预览阶段,后续会有不兼容变更。它是通用 Agent 运行框架,预览期内不适合承载生产分析流程。

另外,网上以「DeepSeek Agent」命名的网站、扩展与项目很多,大部分是社区作品。引入前应核对是否来自 deepseek-ai 官方仓库。

第五类:研究原型与通用 Agent 平台

LAMBDA

LAMBDA 是学术开源项目,论文发表于《美国统计协会杂志》(JASA)。它的核心只有两个 Agent:programmer 负责编写并执行代码,inspector 在代码报错时分析原因并给出修改建议。

两者循环,直到代码成功运行或达到尝试次数上限,用户也可以随时直接修改代码。项目提供 OpenAI 风格接口,可以接入通过 vLLM 等框架部署的开源模型。

期刊同期的讨论文章指出了它的局限。两个 Agent 只负责让代码跑通,并不判断分析方法与结果在科学上是否成立。它还默认用户已经知道该做什么分析。这一点几乎适用于所有用自然语言做数据分析的工具:代码能运行,不等于结论正确。

AutoGPT

AutoGPT 于 2023 年 3 月 30 日发布,发布者是游戏公司 Significant Gravitas 的创始人 Toran Bruce Richards。它是较早引起广泛关注的自主 Agent 项目。

它现已演变为带可视化构建器的 Agent 平台,托管版按用量付费,自托管版不收许可费。它面向通用流程自动化,不是数据科学专用工具。

早期版本容易陷入循环、产生幻觉、调用成本高,这些问题都有公开记录,评估新版本时仍值得关注。

数据科学 Agent:几个需要澄清的名字

在网上的各类 AI Agent 盘点里,还常会看到下面几个名字,这里一并说明。

  • 「Meta AutoGPT」并不存在。AutoGPT 与 Meta 没有关系,发布者见上文。
  • 「被量化基金采用的 DeepSeek Agent」找不到可查来源。DeepSeek-VL 与 DeepSeek-Coder 是模型,不是 Agent 框架。DeepSeek 官方 Agent 框架直到 2026 年 8 月才开源。
  • Convergence Proxy 已不再独立提供。Salesforce 于 2025 年 6 月 11 日完成对 Convergence 的收购,团队与技术并入 Agentforce。有用户公开反映,收购后订阅费被退还。
  • BabyAGI 是概念验证,不是生产工具。它的原始仓库已于 2024 年 9 月归档,后续版本均为实验性项目。
  • AutoGen 仍常出现在推荐清单里,但已处于维护模式,新项目应评估 Microsoft Agent Framework。

数据科学 Agent:选型时该问的五个问题

比起「哪个最好」,下面五个问题更能决定一个 Agent 能不能在企业里用起来。关于工具选型更完整的讨论,可以参考AI 时代的数据科学工具选型

01 数据能不能不出域

金融、医疗、政务等行业的数据往往不能发送到外部服务。要确认的不只是平台能否本地部署,还有 Agent 调用的大模型能否同样本地部署。前文三家数据平台的 Agent 均为公有云服务,这一点尤其要提前明确。

02 每一步能不能复现与审计

Agent 生成了什么代码、用了哪些参数、中间结果是什么,是否完整留存?同一个问题再问一次,能否得到同样的分析过程?在受监管行业,无法复现的分析结论很难被采信。

03 谁来判断结论是否成立

Agent 擅长让代码跑通,但不会主动质疑方法是否用错、样本是否有偏。流程里必须明确由谁、在哪个环节把关。核对 AI 输出的具体方法,可以参考核查 AI 回答的五种实用方法

04 模型能不能替换

大模型迭代很快。把分析流程绑死在某一个模型上,意味着每次模型升级或下线都要重新验证。

05 项目还在不在维护,条款是什么

AutoGen 进入维护模式、Proxy 被收购后停止独立服务、Spotfire Copilot 不含维护,这些都会影响长期使用成本。选型前应查看代码仓库的更新频率、官方公告与许可条款。

整体来看,市场已经分化。数据平台厂商依托数据上下文,机器学习平台厂商依托本地部署与已有模型资产。开源框架则把选择权与工程负担一并交给用户。

对多数企业,务实的顺序是:先看数据在哪、能否出域,再看过程能否复现审计,最后才比较功能清单。

常见问题

数据科学 Agent,和通用编程助手有什么区别?

主要区别在于是否了解数据上下文。平台内置的数据科学类 Agent 能读取表结构、权限与血缘信息。通用编程助手只看到代码,生成的数据处理代码往往需要更多人工修正。

AutoGen 还适合用于新项目吗?

不建议。AutoGen 自 2025 年 10 月起处于维护模式,只修复缺陷与安全问题。微软推荐新项目使用 Microsoft Agent Framework,该框架于 2026 年 4 月发布 1.0 版。

数据不能出域的企业,可以考虑哪一类?

可以优先评估支持本地部署的方案。H2O.ai 与 DataRobot 均称支持本地与隔离网络部署(厂商自述)。基于开源框架自建也可行,但沙箱、权限与审计需自行实现。Databricks、Snowflake、Google Cloud 的相关 Agent 以公有云服务提供。

Agent 生成的分析结论可以直接采信吗?

不能直接采信。Agent 能修复代码报错,但不判断统计方法与结论是否成立。LAMBDA 论文的期刊讨论文章专门指出了这一局限,结论仍需人工复核。

参考来源

把选型问题落到具体流程上
如果你正在评估分析流程如何在本地环境中复现与审计,可以先从入门教程动手,或与我们沟通具体场景与范围。
想先熟悉节点用法与常见报错?可以先看 KNIME 中文知识库

搜索文章

返回博客列表
iModel 专属客服
在线留言或电话联系
在线留言

留下您的问题和联系方式,我们会在一个工作日内回复。

手机与邮箱至少填一项

4008568196 拨打此号码联系我们

微信扫码咨询

iModel 微信咨询二维码

使用微信扫描上方二维码