Cortex AI 与 Snowpark

Snowflake Cortex / Snowpark

用一句 SQL 就能调用大模型,数据不用搬出仓库。

人工智能与模型出现时间 · 2023 年前后按模型调用量计费,与计算资源分开。库内AISQL调用模型Snowpark数据不搬家
看官方文档

01 它是干嘛的

Cortex 让大模型能力以函数的形式出现在 SQL 里:可以直接对一列文本做摘要、分类、翻译或情感判断,数据在仓库内原地处理。Snowpark 则允许用 Python 或 Java 写逻辑,让代码在数据所在处执行,而不是把数据拉到代码那里。

02 为什么会有它

以前:为了跑个模型,先把几 TB 数据搬出去

企业的数据在仓库里,模型却跑在别处。要用模型处理数据,就得先把几 TB 数据抽出来、传到模型服务、再把结果写回去。这条链路不仅慢,还带来复制成本与合规风险——数据每多一份副本,就多一处泄露可能。

而且大部分数据处理逻辑其实并不复杂,只是需要一点模型能力:给几百万条评论打个情感标签、把长文本压成摘要。为这点需求搭一整套模型服务,投入产出比很差。

于是「把计算搬到数据旁边」成为共识:既然数据已经在仓库里,就让模型能力以函数形式出现在 SQL 中,一行代码完成调用,数据原地不动。

03 它怎么工作

SQL 引擎在扫描数据的同时调用内置或托管的模型服务,把结果作为新的一列返回,全程在仓库内完成。

模型平台:把训练到上线串成流水线① 产出版本② 调用即用数据准备清洗、标注、切分训练 / 微调用算力把参数调好评测指标达标才允许上线模型仓库每个版本都可追溯部署为接口一个 HTTP 地址就能调权限与配额谁能调、每天调多少次你的应用不再关心模型怎么跑平台的价值在于「标准化」:训练环境、评测标准、上线流程、权限审计都不再靠人肉约定。唯一可信来源算力密集环节
看调用那一环的位置:模型服务被放在数据平台内部,这正是「数据不搬家」的实现方式。

在 SQL 里调用模型发生了什么

  1. 1
    ① 写 SQL

    在查询中调用模型函数,指定输入列与任务类型。

  2. 2
    ② 引擎并行

    引擎把数据分块并行调用,自动处理批量与重试。

  3. 3
    ③ 模型推理

    请求在平台内的模型服务上执行,数据不离开仓库边界。

  4. 4
    ④ 结果成列

    模型输出作为新列返回,可直接写回表或继续参与聚合。

  5. 5
    ⑤ 成本计量

    按处理的 token 或行数计量,与仓库计算费分开统计。

04 谁在用它

批量文本处理

百万条评论做情感分类或摘要。

敏感数据的 AI 处理

合规要求数据不出仓库边界。

分析师自助使用 AI

不写 Python 也能用模型,会 SQL 就够。

特征工程

在数据管道里直接生成模型所需的特征列。

05 怎么用

从一个小样本开始验证效果,确认后再全量跑,避免一开始就烧掉大量额度。

  1. 01先对一百行数据试跑,检查结果质量。
  2. 02明确输出格式要求,让模型返回结构化内容。
  3. 03为调用结果建一张新表,保留原始列便于核对。
  4. 04设置成本上限,避免全量跑批失控。

避坑提示

  • !模型输出不稳定,重要场景要抽样人工复核。
  • !批量处理前先估算 token 消耗,成本往往被低估。

06 关键概念

库内计算
让代码或模型在数据所在处执行,避免大规模数据搬运。
Snowpark
用 Python 等语言编写、但在仓库内执行的数据处理框架。
模型函数
把模型能力封装成可直接在 SQL 中调用的函数。
token
模型处理文本的基本计量单位,也是计费依据。

07 容易混淆的对比

外部模型 API + 数据导出模型选择更自由,但有搬运成本与合规负担。
自建模型服务完全可控,但运维复杂,且仍需解决数据同步问题。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态