01 它是干嘛的
Cortex 让大模型能力以函数的形式出现在 SQL 里:可以直接对一列文本做摘要、分类、翻译或情感判断,数据在仓库内原地处理。Snowpark 则允许用 Python 或 Java 写逻辑,让代码在数据所在处执行,而不是把数据拉到代码那里。
02 为什么会有它
以前:为了跑个模型,先把几 TB 数据搬出去
企业的数据在仓库里,模型却跑在别处。要用模型处理数据,就得先把几 TB 数据抽出来、传到模型服务、再把结果写回去。这条链路不仅慢,还带来复制成本与合规风险——数据每多一份副本,就多一处泄露可能。
而且大部分数据处理逻辑其实并不复杂,只是需要一点模型能力:给几百万条评论打个情感标签、把长文本压成摘要。为这点需求搭一整套模型服务,投入产出比很差。
于是「把计算搬到数据旁边」成为共识:既然数据已经在仓库里,就让模型能力以函数形式出现在 SQL 中,一行代码完成调用,数据原地不动。
03 它怎么工作
SQL 引擎在扫描数据的同时调用内置或托管的模型服务,把结果作为新的一列返回,全程在仓库内完成。
在 SQL 里调用模型发生了什么
- 1① 写 SQL
在查询中调用模型函数,指定输入列与任务类型。
- 2② 引擎并行
引擎把数据分块并行调用,自动处理批量与重试。
- 3③ 模型推理
请求在平台内的模型服务上执行,数据不离开仓库边界。
- 4④ 结果成列
模型输出作为新列返回,可直接写回表或继续参与聚合。
- 5⑤ 成本计量
按处理的 token 或行数计量,与仓库计算费分开统计。
04 谁在用它
批量文本处理
百万条评论做情感分类或摘要。
敏感数据的 AI 处理
合规要求数据不出仓库边界。
分析师自助使用 AI
不写 Python 也能用模型,会 SQL 就够。
特征工程
在数据管道里直接生成模型所需的特征列。
05 怎么用
从一个小样本开始验证效果,确认后再全量跑,避免一开始就烧掉大量额度。
- 01先对一百行数据试跑,检查结果质量。
- 02明确输出格式要求,让模型返回结构化内容。
- 03为调用结果建一张新表,保留原始列便于核对。
- 04设置成本上限,避免全量跑批失控。
避坑提示
- !模型输出不稳定,重要场景要抽样人工复核。
- !批量处理前先估算 token 消耗,成本往往被低估。
06 关键概念
- 库内计算
- 让代码或模型在数据所在处执行,避免大规模数据搬运。
- Snowpark
- 用 Python 等语言编写、但在仓库内执行的数据处理框架。
- 模型函数
- 把模型能力封装成可直接在 SQL 中调用的函数。
- token
- 模型处理文本的基本计量单位,也是计费依据。
07 容易混淆的对比
外部模型 API + 数据导出模型选择更自由,但有搬运成本与合规负担。
自建模型服务完全可控,但运维复杂,且仍需解决数据同步问题。