01 它是干嘛的
Workers AI 提供按调用付费的托管推理:把 Llama、Mistral、Whisper 等开源模型部署在边缘网络,用一套 API 直接调用。AI Gateway 则是模型调用的中间层,统一管理多个模型厂商的密钥、做缓存、做限速、记录每次调用的 token 与费用,便于成本与稳定性管理。
02 为什么会有它
调用大模型的三个现实麻烦:贵、乱、不可控
当团队开始在生产环境用大模型,很快会遇到三件事:一是账单不可控,不同团队各拿一把 API Key,月度费用到月底才知道;二是稳定性,某家模型服务抖动时无处降级;三是无法观测,出了问题不知道该看哪次调用、用了多少 token。
同时,很多任务(分类、情感判断、简单摘要)其实不需要顶级大模型,用一个小开源模型就够,但自己部署又需要 GPU 与运维。
Cloudflare 的两条产品线应对这两面:Workers AI 让「小模型 + 就近推理」变成 API 调用;AI Gateway 把「所有模型调用」收口到一条通道上,统一做缓存、重试、限流、成本归集。它不生产模型,而是做模型的基础设施层。
03 它怎么工作
业务代码只面对网关地址,网关按策略选择模型厂商,先查缓存再转发,途中记录 token 用量与延迟,返回后写出可观测的日志与指标。
一次大模型请求经过网关的完整旅程
- 1① 业务发起请求到网关
请求包含统一的鉴权,指向网关端点而非直接指向某家模型服务。
- 2② 命中缓存则直接返回
相同提示词与参数在有效期内重复出现时,直接返回历史结果,省钱又提速,适合客服问答等高频重复场景。
- 3③ 未命中则路由到目标模型
按策略选择模型:优先便宜的、额度充足的,或按任务类型分派;支持配置备用模型自动降级。
- 4④ 记录用量与延迟
每次调用的 token 数、耗时、状态码、成本都被记录,可按项目与团队归集账单。
- 5⑤ 限流与失败重试
设置速率上限防止某个应用刷爆额度,失败请求按策略重试或切换备用模型。
04 谁在用它
一个项目里同时用多家模型,用一套密钥与一套观测面板统一管理。
用缓存与限流压住重复调用与滥用,把大模型账单控制在预算内。
文本分类、意图识别、敏感内容过滤等轻任务用小模型就近处理,延迟低、成本低。
新模型先在网关侧小流量试跑,出问题切回旧模型,业务代码无需改动。
05 怎么用
不写代码也能先建好网关(控制台点几下),再接业务;Workers AI 则需要一点代码调用。
- 01控制台进入 AI → AI Gateway,创建一个网关,得到统一调用地址。
- 02在网关里添加各家提供商密钥(OpenAI、Anthropic、Google 等),密钥只存在平台侧。
- 03业务代码把 OpenAI 兼容请求的 base_url 指向网关地址,其余代码不变。
- 04开启缓存(可设 TTL),对客服、FAQ 这类重复度高的场景效果显著。
- 05设置速率限制与成本预算告警,避免异常流量导致账单失控。
- 06需要边缘小模型时,在 Workers 中通过 env.AI.run() 调用 Workers AI 上的开源模型。
// 1) 走网关调用第三方大模型:只换 base_url,业务逻辑不动
const res = await fetch(
'https://gateway.ai.cloudflare.com/v1/<account>/<gateway>/openai/chat/completions',
{
method: 'POST',
headers: { 'content-type': 'application/json', authorization: `Bearer ${env.AI_GATEWAY_TOKEN}` },
body: JSON.stringify({
model: 'gpt-4o-mini',
messages: [{ role: 'user', content: '用一句话解释什么是 CDN' }]
})
}
)
// 2) 直接在边缘跑开源模型:适合分类、摘要等轻任务
const out = await env.AI.run('@cf/meta/llama-3.1-8b-instruct', {
messages: [{ role: 'user', content: '把这句话翻译成英文:边缘计算' }]
})避坑提示
- !缓存只对「相同输入期望相同输出」的场景有效,涉及实时数据的问答不要开缓存。
- !把超时与降级策略提前配好,单一模型故障时业务应能自动切换而非整体不可用。
- !注意隐私与合规:提示词会经过网关,涉及个人敏感数据时先确认数据流向。
06 关键概念
- 推理(Inference)
- 让训练好的模型对输入给出输出,也就是「使用」模型的过程。
- Token
- 模型处理文本的最小单位,约等于一个词或半个汉字,计费按 token 数算。
- 网关(Gateway)
- 所有请求的必经关口,用来做鉴权、缓存、限流与统计。
- 降级
- 主服务不可用时自动切到备用方案,保证功能基本可用。