Workers AI 与 AI Gateway

Workers AI / AI Gateway

在边缘直接跑开源 AI 模型,以及给你的大模型调用加一层「收费站 + 监控 + 缓存」。

人工智能与模型出现时间 · 2023 年前后AI Gateway 免费使用;Workers AI 按神经元(计算量)计费,每天有免费额度。AI 推理模型托管网关成本控制
看官方文档

01 它是干嘛的

Workers AI 提供按调用付费的托管推理:把 Llama、Mistral、Whisper 等开源模型部署在边缘网络,用一套 API 直接调用。AI Gateway 则是模型调用的中间层,统一管理多个模型厂商的密钥、做缓存、做限速、记录每次调用的 token 与费用,便于成本与稳定性管理。

02 为什么会有它

调用大模型的三个现实麻烦:贵、乱、不可控

当团队开始在生产环境用大模型,很快会遇到三件事:一是账单不可控,不同团队各拿一把 API Key,月度费用到月底才知道;二是稳定性,某家模型服务抖动时无处降级;三是无法观测,出了问题不知道该看哪次调用、用了多少 token。

同时,很多任务(分类、情感判断、简单摘要)其实不需要顶级大模型,用一个小开源模型就够,但自己部署又需要 GPU 与运维。

Cloudflare 的两条产品线应对这两面:Workers AI 让「小模型 + 就近推理」变成 API 调用;AI Gateway 把「所有模型调用」收口到一条通道上,统一做缓存、重试、限流、成本归集。它不生产模型,而是做模型的基础设施层。

03 它怎么工作

业务代码只面对网关地址,网关按策略选择模型厂商,先查缓存再转发,途中记录 token 用量与延迟,返回后写出可观测的日志与指标。

大模型是怎么「一个字一个字」把话说出来的自回归循环:把新词接回去,再猜下一个你的输入一句话 / 一段文档切成 token大约半个汉字一块大模型几十亿到上万亿参数按概率挑一个温度高更发散、低更保守输出一个词然后接回输入继续猜模型一次只算「下一个词最可能是什么」,所以输出越长 = 循环次数越多 = 越慢也越贵。算力消耗集中在这里每次循环处理一个 token
图下方是 token 逐字生成的机制:模型一次只预测下一个词,循环几十上百次才拼出一段回答,这也解释了为什么输出越长越慢越贵。

一次大模型请求经过网关的完整旅程

  1. 1
    ① 业务发起请求到网关

    请求包含统一的鉴权,指向网关端点而非直接指向某家模型服务。

  2. 2
    ② 命中缓存则直接返回

    相同提示词与参数在有效期内重复出现时,直接返回历史结果,省钱又提速,适合客服问答等高频重复场景。

  3. 3
    ③ 未命中则路由到目标模型

    按策略选择模型:优先便宜的、额度充足的,或按任务类型分派;支持配置备用模型自动降级。

  4. 4
    ④ 记录用量与延迟

    每次调用的 token 数、耗时、状态码、成本都被记录,可按项目与团队归集账单。

  5. 5
    ⑤ 限流与失败重试

    设置速率上限防止某个应用刷爆额度,失败请求按策略重试或切换备用模型。

04 谁在用它

多模型统一接入

一个项目里同时用多家模型,用一套密钥与一套观测面板统一管理。

AI 功能的成本控制

用缓存与限流压住重复调用与滥用,把大模型账单控制在预算内。

边缘小模型任务

文本分类、意图识别、敏感内容过滤等轻任务用小模型就近处理,延迟低、成本低。

灰度与降级

新模型先在网关侧小流量试跑,出问题切回旧模型,业务代码无需改动。

05 怎么用

不写代码也能先建好网关(控制台点几下),再接业务;Workers AI 则需要一点代码调用。

  1. 01控制台进入 AI → AI Gateway,创建一个网关,得到统一调用地址。
  2. 02在网关里添加各家提供商密钥(OpenAI、Anthropic、Google 等),密钥只存在平台侧。
  3. 03业务代码把 OpenAI 兼容请求的 base_url 指向网关地址,其余代码不变。
  4. 04开启缓存(可设 TTL),对客服、FAQ 这类重复度高的场景效果显著。
  5. 05设置速率限制与成本预算告警,避免异常流量导致账单失控。
  6. 06需要边缘小模型时,在 Workers 中通过 env.AI.run() 调用 Workers AI 上的开源模型。
通过 AI Gateway 调用模型 + 边缘小模型ts
// 1) 走网关调用第三方大模型:只换 base_url,业务逻辑不动
const res = await fetch(
  'https://gateway.ai.cloudflare.com/v1/<account>/<gateway>/openai/chat/completions',
  {
    method: 'POST',
    headers: { 'content-type': 'application/json', authorization: `Bearer ${env.AI_GATEWAY_TOKEN}` },
    body: JSON.stringify({
      model: 'gpt-4o-mini',
      messages: [{ role: 'user', content: '用一句话解释什么是 CDN' }]
    })
  }
)

// 2) 直接在边缘跑开源模型:适合分类、摘要等轻任务
const out = await env.AI.run('@cf/meta/llama-3.1-8b-instruct', {
  messages: [{ role: 'user', content: '把这句话翻译成英文:边缘计算' }]
})

避坑提示

  • !缓存只对「相同输入期望相同输出」的场景有效,涉及实时数据的问答不要开缓存。
  • !把超时与降级策略提前配好,单一模型故障时业务应能自动切换而非整体不可用。
  • !注意隐私与合规:提示词会经过网关,涉及个人敏感数据时先确认数据流向。

06 关键概念

推理(Inference)
让训练好的模型对输入给出输出,也就是「使用」模型的过程。
Token
模型处理文本的最小单位,约等于一个词或半个汉字,计费按 token 数算。
网关(Gateway)
所有请求的必经关口,用来做鉴权、缓存、限流与统计。
降级
主服务不可用时自动切到备用方案,保证功能基本可用。

07 容易混淆的对比

OpenRouter聚合多家模型的统一 API,偏重模型可得性与价格比较。
LiteLLM(自建网关)开源自建方案,控制力最强,但需要自己运维与扩展。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态