01 它是干嘛的
API 是 OpenAI 面向开发者的那半条业务线:模型由它训练好、部署好,开发者只要会发一个网络请求,就能把大模型能力接进自己的产品。使用时最需要搞懂四件事——按 token 计费、上下文窗口有多长、该选哪个档位的模型、以及别把速率限制撞爆。
02 为什么会有它
想让程序自己说话,过去得自己从零训一个模型
假设你想给公司做一个自动回复的客服。传统做法是自己收集数据、买显卡、训练模型、再搭服务对外提供——这需要一支 AI 团队和大量算力,中小公司根本玩不起。就像你想开一家餐厅,却得先自己去建农场、养牛种菜。
GPT-3 在 2020 年通过 API 开放,思路变了:模型由 OpenAI 训练好、部署好,你只需要发一个网络请求,把问题传过去,它把答案传回来。你不用懂模型是怎么训练的,也不用买显卡,按使用量付费。这就像发电厂集中发电、你插上插座就能用,不必自己在后院建一座电站。
这套接口后来陆续加上了图像生成、语音识别、语音合成、向量嵌入、文件检索等能力,慢慢变成一个「模型能力超市」。对开发者来说,最重要的从来不是背后用了什么技术,而是「发一个请求,就能得到想要的结果」。
03 它怎么工作
开发者发出的每个请求里,都藏着四件必须理解的事:token 怎么算钱、上下文窗口装得下多少字、该选哪个档位的模型、以及如何不把速率限制撞爆。
一次 API 调用背后:计费、上下文与模型分级
- 1① 组请求
你把「系统指令 + 历史对话 + 用户问题」拼成一段内容,发到 API 地址;这一整段都会被切成 token。
- 2② 选模型
平台提供从便宜快的模型到贵而强的旗舰模型多个档位,性能与价格基本成正比,任务简单就选便宜的。
- 3③ 算 token 与费用
输入和输出都按 token 计费,输出通常比输入贵。请求发出去之前,你的账单其实就大致定了。
- 4④ 受上下文窗口约束
所有内容加起来不能超过模型的上下文窗口上限,超了要么报错要么被截断,老对话就得先做摘要再丢弃。
- 5⑤ 受速率限制与配额约束
平台对每分钟请求数、每分钟 token 数设了上限,防止单个用户把资源占满;触发后会被限流或报错,需要退避重试。
04 谁在用它
客服机器人、智能搜索、内容审核、自动摘要,直接接 API 比自己训模型省下几个数量级。
给成千上万条用户评论做情感分类、给几千份合同抽取信息,写个脚本循环调用即可。
在内部工具、CRM、办公软件里嵌入 AI 能力,最终用户感觉不到背后调了接口。
先花几美元用 API 验证产品点子行不行,验证通过再谈工程化,试错成本极低。
用少量自己的数据对基础模型做微调,让它更懂你的行业术语和说话风格。
05 怎么用
需要会写代码(任何语言都行),但跑通第一个请求可能只要十分钟:拿到密钥,发一个请求。
- 01在平台注册并创建 API Key,妥善保存,它等于你的钱包密码。
- 02在账户里充值(预付费),并设定用量上限,避免意外账单。
- 03用官方 SDK(Python / Node)或直接发 HTTP 请求,把密钥放进请求头。
- 04先用最便宜的小模型跑通流程,再按效果决定要不要换更强的模型。
- 05上线前把错误重试、超时、限流退避写好,再配上用量监控。
from openai import OpenAI
client = OpenAI() # 从环境变量 OPENAI_API_KEY 读取密钥
resp = client.chat.completions.create(
model="gpt-4o-mini", # 便宜的快模型,适合先跑通
messages=[
{"role": "system", "content": "你是一个只说重点的助手。"},
{"role": "user", "content": "用一句话解释什么是 token"},
],
temperature=0.3, # 温度越低越稳定
)
print(resp.choices[0].message.content)
print(resp.usage.total_tokens) # 本次消耗的 token 数,用于估算费用避坑提示
- !一定要设用量上限和预算告警,否则一个写错的循环可能一夜就烧掉很多钱。
- !输入和输出都计费,且输出更贵;能本地做的过滤、截断先做,别把整本手册都塞进去。
- !速率限制按账户和模型分档,高峰期会撞到上限;生产环境必须写重试与退避。
- !密钥绝对不能写进前端代码或提交到代码仓库,一旦泄露可能被刷爆。
06 关键概念
- API
- 程序之间说话的一套约定。你不用懂背后,按格式发请求、收结果即可。
- token
- 计费和长度的单位,输入输出都算,一句话大概十几个 token。
- 上下文窗口
- 一次请求能装下的最大 token 数,是模型短期记忆的上限。
- 速率限制(Rate Limit)
- 平台给每个账户设的「每分钟最多用多少」,防止单个用户拖垮整体。
- 微调(Fine-tuning)
- 用你自己的少量数据再训练一下基础模型,让它更贴合特定任务。