01 它是干嘛的
通义千问(Qwen)是阿里自研的大模型系列,走「开源权重 + 云上托管接口」双路线:模型权重公开可下载,企业可自行部署;同时通过百炼平台提供托管的调用接口,按量付费即开即用。百炼负责模型托管与调用,通义 App 则是面向普通用户的聊天产品,两者面向不同人群。
02 为什么会有它
大模型很强大,但「拥有」它并不容易
大模型出现后,很多团队想把它用进产品:客服问答、文档摘要、代码辅助、内容审核。但真正动手会遇到两类障碍。一是成本与门槛——训练一个大模型需要海量算力,自己从头做一个不现实;二是部署——即便拿到现成模型,想让它稳定对外服务,还需要一整套推理加速、并发处理、监控运维的工程。
另一类团队则相反:他们有能力自建,但不愿把数据交给外部服务,希望模型完全掌握在自己手里,可以随时改造、微调、私有化部署。开源权重正是为这类需求准备的:把模型文件下载下来,在自己机房里跑,数据不出门。
通义千问同时做了两件事,正是为了照顾这两类人。想省事、想快速上线的,直接用百炼平台调接口,几行代码就能用;想自主可控、做私有化的,可以下载开源权重自己部署。这种「开源加托管」双路线,让它在国内外都获得了大量开发者,也让中文开源大模型有了一个可长期依赖的选择。
03 它怎么工作
不管走托管接口还是自己部署,大模型生成回答的机制是一样的:把提示词转成 token 序列,模型逐个预测下一个 token,直到生成完整回答。区别只在「算力在哪台机器上」。
两种用法,一条推理链路:从输入到逐字生成
- 1① 组织提示词
把系统指令与用户问题拼成一段输入文本,这一步决定了模型「扮演什么角色、要做什么」。
- 2② 分词成 token
输入文本被切成 token(约等于一个词或半个汉字),模型内部只认识 token,不直接处理文字。
- 3③ 模型逐字预测
模型基于已输入的内容,预测下一个最可能的 token,再把它接回去继续预测,如此循环。
- 4④ 流式返回
生成的 token 会边算边通过接口流式返回,所以你看到回答是「一个字一个字」冒出来的。
- 5⑤ 选择托管或自建
用百炼则这一整套在云端完成、按 token 计费;自建则把开源权重部署在自己机器上,数据不外出。
04 谁在用它
把产品文档、常见问题接入,用接口搭建能理解自然语言的问答机器人。
生成营销文案、邮件草稿、商品描述,再由人工润色定稿。
在编辑器里补全代码、解释报错、生成测试用例,Qwen 系列在代码任务上有专门强化。
把长文档丢给模型,提炼要点、抽取表格中的关键字段。
对数据出域敏感的场景,下载开源权重在自有环境内运行,数据不外传。
05 怎么用
调托管接口只需几行代码;自建部署门槛更高,需要 GPU 与推理框架的知识。
- 01在百炼平台开通服务并创建 API Key,先试用免费额度。
- 02根据任务挑选合适的模型:轻任务用小的省钱,复杂任务用大的效果更好。
- 03用兼容 OpenAI 协议的 SDK 或 HTTP 接口发起请求,注意把密钥放在服务端。
- 04需要私有化或深度定制时,从开源仓库下载权重,在自有 GPU 环境部署。
- 05上线前做好提示词设计与效果评测,配合缓存与限流控制成本。
from openai import OpenAI
client = OpenAI(
api_key="<你的百炼 API Key>",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen-plus",
messages=[
{"role": "system", "content": "你是简洁的中文助手。"},
{"role": "user", "content": "用一句话解释什么是云计算。"},
],
)
print(resp.choices[0].message.content)避坑提示
- !API Key 只能放在服务端,任何写进前端代码的密钥都等于公开。
- !提示词越具体、给出示例,效果通常越好,别指望一句模糊的指令得到稳定结果。
- !模型会产生看似正确但其实错误的内容,涉及事实与数字的场景务必人工核实或接入检索。
06 关键概念
- 大语言模型
- 用海量文本训练出来、能够理解和生成自然语言的模型。
- Token
- 模型处理文本的最小单位,约等于一个词或半个汉字,计费按数量计算。
- 开源权重
- 把训练好的模型参数公开出来,任何人都可下载自行部署与改造。
- 百炼平台
- 阿里云的模型服务平台,负责模型的托管、调用与计费;区别于面向普通用户的通义 App。