01 它是干嘛的
Llama 是 Meta 公开发布的一系列大语言模型,最大特点是「开源权重」:模型训练完成后,把那份动辄几十上百 GB 的参数文件直接放出来供任何人下载,而不是只提供一个按次收费的网络接口。它用「模型免费」换取开发者生态与行业影响力,与只提供闭源接口的路线形成鲜明对照。
02 为什么会有它
当最强的大模型只肯隔着网络接口使用,Meta 选择把文件送出去
2022 年底 ChatGPT 出现之后,最好的大模型基本只能通过厂商的接口使用:数据必须先上传到别人的服务器,用多少按字数付费,模型不能改,也不能装进自己机房。对医院、银行、工厂这类数据绝不能出门的机构来说,能力再强也用不上,这是闭源路线最硬的墙。
闭源还意味着「租用」。模型被锁在少数公司手里,价格、规则、每天能用多少全由对方说了算,订单一停业务就断。研究者更憋屈:只能看到输入输出,看不到模型内部,连它为什么答错都无从查起,学术进步被卡住。
Llama 的做法像把菜谱和半成品一起交出来:2023 年前后 Meta 陆续放出多个版本的模型权重,允许别人下载、微调、甚至商用。这一步让「自己拥有一套大模型」第一次变得可行,也逼得整个行业重新讨论开源与闭源的边界。
03 它怎么工作
大模型并不是想好整段话再打印,而是一次只预测「下一个字」,把预测结果接到句子末尾,再预测下一个,循环往复直到说完,所以回答越长越慢。
一次回答是怎么被一个字一个字吐出来的:模型推理全过程
- 1① 把问题切成词元
你的问题先被拆成一个个最小的文字单位(词元),每个词元换算成一串数字,机器只认识数字。
- 2② 计算上下文
模型逐层处理这些数字,注意力机制让每个词都去「看一眼」前后其他词,从而理解语序与指代关系。
- 3③ 预测下一个词元
模型输出一个概率分布,表示下一个位置最可能是什么字,通常挑概率最高的那个。
- 4④ 接到末尾再循环
选中的词元被追加到句子后面,整句话重新送进模型,重复第 2 到 3 步,一个字一个字往外蹦。
- 5⑤ 遇到结束标记停止
当模型预测出表示「说完了」的特殊标记,或者达到长度上限,生成过程结束,整段文本返回给你。
04 谁在用它
医院、银行、制造企业把模型装进自己的机房,敏感数据不出内网,合规部门才肯放行。
用自家十几年的行业语料继续训练,得到一个懂本行业黑话的小模型,比通用大模型更准更省。
因为能看到权重与训练细节,高校可以复现实验、研究模型为何出错,这是闭源模型给不了的。
文本分类、摘要、客服自动回复这类每天调用几百万次的任务,自建小模型比按次付费便宜得多。
在没有稳定网络的设备上跑一个轻量版本,离线也能做翻译、转写、问答。
05 怎么用
门槛中等:不需要自己训练,但要准备一块够大的显卡或租一台带显卡的云主机,会用 Python 就能上手。
- 01确认硬件:7B 级别的小模型一张消费级显卡即可,70B 级别通常需要多卡或专业显卡。
- 02从官方模型仓库申请并下载权重文件(部分版本需先同意许可协议)。
- 03安装依赖:Python 环境加上 transformers、torch 等库(或用 llama.cpp、Ollama 等更轻量的运行工具)。
- 04写一小段代码把模型加载进显存,喂一句提示词,看它能不能正常回答。
- 05调参数:控制回答长度的上限、随机程度等,让输出更稳或更有创意。
- 06要上线时用推理服务器把模型包成接口,再让业务系统按普通网络请求调用。
from transformers import AutoTokenizer, AutoModelForCausalLM
# 模型文件下载到本地后,这里的路径换成你自己存放的位置
model_id = "meta-llama/Llama-3.1-8B-Instruct"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
messages = [{"role": "user", "content": "用一句话解释什么是开源模型"}]
inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
out = model.generate(inputs.to(model.device), max_new_tokens=128)
print(tok.decode(out[0][inputs.shape[-1]:], skip_special_tokens=True))避坑提示
- !显存不够就先试更小的版本,小模型调好了往往比大模型硬塞更划算。
- !开源权重不等于随便用:每个版本都有自己的许可协议,商用前务必读一遍条款。
- !模型会一本正经地编造事实,「胡说」是它的固有毛病,关键业务一定要人工复核或接入资料库校验。
06 关键概念
- 权重
- 模型训练完得到的那一大堆数字文件,相当于模型的「大脑」。开放权重就是把大脑交给你。
- 参数规模
- 常说的 7B、70B,指的是模型里数字的总量,越大通常越聪明,也越吃显存。
- 词元(Token)
- 模型眼里的最小文字单位,约等于一个词或半个汉字,计费和速度都按它算。
- 微调
- 在别人的模型基础上,用你自己的数据再教一遍,让它更懂你的业务。