01 它是干嘛的
Gemini 是谷歌的大模型家族,既能作为聊天助手直接服务普通用户,也能通过接口供开发者调用。它的特点是「多模态」:不只处理文字,还能理解图片、音频和视频。它解决的是「让人用自然语言指挥计算机干活」这件事,从写文案、总结长文档,到看图回答问题、生成代码。
02 为什么会有它
2023 年之前:机器只会做一件专门的活,换个任务就失灵
过去的人工智能是一个个独立的专用工具:翻译有翻译的模型,识图有识图的模型,语音识别又是另一套。它们各管一摊,彼此不通。你想让机器「看看这张图里有什么问题,再写段说明」,得把好几个工具拼起来,中间还要人工转换,稍微复杂一点的需求就做不了。
这些模型还需要专门准备标注数据来训练每一个任务,成本高、周期长,而且效果有限,只能应对很窄的场景,一旦输入的形式和训练时不太一样,表现就急转直下。
大模型改写了这个局面:用海量文字、图片、音频一起训练一个足够大的模型,让它学会通用的语言与常识,之后不换模型、只换提问方式,就能完成翻译、总结、写代码、看图等完全不同的事情。Gemini 就是谷歌沿着这条路推出的多模态大模型,它把文字、图像、音频、视频放进同一套理解框架里,让「用一个 AI 干很多事」从设想变成日常。
03 它怎么工作
大模型本质上是一台超级「接话机」:把你输入的内容转成数字表示,然后根据学过的规律,一次次预测最可能的下一个词,逐个拼出整段回答。它不查数据库,全靠训练时记住的规律来生成。
它到底是怎么「想」出回答的:一个字一个字往外猜
- 1① 输入被切成小块(Token)
你的文字先被切成一个个小片段,常见词或半个词算一块,每块对应一个编号。图片、音频也会被转成类似的数字表示。
- 2② 转成数字向量
每个片段被转换成一组数字,可以理解为它在「语义空间」里的坐标,意思相近的内容坐标也相近,模型靠这个来理解含义。
- 3③ 逐字预测下一个词
模型根据前面所有内容,算出下一个词最可能是什么,挑出一个输出,再把这个词接回输入,继续预测下一个,如此往复。
- 4④ 反复循环直到结束
每多生成一个词就多算一遍,所以回答越长耗时越久、成本越高。它并不知道答案对错,只是在按概率往外接话。
- 5⑤ 输出结果
直到模型判断该结束,整段回答拼装完成返回。这也解释了为什么它会「一本正经地胡说」——它追求的是像,而不是真。
04 谁在用它
起草邮件、方案、文案,或把一段话改得更简洁、更正式,快速拿到初稿再人工调整。
把报告、论文、合同丢进去,让它提炼要点,或针对内容直接提问,快速抓住重点。
上传图片让它描述内容、识别图表、解释界面,配合文字一起理解,不必再切换专门工具。
生成代码片段、解释报错、把一种语言翻译成另一种,显著加快开发速度,但仍需人工审查。
作为通用助手回答问题、做规划、翻译、算账,嵌入在搜索与办公工具中随时可用。
05 怎么用
普通用户直接在网页或应用里对话即可;开发者需要用密钥调用接口。
- 01普通用户:打开对话界面,用自然语言提问,可以上传图片或文件一起给模型参考。
- 02把复杂任务拆成几步来问,或在提问里给出背景与格式要求,得到的回答通常更贴合需要。
- 03开发者:在开发者平台申请接口密钥,按官方文档发起调用。
- 04调用时选择合适规模的模型——简单任务用小模型更快更便宜,复杂任务再用大模型。
- 05把模型接入自己的应用,并做好输入校验与输出审核,避免把不合适的内容直接展示给用户。
import { GoogleGenAI } from '@google/genai'
const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY })
const res = await ai.models.generateContent({
model: 'gemini-2.0-flash',
contents: '用三句话解释什么是数据仓库'
})
console.log(res.text)避坑提示
- !模型会编造看似合理但错误的内容,涉及事实、数字、法律与医疗的内容务必人工核实。
- !不要把密钥写进前端代码,密钥一旦公开会被盗用并产生费用。
- !回答越长越慢越贵,用简洁的提示词与合适的模型档位能显著控制成本。
06 关键概念
- 大模型(LLM)
- 用海量数据训练出来的巨型语言模型,能理解与生成自然语言。
- 多模态
- 同一个模型能同时处理文字、图片、音频、视频等多种形式的输入。
- Token
- 模型处理内容的最小单位,约等于一个词或半个汉字,费用通常按它计算。
- 幻觉
- 模型一本正经地给出错误或编造的内容,因为它追求像真的而不是真的事实。