深度求索(DeepSeek)是一家以「开源权重 + 极低推理成本」占据心智的中国大模型公司,2023 年在杭州成立。它最被人记住的一点是:当全球同行普遍把最好的模型锁在自家接口后面时,它选择把模型的「权重」直接公开下载,任何人都能拿去用、去改、去私有部署。
2025 年初,推理模型 DeepSeek-R1 发布,因为它把「长思维链推理」这项能力做得相当扎实、又几乎免费开放,并给出可复现的技术路径,引发全球范围的关注与讨论。很多人第一次意识到,顶级推理能力并不一定需要付出极其高昂的调用价格。
技术层面,它有一串鲜明标签:MoE(混合专家)、MLA(多头潜在注意力)、FP8 训练、以及用强化学习训练出长思维链。这些名词听起来吓人,但换成大白话只讲两件事——怎么用更少的算力做更多的事,以及怎么让模型学会一步步想问题。