DeepSeek-R1 推理模型

DeepSeek-R1

一个答题前会先在心里打草稿、把步骤想清楚的模型。

人工智能与模型出现时间 · 2025 年前后权重已公开可下载;通过官方 API 调用按 token 计费,因输出更长,单次成本通常高于普通模型。推理模型强化学习长思维链数学代码
看官方文档

01 它是干嘛的

DeepSeek-R1 是一款「推理模型」,专注需要多步思考的难题,比如数学、编程和复杂逻辑。它的特别之处不在嘴上说得漂亮,而在于它会先展开一段较长的思考过程,再给出结论。R1 的发布让「用强化学习训练出长思维链」这条路被更多人看见与复现,也让顶级推理能力的门槛明显降低。

02 为什么会有它

为什么普通模型一遇到多步数学题就容易翻车

传统模型习惯「脱口而出」:你问什么,它凭直觉给个答案。这种模式在闲聊、写作上挺好,可一旦遇到需要一步步推演的数学题或复杂编程任务,就很容易在中间某步出错。就像考试时不许打草稿,全靠心算,错一步后面全错,而且它自己还浑然不觉。

人的做法是打草稿:把每一步写下来,检查上一行对不对,再往下走。问题是怎么让模型学会这一套?写死规则行不通,因为题目千变万化。

R1 的办法是「用奖励来教方法」。训练时不只是告诉它标准答案,而是设计规则去奖励那些「推理过程正确、步骤清晰」的回答,惩罚那些靠瞎猜蒙对或过程混乱的回答。模型为了让奖励更高,自己摸索出了「先想清楚再作答」的习惯,逐步长出很长的思维链。这套做法叫强化学习——不是手把手教,而是立好奖惩,让它自己练出来。

03 它怎么工作

核心是把「给出答案」变成一场反复练习:模型先尝试回答,系统按推理过程是否严谨给出奖励,模型据此调整自己,下一轮再试。循环多轮之后,它自发地学会了展开长思维链。

训练:反复猜、反复纠错,几万轮之后它就会了误差有多大梯度:该往哪调再来一轮(成千上万轮)训练数据海量文本与代码前向计算让模型猜一个答案算损失猜得离标准答案差多远反向传播算出每个参数该怎么调更新参数朝更准的方向挪一小步检查点存成可随时取用的权重训练没有魔法:就是「猜 → 比较 → 微调参数」循环几十万次,差别只在于数据量、算力与调参技巧。误差评估数据与梯度流向
看图中那个「尝试—评分—调整—再尝试」的循环:关键不是喂给它标准答案,而是用奖励引导它自己长出好的思考方式;右侧较长的思考路径,就是训练后出现的长思维链。

它是怎么学会先想再答的:一个用奖励驱动的训练闭环

  1. 1
    ① 拿到题目开始尝试

    训练时给模型大量有标准答案的难题,让它先自己试着回答一遍,并展示思考过程。

  2. 2
    ② 输出一段长思维链

    模型在给出最终答案前,先一步步写下推理:假设是什么、下一步怎么算、结论从哪来。

  3. 3
    ③ 按规则给出奖励

    系统检查答案对不对,同时评估推理过程是否严谨合理,据此打分——答案对且过程清晰,奖励就高。

  4. 4
    ④ 依据奖励调整自己

    模型根据奖励高低微调内部参数,让「更可能拿高分」的思考方式更容易被再次使用。

  5. 5
    ⑤ 循环往复,思维链变长

    经过很多轮这样的练习,模型自发学会把问题想得更细、更愿意自我检查,推理能力随之提升。

  6. 6
    ⑥ 使用时长思考、慢作答

    实际用时,它先展开一段较长的内部推理,再给出结论,因此更准,但也更慢、更费资源。

04 谁在用它

数学解题与教学

面对应用题、竞赛题,它能一步步演算,并把过程讲清楚,方便学习者理解。

编程与调试

复杂算法、跨文件改代码时,先想清楚逻辑再动手,出错率明显低于直接作答的模型。

逻辑推理与决策辅助

需要多步推演的场景,例如方案权衡、条件推理,它会把思路摊开给你看。

科研与复杂分析

对严谨性要求高、需要可核查推理链的任务,能看到过程比只看结论重要得多。

05 怎么用

可通过对话助手或开放平台直接使用;普通用户无需任何技术准备,开发者则按 API 文档调用。

  1. 01最简单的用法:在对话入口切到推理模式,把难题交给它。
  2. 02提问时把条件、目标和约束讲清楚,推理模型尤其吃「信息完整」这一套。
  3. 03耐心等它想完,推理模型本来就慢,中途打断就白想了。
  4. 04拿到答案后重点看它的推理链,检查每一步是否站得住,而不是只看最后那句结论。
  5. 05开发者调用 API 时,为推理留出足够的输出长度预算,避免思考中途被截断。
  6. 06把复杂任务拆小、分批提问,往往比一次性丢一个大难题效果更好。

避坑提示

  • !推理模型更慢、输出更长,因而更贵;能靠普通模型解决的简单任务不要硬用它。
  • !思维链不等于一定正确,它只是把思路写清楚,仍需要你自己核对关键步骤。
  • !提问时信息给全,推理模型最怕条件不全,它会顺着错误前提一路推到底。

06 关键概念

推理模型
答题前会先展开一段较长的思考过程再给结论的模型,慢但更擅长难题。
思维链
模型把推理一步步写出来的那条路径,让人能看清它是怎么从条件走到结论的。
强化学习
不手把手教,而是立好奖惩规则,让模型自己反复尝试、逐步摸索出好的做法。
奖励信号
训练中给模型打的分数,答案对且过程好就加分,模型据此调整自己。

07 容易混淆的对比

普通对话模型(如 V3)直接作答、速度快、成本低,适合日常任务;难题才轮到推理模型上场。
其他推理模型国际同行也有同类产品,思路相通,优劣多在推理深度、速度与价格之间权衡。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态