DALL·E 图像生成

DALL·E

你描述一段话,它画出一张图,还能按你说的圈一块改一块。

人工智能与模型出现时间 · 2021在 ChatGPT 订阅内提供生成额度,平台 API 按生成图片的尺寸与数量计费。文生图扩散模型图像编辑语义对齐
看官方文档

01 它是干嘛的

DALL·E 是文字生成图片的模型:把一段描述变成符合描述的图像。它最难的地方不是画得好看,而是「听懂」——你写的每个要素都要出现在画面里,还得组合得合理。它还支持按指令局部修改图片。

02 为什么会有它

让 AI 画图不难,难的是让它听懂你到底想要什么

在文字生成图片成熟之前,想得到一张特定画面只有两个办法:自己画(或找人画),或者去图片库里翻。图片库的问题是你只能挑「已经存在的」——想找一张「一只戴墨镜的柴犬在弹钢琴」的照片,大概率翻遍全网也找不到。找人画则又贵又慢。

早年的 AI 画图有个致命毛病:听不懂。你说「红色的车和蓝色的气球」,它可能给你蓝车红气球;你说「三只猫」,它画出两只或者五只。画面好不好看不缺,缺的是「你说什么它就画什么」——这在业内叫语义对齐。

DALL·E 把重点放在理解文字和画面的对应关系上:反复训练模型,让它把描述里的每个要素都落到画面的对应位置,不该有的东西别乱加。后来的版本还支持「指定区域重绘」——你说的那块它改,其余地方不动。从此「描述一句、得到一张专属图片」成了普通人随手可用的能力。

03 它怎么工作

图像生成和视频生成同属扩散模型:从随机噪点起步,反复去噪。区别在于,图片版把「文字理解」做到极细,每一步去噪都被文字描述牢牢牵着走,确保画面和你说的对上。

扩散模型:从一团噪声里「雕」出一张图全程指引「往哪个方向去噪」文字提示词「一只戴帽子的猫」编码为条件把语义变成模型能懂的方向随机噪声一开始完全是电视雪花逐步去噪重复 20-50 次成品图像清晰可用的画面第 1 步全是噪声第 20 步轮廓出现第 50 步细节完成每一步只做一件小事:判断「哪些像素像噪声、该去掉多少」。去噪主体条件引导与迭代过程
还是那张扩散图解,这里要看的是「文字描述」如何贯穿每一步去噪:每次擦掉噪点都被文字牵着走,确保最后画面里的东西和你写的一句句对得上,这就是语义对齐。

一张图从描述变成画面:文字如何约束去噪的每一步

  1. 1
    ① 解析描述

    模型先把你的文字拆解成若干要素:主体、数量、颜色、动作、环境、风格,并理解它们之间的关系。

  2. 2
    ② 从噪声起步

    生成开始时画布上是一整片随机雪花,没有任何具体内容。

  3. 3
    ③ 文字作为牵引

    每一步去噪,模型都会对照文字条件判断「当前画面离描述还差什么」,比如还没出现车就把车的样子逼出来。

  4. 4
    ④ 逐步成像

    噪点一点点褪去,轮廓、颜色、材质逐渐清晰,直到还原成一张完整图像。

  5. 5
    ⑤ 局部重绘与对齐

    需要修改时,圈出区域再给新描述,模型只在该区域内重新去噪,同时保证和周围画面融合自然,最终每个要素都对应上你的描述。

04 谁在用它

设计与创意

做海报、配图、插画草稿,快速出多个方案给客户挑。

内容配图

公众号、博客、社交媒体的配图,不用再去图库翻带版权的照片。

产品与电商

生成商品场景图、概念图、包装灵感,降低拍摄成本。

头像与定制图

生成专属头像、生日贺图、个性化图案,做礼物或自用都方便。

图像修改

把照片里多余的物体去掉、给画面加个元素、换一个背景。

05 怎么用

会说话就会用,把描述写清楚是唯一的门槛。

  1. 01在 ChatGPT 或平台里选择图像生成功能,用账号登录。
  2. 02用一句话描述你要的画面,尽量说清主体、动作、环境、风格、视角。
  3. 03生成后按需追问修改:换个颜色、去掉某个东西、加个元素,直接说就行。
  4. 04需要精修时,指定要改的区域再给新描述,其它部分保持不变。
  5. 05下载满意的图片,用到自己的项目里。

避坑提示

  • !描述要素越具体越好,模糊的「好看一点」帮不上忙。
  • !风格词很管用:说清是照片写实、水彩、3D 渲染还是简笔画,效果差别很大。
  • !图里的文字常常写不准、拼错,需要文字时最好后期自己加。
  • !生成图片同样有额度限制,商用前留意平台的使用条款。

06 关键概念

文生图
用一段文字描述直接生成对应的图像。
语义对齐
让画面的内容和你文字描述严格对上,是这类模型最核心的指标。
扩散模型
从随机噪声出发,反复去噪还原出图像。
局部重绘(Inpainting)
只在你指定的区域内重新生成,其余地方不动。

07 容易混淆的对比

Midjourney / Stable Diffusion同样是文生图;Midjourney 审美风格突出,Stable Diffusion 可本地部署、可控性更强。
传统图库便宜快,但只能挑已有的,找不到完全符合想象的画面,还有版权约束。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态