Google 搜索

Google Search

你把想问的事打几个字,它从全网几百亿个网页里,把最可能有用的几条挑给你。

平台与商业出现时间 · 1998搜索对用户完全免费;广告主按点击竞价付费,是谷歌最核心的收入来源。搜索引擎爬虫倒排索引PageRank
看官方文档

01 它是干嘛的

搜索是谷歌的起点,也是整个商业帝国的入口。它做的事情是:派出程序把全网网页抓回来、建成一本可快速翻查的「索引字典」,用户输入关键词时,按内容相关度与网页的重要程度排序,再把结果与广告分开呈现。它解决的是「信息太多,人要自己一条条找」这个根本问题。

02 为什么会有它

1998 年之前:找资料像在一本按字数排序的电话簿里翻人

上世纪九十年代的搜索引擎,大多只会数关键词出现了多少次。一个网页只要把「手机」这个词重复贴上几百遍,就能排到第一,哪怕它是个骗人的垃圾站。真正写得好的页面反而被埋在后面。用户搜一个词,回来几万条结果,只能一页页翻,找到有用信息全靠运气和耐心。

雅虎走的是另一条路:雇人把网站手工分类,做成一棵目录树。质量高,但人工维护根本跟不上网页增长的速度,新页面要等很久才被收录,而且分类标准全凭编辑判断。

当时在斯坦福读博的拉里·佩奇和谢尔盖·布林想到了一个完全不同的角度:网页之间的「链接」其实是一种投票。如果很多重要网页都指向某一页,那这一页大概率是权威的;而重要网页本身的权重,又可以由指向它的链接算出来。这套「链接即投票」的思想就是 PageRank,它让排序第一次接近「谁的信用高」,而不是「谁把关键词抄得多」。

03 它怎么工作

整条主线是四步:爬虫把网页抓回来,解析后建成倒排索引,用户搜索时按「相关性 + 重要度」给候选页面打分排序,最后把广告和自然结果分栏摆放。

搜索引擎:不是实时去网上找,而是提前建好索引建索引(提前完成)查索引,而不是翻网页爬虫抓取顺着链接不断发现新页面解析与正文提取去掉广告和导航倒排索引「词 → 出现它的页面」清单你的关键词几亿人和你同时搜排序相关性 + 权重 + 时效结果页自然结果与广告分区展示广告位独立系统,单独标注你在 0.3 秒内得到结果,是因为答案早在几天前就被算好了。这也是为什么新页面需要「被收录」才有排名。速度的秘密商业结果(与自然结果分开)
重点看「爬虫 → 索引 → 排序」这三段流水线,以及页面右侧「广告」与「自然结果」被画成两条互不交叉的通道——这就是它区别于付费排名的关键。

一次搜索是怎么得到结果的:抓取、建索引、排序、分离广告

  1. 1
    ① 爬虫抓取

    谷歌的爬虫程序顺着网页里的链接一个接一个地访问,把网页内容取回来。这个过程持续不断,全网内容被反复刷新,保证新页面能被尽快发现。

  2. 2
    ② 解析与建倒排索引

    把网页正文拆成一个个词,记录「哪个词出现在哪些网页、出现的位置和次数」。这张「词到网页」的对照表叫倒排索引,它就是搜索几毫秒出结果的根本原因——不用读遍全网,直接查表。

  3. 3
    ③ 按关键词与权重排序

    用户输入关键词后,先按索引找出包含这些词的所有页面,再用几百项因素打分:词在标题还是正文、网页权威度如何(PageRank 的历史贡献就在这里)、内容是否新鲜、是否符合搜索意图。分数高的排前面。

  4. 4
    ④ 广告与自然结果分离

    谷歌坚持一条纪律:花钱买的广告必须明确标注,排在自然结果之外的独立位置,绝不能靠出钱把排名买到自然结果里去。这一步决定了它没有走上「谁给钱谁第一」的老路。

  5. 5
    ⑤ 返回结果页

    最终把十条左右的结果连同摘要、广告、地图卡片等一起返回。用户点不点某条结果,又会反过来成为优化排序的信号,形成闭环。

04 谁在用它

找资料与查事实

写论文、查新闻、核实一件事,用几个关键词就能定位到相关页面,是大多数人的上网第一站。

本地生活与导航

搜索附近餐厅、营业时间、路线,结果页直接给出地图与商家信息,不必再打开别的应用。

购物比价

输入商品名,购物卡片汇总各商家的价格与评价,帮助用户快速做决定。

企业投放获客

商家购买与业务相关的关键词,在用户主动搜索时展示广告,这是谷歌最主要的收入来源。

站内内容被收录

网站运营者通过规范结构和提交站点地图,让自己的页面能被抓取、出现在搜索结果中。

05 怎么用

普通用户打开网页就能用;站长想让自己的网站被收录,则需要一点配置工作。

  1. 01普通用户:直接在搜索框输入关键词,用引号包住精确短语、用减号排除某词等技巧可以让结果更准。
  2. 02站长第一步:在 Google Search Console 里验证网站所有权,这是与谷歌沟通收录问题的官方入口。
  3. 03提交站点地图(sitemap.xml),告诉谷歌哪些页面需要抓取,加快新内容的收录。
  4. 04在 Search Console 里查看哪些关键词带来了点击、哪些页面有收录错误,据此调整内容。
  5. 05需要程序化读取搜索数据时,使用 Search Console API 拉取查询表现数据,用于做报表或自动化监控。
使用 Search Console API 查询站点表现(示意)text
GET https://searchconsole.googleapis.com/webmasters/v3/sites/{siteUrl}/searchAnalytics/query
Authorization: Bearer <你的 OAuth 令牌>
Content-Type: application/json

{
  "startDate": "2026-09-01",
  "endDate": "2026-09-30",
  "dimensions": ["query", "page"],
  "rowLimit": 100
}

避坑提示

  • !关键词在标题与正文里自然出现即可,堆砌重复反而会被判定为垃圾内容而降权。
  • !新站收录需要时间,别指望提交后立刻出现,保持内容持续更新比反复提交更有效。
  • !广告位与自然结果永远是分开的,花钱只能买广告位,买不到自然排名。

06 关键概念

爬虫(Crawler)
自动顺着链接访问网页、把内容取回来的程序,搜索引擎的内容来源。
倒排索引
一张「词对应哪些网页」的对照表,让搜索引擎不必读完整个互联网就能快速找到相关页面。
PageRank
把链接当作投票来衡量网页权威度的算法,被重要页面链接得越多,说明这一页越可信。
自然结果 vs 广告
自然结果是算法排出来的,广告是花钱买的,两者在页面上被明确区分。

07 容易混淆的对比

必应(Bing)微软的搜索引擎,在部分地区与企业场景中份额可观,与 Windows 深度绑定。
百度中国主流搜索引擎,中文语境与本地服务覆盖更好,商业模式同样以搜索广告为主。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态