ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

什么是网络索引?它是如何工作的?

什么是网络索引?它是如何工作的? 在搜索引擎中输入查询内容结果会在瞬间出现。感觉就像搜索引擎替你读取了整个互联网但实际上并非如此。它读取的是一份已经预先准备好、整理和存储的副本——这份副本就是它的网络索引。本指南涵盖了网站索引的本质、抓取-索引-排名流程的工作原理、为什么一些明明不错的页面会被遗漏以及如何加快您自己网站的索引速度。网络索引是如何工作的网络索引过程包括四个阶段发现——URL如何首先进入抓取队列。爬虫——查看网址并获取其中的内容。索引——解析、解释和存储获取到的内容。排名——在用户搜索时根据特定查询对存储的页面进行排序。人们很容易将此想象成一条流水线每个页面只经过一次。但事实并非如此。这个过程是持续进行的爬虫会按计划重新访问已知的URL索引会不断更新或修剪排名也会针对每次查询重新计算而不是预先存储。另一个需要尽早牢记的要点是每个阶段都是一个筛选器。页面会在每个步骤中被淘汰只有通过所有筛选的页面才能出现在搜索结果中。网络爬虫网络爬虫也称为蜘蛛或机器人是能够自动请求网页的程序。Googlebot、Bingbot 和 YandexBot 是最知名的例子但几乎所有搜索引擎和大多数人工智能数据管道都运行着网络爬虫。核心循环很简单。爬虫程序首先维护一个已知URL列表然后逐个请求该列表读取HTML代码提取找到的所有链接并将新URL添加到队列中如此循环往复。如果不加干预这个循环永远不会结束因为网络会不断产生新的链接。新页面通过以下四个主要途径进入队列内部链接。最可靠的途径。如果爬虫程序已经访问了你的网站链接就是它找到网站其余部分的方式。反向链接。来自已被搜索引擎抓取的外部页面的链接可以将你的网址介绍给从未访问过你网站的搜索引擎。XML 站点地图。一个机器可读的 URL 列表其中包含您认为值得抓取的 URL并可选择添加最后修改日期。直接提交。像 Google Search Console 或 Bing 网站站长工具这样的工具允许您提交特定的网址。在向域名发出任何其他请求之前一个行为良好的爬虫会请求 robots.txt 文件——这是一个位于网站根目录的纯文本文件它告诉自动化客户端应该或不应该向哪些地方发送请求。以下是一个最简示例复制span stylebackground-color:#f5f6fa !importantcodeUserspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a-/span/spanagentspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a*/span/span span stylecolor:#990055Disallow/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#ee9900/cart//span span stylecolor:#990055Disallow/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spansearchspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a?/span/span span stylecolor:#990055Allow/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spansearchspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a?/span/spanqspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanfeatured span stylecolor:#990055Sitemap/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span httpsspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanexamplespan stylecolor:#99a0b7./spancomspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spansitemapspan stylecolor:#99a0b7./spanxml/code/span以下是请求逐行执行的过程用户代理*将规则应用于每个爬虫禁止标记爬虫应该跳过的路径允许从不允许的模式中划出一个例外网站地图指向您的 URL 列表这是目前向 Google 提供网站地图的两种受支持方式之一。一个细微差别常常让许多团队犯错。禁止抓取规则会阻止符合规范的爬虫抓取页面但并不会将该页面从索引中移除。如果其他网站链接到该 URL搜索引擎仍然可以收录它——通常不会添加任何描述因为它从未被允许读取页面内容。要将某个页面完全排除在索引之外需要在爬虫可以抓取的页面上添加noindex指令。在被禁止抓取的 URL 上使用noindex标签是自相矛盾的爬虫无法读取它应该遵守的指令。请求返回的结果与请求本身同样重要。这些状态码决定了网络爬虫和索引的进程代码意义对爬取和索引的影响200好的页面加载成功可以进行索引。301永久搬迁这标志着一次永久性迁移。排名信号将整合到目标 URL新 URL 将取代旧 URL 被索引。302已找到临时这表示临时重定向。搜索引擎通常会保留原始 URL 的索引因此对于永久性更改来说302 重定向并非理想之选。而且如果 302 重定向持续存在足够长的时间最终也会被视为永久性重定向。304未修改告诉爬虫自上次访问以来没有任何变化。这样可以节省双方的带宽并有助于节省爬取预算。404未找到页面无故消失。搜索引擎会重新检查一段时间然后才会将其从索引中移除。410已消失明确表示“永久删除”。通常比 404 错误删除速度略快谷歌称两者差异很小。429请求过多服务器要求降低抓取速度。持续出现的 429 错误会减少网站内容的抓取量。503暂停服务视为临时措施。短期维护期间效果良好但如果持续数日则会对索引造成损害。有些页面根本不会被抓取。常见原因如下没有任何链接指向这些页面。既不在站点地图中也没有任何外部链接的孤立页面实际上处于隐形状态。robots.txt 规则会将它们排除在外。通常是无意的通过类似这样的广泛模式。span stylebackground-color:#f5f6fa !importantcodespan stylecolor:#990055Disallow/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:slategray/*?/span/code/span抓取预算会耗尽。搜索引擎会根据服务器容量和网站的价值为每个网站分配有限数量的请求。分面导航、会话 ID 和无穷无尽的 URL 参数都会在几乎相同的页面上迅速消耗掉这些分配的资源。服务器速度慢或不稳定。当网站响应缓慢或返回错误时爬虫会降低请求频率因此每次访问获取的 URL 数量也会减少。网页内容需要登录、付费或填写表单才能访问。如果爬虫无法匿名访问那么在索引中它就不存在。这个页面位置很隐蔽。从首页点击七八次就能找到的网址即使被抓取也很少被抓取。页面索引成功获取页面后页面会进入处理阶段但不会进入索引。接下来的操作决定了页面是否会被存储。解析和渲染。引擎会将 HTML 分解成各个组成部分文本、标题、链接、图像 alt 属性和语义元素。由于现代网络的大部分内容都是在浏览器中构建的因此引擎也会渲染页面并像浏览器一样执行 JavaScript。渲染开销很大所以它会在一个单独的队列中执行。因此只有在客户端 JavaScript 运行后才存在的内容会被稍后索引如果脚本运行失败或依赖于爬虫无法加载的资源则有时甚至根本不会被索引。元数据提取。标题、元描述、标题层级、hreflang 标签和结构化数据会被提取出来并与文本一起存储。这些信息本身并不决定排名但它们会影响页面的理解方式以及页面在搜索结果中的显示方式。规范化。同一内容通常可以通过多个 URL 访问有的 URL 末尾带有斜杠有的不带有斜杠有的带有跟踪参数有的以打印视图显示有的则属于多个类别。搜索引擎会将这些重复的 URL 聚类并选择其中一个版本即规范版本进行索引。您可以这样设置您的偏好span stylebackground-color:#f5f6fa !importantcodespan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanlink relspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylecolor:#109d8ccanonical/span hrefspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylecolor:#109d8chttps://example.com/page/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/span/code/span这段代码放在head标签内告诉搜索引擎你认为哪个 URL 是内容的主要版本这样排名信号就会集中到该 URL而不是分散到重复的 URL 上。这只是一个强烈的提示而不是命令所以如果你的内部链接、站点地图和重定向都指向其他位置搜索引擎仍然可能会选择不同的规范 URL。结构化数据。Schema.org标记通常以 JSON-LD 格式提供以无需解释的格式描述页面内容。它使搜索引擎能够识别出页面是一份烹饪时间为 40 分钟的食谱而不是一篇提及烹饪的文章span stylebackground-color:#f5f6fa !importantcodespan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanscript typespan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylecolor:#109d8capplication/ldjson/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/span span stylecolor:#99a0b7{/span span stylecolor:#109d8ccontext/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#109d8chttps://schema.org/spanspan stylecolor:#99a0b7,/span span stylecolor:#109d8ctype/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#109d8cArticle/spanspan stylecolor:#99a0b7,/span span stylecolor:#109d8cheadline/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#109d8cWhat Is Web Indexing? And How It Works/spanspan stylecolor:#99a0b7,/span span stylecolor:#109d8cdatePublished/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#109d8c2026-07-22/spanspan stylecolor:#99a0b7,/span span stylecolor:#109d8cauthor/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#99a0b7{/span span stylecolor:#990055type/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#109d8cOrganization/spanspan stylecolor:#99a0b7,/span span stylecolor:#990055name/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/span span stylecolor:#109d8cOxylabs/span span stylecolor:#99a0b7}/span span stylecolor:#99a0b7}/span span stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanscriptspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/span/code/span准确的结构化数据使页面符合富媒体搜索结果的条件并为人工智能驱动的搜索工具提供更清晰的信号使其了解正在读取的内容。即使经过所有这些步骤已抓取的页面仍然可能未被索引。常见原因noindex 指令。明确且绝对——引擎会遵守它。内容重复。已选择另一个 URL 作为规范 URL因此此 URL 仅作为对该集群的引用而存储。内容单薄。标签存档、几乎空白的分类页面、自动生成的地点页面甚至还替换了一个词。感知价值低。正确的索引需要存储和计算资源。那些看起来不太可能满足查询需求的网页可能根本不值得保留。noindex指令本身是head中的一行span stylebackground-color:#f5f6fa !importantcodespan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanmeta namespan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylecolor:#109d8crobots/span contentspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylecolor:#109d8cnoindex/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/span/code/span对于非 HTML 文件例如 PDF等效方法是在 HTTP 响应头中添加X-Robots-Tag: noindex 属性。无论哪种情况页面都必须保持可抓取状态以便读取相关指令。排名算法被索引是获得曝光的必要条件。但它只能保证符合资格除此之外不作其他保证。索引就像一个候选列表排名决定用户实际看到哪些列表而且每次查询都会重新计算排名。影响这一决策的信号大致可以分为以下几类相关性。网页内容、实体和上下文与查询含义的匹配程度而不仅仅是与相关关键词的匹配程度。权威性。信任和专业的象征历来主要体现在来自其他信誉良好的网站的链接上。新鲜度。对于时效性至关重要的查询新鲜度权重很高而对于稳定的主题新鲜度权重则很低。页面体验。包括加载性能、布局稳定性、移动设备易用性、HTTPS 以及界面干扰程度。用户意图。格式是否符合搜索者的需求——定义、比较、产品、视频或本地结果。这些系统瞬息万变。搜索引擎每年都会进行数千次调整还会定期进行核心算法更新显著改变搜索结果的顺序而生成式摘要的出现更是进一步改变了搜索结果的呈现方式。任何单一信号的优化策略都难以持久只有真正能够解答用户查询的内容才能经受住每一代算法的考验。为什么互联网索引很重要如果没有索引搜索引擎就必须在用户查询时获取并评估实时页面。即使不考虑这会给全球所有网站带来的负载响应时间也将以小时计。索引正是将看似不可能的问题转化为可解决的问题的关键所在。速度。将查询与预先构建的倒排索引进行匹配只需几毫秒因为耗时的工作获取、解析、渲染、评分已预先完成。可扩展性。每个页面在每次抓取时仅处理一次然后即可在数十亿次查询中重复使用。这种成本摊销是网络规模搜索在经济上可行的唯一原因。相关性。由于内容以规范化的形式存储引擎可以预先计算质量信号、解决重复项并理解实体关系——这些工作如果实时进行是不可能完成的。提高网页索引速度的实用方法1. 提交 XML 站点地图站点地图是一份机器可读的 URL 列表其中包含您希望搜索引擎抓取的 URL并可选择性地添加 lastmod 时间戳以帮助搜索引擎确定重新抓取的优先级。请务必保持站点地图的准确性仅包含返回200状态码的规范 URL 并确保 lastmod 时间戳反映真实的网站内容变更。对您在旧文章中仍能找到的建议有两点重要的更正网站地图 ping 端点已停用。谷歌已于 2023 年 6 月宣布弃用该端点现在它会返回404错误。对该端点的请求无效。必应也已停用了其对应的端点。目前支持两种提交方式在 robots.txt 文件中添加一行 Sitemap: 参数以及在 Google Search Console 或 Bing 网站站长工具中提交 Sitemap 报告。如果你想要推送式通知现代的等效方案是 IndexNow这是一个由 Bing、Yandex、Seznam 和 Naver 支持的开放协议。IndexNow 首先需要您提供密钥所有权证明请在网站根目录下托管一个以您的密钥命名的 UTF-8 文本文件例如 https://example.com/YOUR_KEY.txt其中包含您的密钥本身。完成此步骤后单个 URL 提交如下所示span stylebackground-color:#f5f6fa !importantcodespan stylecolor:#990055https/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanapispan stylecolor:#99a0b7./spanindexnowspan stylecolor:#99a0b7./spanorgspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanindexnowspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a?/span/spanurlspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanhttpsspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanexamplespan stylecolor:#99a0b7./spancomspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanspan stylecolor:#0077aanew/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a-/span/spanpagespan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spankeyspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a/span/spanspan stylecolor:#990055YOUR_KEY/span/code/spanGoogle 不参与 IndexNow因此请将其视为对其他搜索平台的覆盖而不是网站地图和 Search Console 的替代品。尽管如此它仍然值得部署Bing 的索引为多个 AI 搜索产品提供数据。2. 改善内部链接内部链接是主要的发现机制也是您重视内容的最清晰信号之一。力求让用户在首页点击三次后即可访问任何有意义的内容在已有页面中添加指向新页面的上下文链接并使用描述性锚文本而不是简单的“点击这里”。从经常被抓取的中心页面链接的新页面其被抓取的速度往往远快于从不活跃的存档页面链接的新页面。3. 发布原创、高质量的内容索引是一种资源决策。重复存储内容的页面最容易被忽略。原创数据、第一手经验和真正的深度才是页面值得占用存储空间的原因。这也是这份清单中最持久的投资因为迄今为止每一次算法更新都持续奖励它。4. 删除孤立页面孤立页面是指没有任何内部链接指向的页面。搜索引擎爬虫只有在它出现在站点地图中或抓取到外部链接时才能访问到它即便如此它看起来也无关紧要。要找到孤立页面可以使用 Screaming Frog 等工具抓取自己的网站然后将发现的 URL 列表与 CMS 导出文件或站点地图进行比较。第二个列表中存在但不在第一个列表中的页面就是孤立页面。5. 优化页面速度更快的响应速度意味着每次抓取会话可以获取更多 URL这对于大型网站尤为重要。网站速度或者说服务器响应时间是爬虫程序最直接关注的指标核心网站指标会影响排名。压缩图片、积极缓存并降低首字节加载时间 (TTFB)。6. 确保页面确实可以被抓取。在断定某个页面存在质量问题之前请先验证其机制该页面未被 robots.txt 文件禁止访问没有从测试环境遗留的noindex指令其规范链接指向自身页面返回200 状态码并且其主要内容无需依赖可能无法执行的 JavaScript 代码即可正常显示。将测试环境指令部署到生产环境是导致网站从搜索结果中消失的最常见原因之一。7. 使用 Google Search Console 监控索引情况Search Console 是了解 Google 如何看待您网站的权威途径。网址检查工具是目前速度最快的单页诊断工具打开搜索控制台选择拥有该 URL 的属性。将完整的 URL 粘贴到仪表盘顶部的检查栏中然后按 Enter 键。请阅读结论。“URL 在 Google 上”表示该网址已被收录“URL 在 Google 上”表示该网址尚未被收录下面的“页面索引”部分将解释原因。检查页面索引查看抓取日期、Google 选择的规范网址以及任何已发现的问题。如果选择的规范网址不是您声明的网址那就是问题所在。点击“测试实时 URL”即可获取当前页面。默认视图反映的是上次抓取的结果可能早于您的修复。如果实时测试通过请点击“请求索引”。这会将网址添加到优先抓取队列中——这是一个请求而不是命令。谷歌没有公布每日限制实际上每个媒体资源每天大约可以抓取十个网址。对于全站模式“页面索引报告”会按状态对每个 URL 进行分组并给出每个排除项背后的原因这比一次检查多个页面要有用得多。如果您想检查您的页面是否已被索引请按以下步骤操作span stylebackground-color:#f5f6fa !importantcodespan stylecolor:#990055site/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/spanyourdomainspan stylecolor:#99a0b7./spancom span stylecolor:#990055site/spanspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a:/span/spanyourdomainspan stylecolor:#99a0b7./spancomspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a//span/spanspecificspan stylebackground-color:rgba(255, 255, 255, 0.5)span stylecolor:#9a6e3a-/span/spanpage/code/span在 Google 中运行以下任一查询。第一个查询大致显示该域名已被收录的内容第二个查询确认某个特定网址是否已被收录。结果数量是估算值而且对于大型域名site: 运算符的结果可能不一致。建议将其作为快速的初步检查并以 Google Search Console 的结果为准。开始之前需要明确一点搜索引擎可以提高索引成功率但无法保证一定成功。以上所有技巧都能提高索引成功的几率并缩短等待时间。但这些技巧都不能强制搜索引擎收录你的网页——最终决定权在于搜索引擎取决于网页是否值得收录。结论网络索引是连接实时网络和其上所有应用的桥梁。搜索引擎发现URL抓取它们处理并将抓取到的内容存储在索引中然后根据查询结果对索引中的候选结果进行排名。了解每个阶段可能出现的问题就能将“为什么这个结果没有显示出来”的谜团转化为一份可检查的清单。同样的原则也适用于搜索引擎优化之外的领域。任何大规模检索网络数据的系统无论是用于价格监控、市场调研还是人工智能代理基于最新信息来源给出答案都会构建并查询自身的索引并提出关于覆盖范围、时效性和重复性等相同的问题。
返回列表