DECISION GUIDE / 索引状态判断

Search Console 显示大量页面未编入索引,先别点「请求编入索引」

已抓取和已发现不是同一阶段,重复网页也常常是正常结果。先分清这条网址该不该被收、卡在哪一步,再决定改技术、改内容还是停发新页。

先给结论

真正要处理的不是数字,而是每类网址所处的阶段。

Search Console 的「网页索引编制」报告里,灰色那一栏一旦堆到几百、几千,常见反应有两种。一种是把能点的「请求编入索引」全点一遍。另一种是把整张表丢给开发,当网站故障单。

这两种动作都太早。对已经有网站的负责人,真正要处理的不是「怎么让数字变绿」,而是一个更具体的问题:这些没进索引的网址,分别卡在哪一步,以及其中有多少其实不该被收。

「未编入索引」不是一种故障,是一堆不同状态的合计。Google 自己也说:不要期望网站上的所有网址都被编入索引;目标是让每个重要网页的规范版本进索引。重复页、过滤页、备用页没被收,常常是系统在按设计工作。

在改标题、加内链、催开发或继续发文之前,先问三件事:

  1. 这条网址,你到底想不想让搜索引擎单独拿出来展示?
  2. 报告给它的原因码是什么:被挡住、还没抓到、抓过但跳过,还是被当成重复?
  3. 出事的是首页和核心服务页,还是标签页、筛选页、城市复制页?

三问之后,多数站点会发现:真正要抢修的只有几条钱相关的 URL;其余要么该排除,要么该合并,要么该停止继续生产同类页。把总数当 KPI,会同时做错技术和做错内容。

先读原因码

Google 实际把「未编入索引」分成了什么。

抓取、编入索引、出现在搜索结果,是三件事。Google 搜索中心写得很硬:即使页面符合搜索要点,也不保证会被抓取、编入索引或展示。Search Console 能告诉你的,是某一条已知网址目前停在哪一段。

  1. 「已发现 - 尚未编入索引」:Google 知道这个网址,但还没抓。 官方说明是:通常想抓,但预计会让网站过载,所以改期了;报告里上次抓取日期为空。它还没有进入「看过内容、决定收不收」这一步。
  2. 「已抓取 - 尚未编入索引」:已经抓过,当前没有放进索引。 官方接着写:日后可能收,也可能不收;无需重新提交该网址以供抓取。 再点「请求编入索引」,解决不了它刚做过的判断。
  3. 重复和备用,经常是正常结果。 「备用网页(有适当的规范标记)」「重复网页(用户未选定规范网页)」意味着 Google 认为内容已在另一条 URL 上。官方的目标本来就不是把每个副本都收进去。
  4. 被 robots.txt、noindex、登录墙或 404 挡住,才是另一类问题。 这类能在网址检查工具里直接看到「是否允许抓取」「是否允许编入索引」。它和技术门有关,和「内容够不够特别」不是同一张工单。

2026 年 7 月,Google Search Relations 的 John Mueller 和 Martin Splitt 在官方播客 Search Off the Record 里专门讲过这份报告。口径和帮助文档一致,但更针对负责人的误用:不要把它当成一份必须逐条修完的库存清单;健康网站不需要 100% 收录比例;索引与未索引的比值也不是质量分数。出现大规模、非技术原因的「已抓取尚未索引」时,更该后退一步看站点整体,而不是给每一条 URL 找一个技术补丁。

中文网站多出来的一层

别把三种「没被搜到」混在一起。

英文讨论里,这份报告几乎默认等于 Google 索引。中文业务不是这样。

很多负责人同时面对百度站长平台的「未收录」、销售口中的「官网搜不到」,以及 Search Console 里的灰色数字。三者不是同一件事。百度有没有收你,解释不了 Google 为什么跳过某一条 URL;Google 跳过标签页,也解释不了客户在微信里搜品牌为什么找不到你。先写下一句实话:你现在看的是哪一个入口的数据。

中文站点还更容易把「网址数量」误当成「内容数量」。常见的不是文章不够,而是同一套内容被复制成很多 URL:

  • 建站程序自动生成的标签、分类、分页、站内搜索结果;
  • 商品列表的筛选、排序参数;
  • 微信分享、广告点击带进来的 fromutm 参数;
  • http / https、www / 非 www、带不带末尾斜杠、m. 和电脑站并存;
  • 按城市、区县复制的落地页,正文只换了地名。

后面这类页面如果只是为了覆盖「XX 市 + 业务词」而互相重复,已经接近 Google 垃圾内容政策里的「滥用门页」和「滥用规模化内容」:生成许多网页,主要目的是操纵排名而不是帮助用户。这时继续加城市页,不会把「未编入索引」修掉,只会给系统更多可以跳过的近重复项。

所以,中文站点看这份报告,多问一刀:未索引的主体,是核心服务页,还是上面这类本不该进索引的目录? 答错这一刀,后面的开发工单和内容日历都会铺错。

先分四堆

按原因抽样,再决定动手。

不必上审计平台。打开「网页未被编入索引的原因」,按原因点进去,各抽几条真实 URL,对照下面四堆。

1. 本来就不该单独进索引

筛选结果、分享参数、标签聚合、打印页、感谢页、登录后才能看的页,通常没有独立被搜索的理由。官方也举例:用参数对同一批内容做过滤或排序,产生的大量重复页,本来就可能不应被编入索引。

这类数字大,不代表网站病了。处理方向是减少目录,而不是请求收录:canonical 指回主版本、对确定无价值的模式用 robots.txt 或 noindex、站点地图里只留你想被抓的规范 URL。继续点「请求编入索引」,等于请 Google 再看一遍你并不想展示的地址。

2. 技术门还没打开

先用网址检查工具看首页和三到五个核心服务页,不要先看几千条长尾。

需要当场能回答的只有几项:抓取是否被允许、编入索引是否被允许、Google 选择的规范网址是不是你以为的那条、实时测试里正文是否真的出现。如果实时测试只看到壳子、验证墙或空页面,那是渲染、反爬或错误的 robots 规则,该找开发。如果规范网址指向了另一条旧页、参数页或分页,先处理站点自己发出的信号。

改版后如果核心页突然大批进入「已抓取 - 尚未编入索引」,优先怀疑这一堆,而不是先改文案。例如新主题把 CSS、脚本放在带问号的地址里,却用 robots.txt 一刀切掉所有参数 URL,Google 可能抓到的是没有样式和正文的空壳。这不是「内容不够好」,是它没看见内容。

3. 已发现、还没抓到

这一堆的关键不是把文章写长。官方含义是:还没访问。对超大型站点,或「很大一部分 URL 都停在已发现尚未索引」的站点,Google 的抓取预算指南才开始有针对性:管理网址目录,把抓取花在独特内容上,而不是独特 URL 上。

对没有海量、高频更新页面的中小站点,同一份指南开篇就写:你不必先读抓取预算;把站点地图更新好,并定期看索引报告即可。中文圈常把「抓取预算不够」当成第一诊断,多数业务站并不在这个适用范围内。

更常见的原因是:重要页只活在站点地图里,没有从已收录页面链过去;或者站点地图把参数页、筛选页、城市复制页也提交了,Google 感知到的「网址目录」被灌满。先清目录、补从核心页出发的真实链接,再考虑要不要为个别重要 URL 请求抓取。

4. 已经抓过,当前选择不收

这一堆最容易和「网站坏了」搞混。Google 已经看过页面。帮助文档写明不必重新提交。近期英文讨论里有人把它简化成「就是内容问题」,有人则建议直接删页。两种都过满。

站析 Lab 的判断是:先看是谁被跳过。

  • 标签页、参数页、城市复制页被跳过:优先回到第 1 堆,减少近重复,而不是给每一页加两段套话。
  • 首页、服务页、产品页、关键说明页被跳过,且第 2 堆的技术检查是通的:这时才进入内容判断。看页面是否提供了别处没有的、可核对的信息——适用条件、不接的范围、交付方式、和相邻方案怎么选。谁都能生成的行业常识汇编,即使没有技术错误,也没有必须进入索引的理由。
  • 站点上已经有一条很像的页被收了:先处理自相残杀,不要再写一篇更像的。

Google 的有用内容指南问的也是这一类问题:有没有原创信息,和搜索结果里其他页面相比有没有实质增量,是不是主要为了搜索引擎而生产。垃圾内容政策则把「用生成式工具大量建页且不增加价值」列为滥用规模化内容。如果你正在用内容日历对抗这一堆数字,先停更同类页,比再发十篇更接近问题本身。

也不要因为它今天没被收,就把页面删掉。官方写的是「可能日后会索引」;删页只适合你确认它不该存在的情况。

什么时候成立

「未索引就是内容问题」有明确前提。

这句话成立,通常同时满足:

  • 你关心的是首页、核心服务页或确实承担获客任务的说明页,而不是标签和筛选目录;
  • 网址检查显示允许抓取、允许索引,实时测试能看到完整正文,规范网址也指向自己;
  • 页面讲的是谁都能写的常识,或和站内已收录页高度相似;
  • 你准备停发同类页、合并重复、把只有你能提供的信息写进已有 URL,而不是再买一个「收录套餐」。

这句话不成立,常见是下面几种:

  • 原因码其实是「已发现 - 尚未编入索引」,Google 还没抓,谈不上否定正文;
  • 实时测试里内容是空的,或 robots / noindex / 错误 canonical 仍在挡;
  • 把城市复制页、参数页的未索引数,当成「全站内容质量差」;
  • 把百度未收录或微信里搜不到,直接读成 Search Console 的内容判决;
  • 把未索引总数和已索引总数的比例,当成必须优化的分数。

最后一种尤其容易判断错。官方播客已经把「索引率」从质量指标里拿掉了。数字大,可能只是你的 CMS 在生产 URL;数字小,也不等于页面值得被推荐。

接下来先做哪一步

按这个顺序即可,不必一次清零灰色数字。

  1. 先核钱相关的 URL。 用网址检查工具看首页、核心服务页、两三个关键说明页:在不在 Google 上、规范网址是谁、实时测试有没有正文。这几条有问题,优先于报告里的长尾清单。
  2. 按原因码抽样,不要盯合计。 已发现、已抓取、重复/备用、robots/noindex,各打开几条。分进上面四堆。同一套修法不要跨堆使用。
  3. 把不该进索引的目录从地图和内链里拿掉。 站点地图只保留规范页。筛选、分享参数、纯聚合页不要继续提交。这一步常常比改文案更快改变「已发现」堆积。
  4. 核心页技术通、仍停在已抓取尚未索引,再改页面本身。 补可核对的业务信息,合并近重复,停止按关键词列表继续铺页。改完后再对少数重要 URL 请求抓取。对已经标注为「已抓取 - 尚未编入索引」的地址,官方不要求你重新提交。
  5. 用询盘和这几条重要 URL 的状态看结果,不用灰色总数。 总数下降可能只是你终于不再提交垃圾 URL;总数不动,也不妨碍核心页已经被收。

什么时候值得进一步诊断

需要的是优先级判断,不是把请求索引当成修复按钮。

当你无法判断核心服务页是被技术挡住、被站内另一页抢走规范地位,还是正文本身没有收录价值;或者改版后重要页集体掉进「已抓取 - 尚未编入索引」,而开发、内容和建站方各执一词——这时需要的是一次独立诊断,用来排优先级,而不是把「请求编入索引」当成修复按钮。

诊断的价值在于告诉你:先关网址目录,先修抓取和渲染,先合并重复页,还是现在确实该补决策信息。它不承诺把报告里的每一条 URL 都变绿。

常见追问

先读懂状态,再决定要不要动网站。

「未编入索引」是不是网站出了故障?

不一定。它是多种状态的合计。重复页、过滤页和备用页没有被单独收录,常常是正常结果;真正需要优先处理的是首页、核心服务页等重要网址。

「已抓取 - 尚未编入索引」和「已发现 - 尚未编入索引」有什么区别?

前者表示 Google 已经抓取页面,但当前没有放入索引;后者表示 Google 已经知道网址,却还没有抓取。两者所处阶段不同,不能套用同一套处理方式。

要不要把所有未索引页面都点「请求编入索引」?

不要。不该收录的页面无需请求;已经抓过但被跳过的页面,重复提交也解决不了原判断。请求抓取只适合少数重要、已修正且确实应该进入索引的网址。

开始沟通前

不确定是技术门、网址爆炸,还是页面本身没有收录价值?

先发来网址和当前的索引状态。我们会先判断应该检查抓取与渲染、规范网址与重复页,还是核心页面的信息价值。

微信号MagNorns添加后可发送网址,并备注“SEO 检测”