文章收录了却没流量:读懂索引状态四分层,判断该重写还是该等

为什么「文章被收录了」不等于「文章有流量」

个人站长做 SEO,最容易陷入的一个循环是:发了新文章 → 用 site:我的域名 关键词 查一下,收录了 → 等流量,没有。于是继续发下一篇,重复同样的循环。

问题出在前面那一步的判断标准上。site: 查询命中了,只说明搜索引擎存了这条 URL,不代表它为这条 URL 分配了排名机会。这两者之间隔着一个很关键的中间态:索引状态。这篇文章讲的就是怎么把这个中间态看清楚,以及看到之后该做什么。

第一层:先把「收录」这个词拆成四种状态

搜索引擎对一条 URL 的处理,实际上有四个不同的结果,而站长常常把它们混成一句「收录了/没收录」:

  • 已抓取、未索引:爬虫来过,读过内容,但没放进检索库。典型原因:内容被判为低价值/重复、页面结构不可解析、或站点整体权重不足。
  • 已索引(无排名):进了检索库,但任何关键词下都排不到有流量的位置。这是最常见的「收录了但没流量」。
  • 已发现、未抓取:在 sitemap 或内链里被看到了,但爬虫还没来。属于排队状态。
  • 被抓取但被排除:因为 canonical、noindex、robots 或重复内容判定,被主动排除在索引之外。

这四种状态的应对话术完全不同。第一种要改内容或改内链,第二种要改选题与意图匹配,第三种只要等或改善抓取预算,第四种要去查 canonical/noindex 配置。把它们混成一句「没收录」,就永远找不到该改哪里。

第二层:在哪里看到真实状态,而不是靠 site: 猜

Google Search Console 的「页面」报告(旧的「覆盖率」)是唯一可靠的来源,它会把上面四种状态分门别类列出来。关键是要读懂它的分类名:

# 常见的几类,对应到上面的状态:
# "已编入索引"                 -> 已索引(有无排名另说)
# "已抓取 - 尚未编入索引"      -> 已抓取、未索引(最需要处理的一类)
# "已发现 - 尚未编入索引"      -> 已发现、未抓取(通常等待即可)
# "已排除" 下的
#   "已请求编入索引的网页"     -> 可能仍在处理,别急
#   "备用网页(有适当的规范标记)" -> canonical 指向别处,正常
#   "重复网页,Google 选择的规范网页与用户指定的不同" -> 需要处理
#   "已找到 - 目前未编入索引"   -> 常见于新站,权重问题

特别要指出两个容易误判的:

  • 「备用网页(有适当的规范标记)」不是错误。它表示你写了 canonical,Google 认可并选择了你指定的那个 URL。这正是你想要的结果,不要试图去"修复"它。
  • 「已请求编入索引的网页」会一直累加。你每次手动提交都会加一条,它们不是失败项。如果这个数字占了大头,说明你提交完就只盯着状态、没做别的事。

另一个常被高估的工具是 site: 查询。site:域名 关键词 的命中数是不精确的估算,并且会随查询词变化。它只适合做「这条 URL 到底在不在索引里」的布尔判断,不适合做任何数量统计或趋势观察。用 site: 的数量变化去判断 SEO 成效,是最常见的自欺。

第三层:什么时候该重写,什么时候该等

「已抓取、未索引」是最容易让人焦虑的状态,也是最容易做错决策的地方。判断标准不是时间,而是页面本身是否提供了别处没有的信息

# 自查清单(不需要工具,逐条问)
# 1. 这篇的标题和已有文章是否高度同义?
#    (比如已有「Nginx 502 排查」,又写「Nginx 502 怎么办」)
# 2. 正文是否有至少一段来自你自己的实测输出、日志、报错原文?
# 3. 是否存在更权威的同类页面(官方文档/大站教程)覆盖同一意图?
# 4. 页面是否只有一两句话 + 大段引用?
# 5. 内链是否指向它(有没有从首页/相关文章链进来)?

如果第 1 条或第 3 条答"是",那基本可以判定为「重复/低价值」,重写标题与差异化内容是唯一出路——等待不会改善它。如果第 2 条答"否",那你的页面缺少「不可替代性」,这也是重写信号,方向是加入实测数据。

反过来,如果内容确实独特、内链也有,状态仍停在「已发现、未抓取」,那属于抓取预算不足,处理方式是改善站点结构而不是重写:

# 让爬虫更容易找到并理解你的站
# 1. sitemap 保持干净:只放 canonical 的、200 的 URL,别放 301/404/noindex
# 2. 减少内链层级:重要文章从首页 2 次点击内可达
# 3. 明确 canonical:每个页面一个自引用 canonical,避免参数页互相竞争
# 4. 检查 robots.txt 是否误挡了 CSS/JS(会让渲染失败,间接影响索引)
curl -s https://example.com/robots.txt

这里有个非常实际的陷阱:robots.txt 误挡 CSS/JS 是老站常见的历史遗留。很多年前为了"保护代码"加了 Disallow: /assets/,但现代搜索引擎需要抓取 CSS/JS 才能正确渲染页面。渲染失败的页面会被判为低质量内容,进而落到「已抓取、未索引」。检查方法是 GSC 的 URL 检查工具里看"网页资源加载"那一节,如果有一堆被 robots 阻止的资源,就是这个原因。

第四层:把「收录状态」变成一个常规检查项,而不是一次性任务

这类问题的特点是:它们不会自己好,也不会立刻坏。所以最有价值的动作不是修一次,而是建立一个低频但固定的检查节奏。个人站长的时间有限,建议就两条:

# 每周一次的检查清单(10 分钟内可完成)
# 1. GSC「页面」报告:看"已抓取-尚未编入索引"的数量是否在涨
# 2. GSC「页面」报告:看是否有新增的"重复网页/用户指定的规范网页不同"
# 3. 抽样 3 篇近两周的文章,用 URL 检查工具确认渲染正常(无资源被阻止)
# 4. 检查有没有内链断开(404 的内部链接会浪费抓取预算)

第 1 条是关键指标。如果「已抓取-尚未编入索引」的数量持续上升,说明你在持续产出与已有内容高度重叠的页面——这比"新文章没排名"严重的多,因为它会拖累整站的质量评估。此时正确的反应是停下来,重写或合并已有内容,而不是继续加产量。

第 4 条也值得展开:内链 404 是纯粹的浪费。爬虫顺着你的内链爬过去,撞到 404,这部分抓取预算就白花了。检查方式很直接:

# 从服务端日志里找出被爬虫请求且返回 404 的 URL
awk '$9 == 404 {print $7}' /var/log/nginx/access.log | sort | uniq -c | sort -rn | head -30
# 关注那些出现在你内链里的路径,逐个修掉或 301 到正确位置

第五层:一个反直觉的结论

把上面串起来,会得到一个和直觉相反的结论:「收录了但没流量」,通常不是收录问题,而是选题问题。

搜索引擎已经读懂了你的页面,只是判断在这个意图下你的页面不值得排前面。而它给出的理由,往往写在「已抓取、未索引」这个状态里——它知道这个页面存在,只是认为已有更好的答案。

所以真正有效的动作是:在写之前确认这个具体意图下还没有被高质量覆盖的答案,在写之后加入别处没有的信息(实测输出、报错原文、具体参数取值)。这两件事做好,「收录」这件事几乎不需要单独操心——它会自然发生,排名也会跟着来。

小结

  1. 「收录」有四种状态,混为一谈就找不到该改哪里;
  2. 真实状态只看 GSC 页面报告,site: 只适合做布尔判断;
  3. 「已抓取、未索引」的处理标准是内容不可替代性,不是等待时长;
  4. 「已发现、未抓取」是抓取预算问题,改结构而非改内容,注意 robots 误挡 CSS/JS;
  5. 把「已抓取-尚未编入索引」的数量趋势当成质量预警指标——它涨,就该减产提质了。

对个人站长来说,SEO 的很多焦虑来自「不确定自己在正确的方向上」。上面这套状态拆解的意义,就是让你在每一次查看后台时,都能明确回答一个问题:我现在要改的是内容,还是结构?能回答这个问题,就已经比大多数人在盲目发文中高效得多了。

Last modification:September 24th, 2026 at 07:29 pm

Leave a Comment