每个个人站长都经历过这个阶段:网站上线了,内容也写了不少,可是在百度里 site:你的域名 一搜,收录只有可怜的几个页面,甚至一个都没有。隔壁站内容没你多、质量没你好,偏偏收录快、排名高,你说气不气。其实搜索引擎收录是有明确流程的,你的网站卡在哪个环节,就决定了它能不能被收录、收录得快不快。这篇文章把从"搜索引擎知道你"到"你的页面进入索引"的完整流程拆开讲清楚,并给你一份可以直接照着做的自查清单。
一、收录的完整流程:四个环节缺一不可
一个页面要被搜索引擎收录,必须依次通过四个环节:
- 发现(Discover):搜索引擎要知道你网站的存在,途径有外链、sitemap 提交、主动推送、手动提交 URL;
- 抓取(Crawl):爬虫顺着链接和 sitemap 来你的服务器下载页面,这一步考验的是服务器的响应速度和稳定性;
- 渲染与解析(Render & Parse):爬虫执行页面里的 JavaScript,解析出最终的可见内容和链接;
- 建立索引(Index):内容被去重、质量评估后写入索引库,之后才可能参与排名。
很多站长只盯着"提交"这一步,以为提交了就会收录。实际上提交只是帮你走完"发现",后面的抓取和索引环节出问题,照样不收录。搞清楚卡点在哪,才能对症下药。
二、先确认爬虫到底来没来过
第一步不是改代码,而是看服务器日志,确认爬虫有没有来抓过你的站。百度蜘蛛的 UA 通常带 Baiduspider,谷歌是 Googlebot,Bing 是 bingbot。查看最近的抓取记录:
grep -i "Baiduspider\|Googlebot" /var/log/nginx/access.log | tail -20如果日志里根本没有爬虫记录,说明"发现"环节就没走通,你的站对搜索引擎来说等于不存在,优先处理提交和外链。如果日志里有爬虫记录,但请求集中在几个固定页面,说明你的内链结构有问题,爬虫顺着链接找不到新页面。如果爬虫来了但大量返回 5xx 或者超时,那就是服务器扛不住,属于"抓取"环节的硬伤。
三、抓取环节:最常见的三个"隐形杀手"
很多站点的收录问题出在抓取环节,而抓取环节的问题往往是配置错误,不是内容问题。逐个检查:
第一,robots.txt 写错了。最常见的错误是 Disallow: / 把全站屏蔽了,或者 Allow 和 Disallow 的顺序写反。检查方法很简单,浏览器直接访问 https://你的域名/robots.txt 看内容是否合理。另外记得单独允许爬虫访问 sitemap:
Sitemap: https://www.example.com/sitemap.xml第二,页面里出现 noindex。有些主题或 SEO 插件默认给某些页面加了 noindex,一旦加了,爬虫抓取后会明确不索引。检查方式是查看网页源代码,搜索 noindex 关键字,特别注意首页和文章页不要出现 。
第三,内容依赖 JavaScript 动态渲染。如果你的正文是前端框架渲染的,数据靠接口异步加载,爬虫抓到的 HTML 里根本没有正文,自然不会收录。判断方法:用 curl 抓取页面源码,看看正文文字是否直接出现在 HTML 里:
curl -s https://你的域名/某篇文章.html | grep -c "正文里的一个关键词"如果结果是 0,说明正文是 JS 渲染的,需要做服务端渲染(SSR)或者至少把正文以文本形式放到 HTML 里。对个人站长来说,用 PHP 之类的服务端语言输出完整 HTML 是最省事的方案。
四、质量评估:为什么抓到了却不收录
爬虫抓到了、也解析了,但页面迟迟不进入索引,这时候问题多半出在质量评估环节。搜索引擎对页面的去重和评分主要看几点:内容是否原创、是否与其他页面高度重复、页面是否太薄(内容太少)、整站是否有价值。个人站长最容易踩的坑有两个:一是用采集或者 AI 批量生成的内容,全文复制粘贴或高度模板化,这类内容抓取一百次也不会收录;二是站内大量"内容农场"式页面,比如为了堆关键词生成的几百个几乎一样的标签页,这些页面反而会拖累全站权重。
另外一个容易忽略的点是重复内容:同一个页面同时存在 http 和 https 两个版本、www 和非 www 两个域名都能访问,爬虫会认为是两个重复页面,导致权重分散、收录变慢。务必在 Nginx 里做 301 跳转,统一到一个主域名、一个协议版本。
五、加速收录:把"发现"环节做满
确认抓取和内容没问题之后,剩下的就是主动把页面喂给搜索引擎。百度方面,注册百度搜索资源平台(ziyuan.baidu.com),完成站点验证后做三件事:一是提交 sitemap,二是用"普通收录"手动提交重要页面,三是开启 API 推送——在文章发布时调用推送接口,把新链接实时告诉百度。接口调用非常简单,用 curl 就能测:
curl -H 'Content-Type:text/plain' --data-binary @urls.txt \
"http://data.zz.baidu.com/urls?site=你的域名&token=你的token"谷歌方面,在 Google Search Console 里提交 sitemap,并可以手动请求索引。这里要提醒一句:无论是百度还是谷歌,提交只是尽人事,真正的决定因素永远是抓取顺畅、内容原创、页面质量过关。提交之后每天用 site: 语法查一次收录情况即可,别一天查十次,收录是个以天甚至以周为单位的过程。另外提醒两点关于 site: 查询的口径问题:第一,site: 返回的数量在不同搜索引擎、不同时间段波动很大,它只是参考值,别拿它当精确的收录数;第二,如果你的站同时有 www 和非 www、http 和 https 多个版本,site: 的统计会分散,这正是前面说过的要 301 统一域名的原因之一。
还有一个心理预期问题:新站上线后通常有一段"冷启动期",搜索引擎对新站的考察比较严格,收录慢、排名低是常态,这段时间短则一两周,长则一两个月。冷启动期最忌讳的操作是频繁改版、频繁换域名、大改 URL 结构,这些动作都会让搜索引擎重新评估你的站,前功尽弃。正确的姿势是:保持稳定的更新频率(每周几篇原创),保持服务器稳定,剩下的交给时间。内容质量和更新节奏,才是搜索引擎评估一个站"值不值得收录"的长期依据,一次性的提交技巧只能锦上添花。
六、内链与外链:让爬虫和权重都流动起来
新页面被收录,很大程度上靠"老页面带新页面"。内链的作用被很多个人站长低估了:每篇文章正文里自然提及相关旧文章并加上链接,让新文章从已有收录的页面获得入口,爬虫顺着内链爬过去,速度和收录率都会明显提升。外链的作用则是让搜索引擎"认识"你的站,可以在相关的技术社区、问答平台正常分享自己的文章,注意以分享价值为目的,别刷,别群发,质量差的外链和垃圾外链对个人站是负资产。
七、收录自查清单(照着打勾就行)
把全文要点整理成一份可以直接执行的清单:
- 域名统一:http 跳 https、www 跳非 www,只留一个主版本;
- robots.txt 可访问、未屏蔽全站、声明了 sitemap;
- 页面源码直接可见正文,不依赖 JS 渲染;
- 无 noindex 误伤文章页和首页;
- 服务器响应快:首页首包时间小于 1 秒,日志里爬虫请求无大量 5xx;
- 内容原创、篇幅充足(千字以上)、不复制粘贴;
- 每篇文章正文带 2 到 3 个相关内链;
- sitemap.xml 生成正常且只含有效 URL;
- 百度资源平台提交 sitemap + 开启 API 推送;
- Google Search Console 提交 sitemap。
搜索引擎收录没有玄学,本质上就是"爬得动、看得懂、值得收"九个字。把流程理解透,照着清单一项项排查,收录只是时间问题。真正该花时间的,还是把每一篇文章写到值得被收录。