你辛辛苦苦写完一篇文章、发布到自己的网站,满心期待。一周后,你打开谷歌搜了一下——什么都没有,你的文章根本搜不到。
问题出在哪?
答案藏在谷歌处理网页的方式里。一个网页从”被发布”到”能被搜到”,中间要过三道闸门:抓取、索引、排名。任何一道没过,你就搜不到自己的文章。搞懂这三道闸门,你就能自己排查”我的文章为什么没人看得到”。
先打个比方:这就像货物过海关
想象你的网页是一批要出口的货物:
- 抓取 = 货物先运到口岸、过关登记。进不了口岸,后面都别谈。
- 索引 = 海关查验合不合规、能不能放行入境。不合规的当场退回。
- 排名 = 顺利入境、进了市场之后,再拼谁卖得好、摆在货架最显眼的位置。
三道关卡顺序不可逆,而且每一关都会刷掉一批。抓到不等于能入境,入境不等于摆上好货架。下面一道一道拆开讲。
第一道闸门:抓取(Crawl)
谷歌派出一种叫”爬虫”的程序(比如 Googlebot),到处去发现并下载网页。
爬虫是怎么发现你新发的文章的? 三条路:顺着别的网页上的链接爬过来、读你提交的网站地图(sitemap)、以及它已知的网址清单。
你能做什么帮它抓到你:
sitemap:主动列一张清单,告诉谷歌”我这个站有哪些页”。我在自己站上就提交了 sitemap_index.xml,相当于给爬虫递了一份目录,让它不用瞎找。
robots.txt:一份规则文件,告诉爬虫哪些能爬、哪些别爬。
站内链接:让你的页面之间互相链接,爬虫顺着链接就能爬遍全站。
第二道闸门:索引(Index)
爬虫把网页抓下来之后,谷歌会解析它、判断这页在讲什么、要不要留下来,值得的才存进它那个巨大的数据库。
这里有个新手最容易踩的坑:被抓到,不等于被收录。
同样两个页面都被抓下来了,凭什么一个进库、一个被扔掉?谷歌会挑:这页能不能正常访问?有没有实质内容,还是一片空白?是不是跟别的页重复?有没有价值?是不是被标了”别收录”(noindex)?低质、重复、被标了 noindex 的页,抓到了也进不了库。
有时候你还会主动关上这道门。我自己就给站里的空归档页设了 noindex——那些页没有实质内容,收录了反而拉低整站质量,不如主动别让它进库。
怎么知道自己的页有没有被收录? 用谷歌的免费工具 Google Search Console,里面直接告诉你哪些页”已编入索引”、哪些”未编入索引”。
第三道闸门:排名(Rank)
当有人在谷歌输入一个搜索词,谷歌只从索引库里挑出相关的页面,然后排出先后顺序。
注意这里的关键:能被搜到,和排在第几名,是两回事。 排在第一页第一名,和排在第八页,都算”能搜到”,但价值天差地别。
谷歌排序时看很多东西,这里说两个最重要的:
相关性——你的内容跟用户想要的对不对得上。 有人搜”减肥食谱”,一篇真讲食谱的文章,就比一篇讲减肥药的更相关。还有个细节:标题和正文要一致。标题写”减肥食谱”、正文却在卖减肥药,等于没兑现标题的承诺,谷歌会判你相关性低。
权威——有多少可信的网站愿意用链接指向你。 谷歌看不懂”这家机构很权威”,它靠一个能数出来的东西:别人的链接。如果很多可信网站都在自己的文章里链接到你,就相当于给你投了很多张”推荐票”,你的权威度就高。所以权威不是自己说了算,是别人用链接给你背书堆出来的。
学会用这三道闸门排查问题
回到开头那个问题:你的文章搜不到,怎么查?
顺着三道闸门,按顺序问自己三句话,一步不通就不用问下一步:
- 抓取:谷歌抓到这个页了吗?(在 Search Console 用”网址检查”看)
- 索引:抓到了,那它被收录进库了吗?还是被当成低质/重复/noindex 挡在门外了?
- 排名:收录了,那它现在排在第几名?到这一步,才轮到去优化内容质量、相关性和权威。
这个”先抓取、再索引、最后排名”的顺序,就是你以后每次遇到”排名问题”时最该先走一遍的排查路径。很多人一上来就纠结排名,其实问题往往卡在前两道闸门——页面压根没被抓到,或者根本没进库。
先确认前两关过了,再谈排名,你就已经比大多数新手清醒了。