蜘蛛抓取日志怎么读:看懂它,收录问题就解决一半
蜘蛛日志,其实就是搜索引擎派来的爬虫在你服务器上留下的访问记录。这玩意儿看着枯燥,但它几乎是搜索引擎唯一会"主动跟你说话"的渠道。
怎么把蜘蛛记录挑出来
普通访问日志里,蜘蛛和真人混在一起。要单独看蜘蛛,得按爬虫的特征去筛。
最直接的办法是按User-Agent筛。百度蜘蛛、谷歌蜘蛛、必应蜘蛛,各有各的标识关键词。用命令行一过滤,日志里就只剩蜘蛛了。
但注意,User-Agent是可以伪造的。有些采集程序会冒充蜘蛛。所以筛出来的还得核对一下来源IP,看是不是搜索引擎官方公布的IP段。
重点看这几个指标
蜘蛛日志里,我主要盯这几样:
- 抓取频率——每天来多少次,是涨还是跌
- 抓取页面——是只抓首页,还是内页也抓
- 状态码——它抓到的页面返回的是什么
- 抓取深度——它进到了你网站的哪一层
这几个指标凑一起,基本能画像出搜索引擎对你站的态度。
状态码暴露的问题
蜘蛛抓取时返回的状态码,特别能说明问题。
如果大量是200,说明抓取顺畅。如果一堆404,说明你站里有死链,蜘蛛白跑一趟。如果出现301,看跳转是不是合理的。出现5xx就更糟,说明蜘蛛来的时候你服务器在报错,它扭头就走,下次可能就不爱来了。
我有个站收录一直上不去,查蜘蛛日志才发现,蜘蛛来抓的时候经常遇到超时。服务器响应太慢,等于把客人堵在门口。换了服务器之后,抓取成功率上去了,收录也跟着好了。
抓取频次说明了什么
蜘蛛来的频率,跟你的权重和更新频率有关。
新站、内容少的站,蜘蛛可能几天来一次。权重上来、天天更新之后,它会来得勤。
如果原来来得挺勤,突然不来了,得警惕。常见原因:服务器频繁宕机、被处罚、网站结构大改让蜘蛛迷路。
反过来,如果蜘蛛来得特别猛,抓取量远超你的内容量,可能是它在浪费资源爬一堆没用的页面。这种情况可以在robots里引导它,别让它瞎爬。
从日志看抓取漏洞
有几类问题,日志里一眼能看出来:
蜘蛛反复抓一些参数页面,比如带一堆问号的地址,说明你有重复内容没处理干净。蜘蛛抓取卡在评论、搜索这类动态页上出不来,说明这些页面该拦一拦。
还有,看看蜘蛛有没有抓到你的后台、测试页、临时文件。这些本来不该被索引的东西如果被抓了,得赶紧处理。
把日志用起来
我的习惯是每月抽时间导一次蜘蛛日志,简单统计一下趋势,跟前一个月比。
数据不用多,看趋势就够。抓取量、成功率、抓取页面分布,这三样稳定或者向好,基本就没事。哪样异常了,再深挖。
说白了,蜘蛛日志就是搜索引擎给你寄的体检报告。你不看,就只能靠猜;你看了,很多问题当场就有答案。
本文网址:https://www.seobole.com/article/1055.html
转载请注明出处。文章内容为作者原创或采编,不代表本站立场,如有侵权请联系 a5b5_su@163.com。