当前位置:首页 > 短网址资讯 > 正文内容

FT12短网址教你如何甄别真假百度蜘蛛

www.ft12.com8年前 (2017-07-21)短网址资讯2907

尽管百度的口碑并不好,可是不可否认的是,它一直是中文搜索中的霸主,所以对大多数中小型商业公司而言,都对baidu蜘蛛的抓取做法予以放行,不过还有许多不合法的蜘蛛,它们会经过 User-Agent 把自个伪装成baidu蜘蛛,此刻如果单纯以 User-Agent 来判别是不是是baidu蜘蛛就不适宜了。尽管网上能找到许多现成的baidu蜘蛛 IP 段,可是并不能确认它们的准确性,所以我计划自个搜集,进而鉴别真假baidu蜘蛛。

实际上baidu在常见问题解答中给出了鉴其他办法:当有 User-Agent 是 Baiduspider 的恳求时,咱们能够经过 host 指令反解 ip 来判别,Baiduspider 的 hostname 以 *.baidu.com 或 *.baidu.jp 的格局命名,其它的则能够视为不合法的蜘蛛。短网址的后台也经常见到这些IP的访问。

留意:有的baidu蜘蛛服务器并不遵守此规矩,本事例中无视它们。

为何baidu不自动发布它自个的 IP 段呢?这么咱们就方便了啊!答案八成是由于它怕他人封禁短网址,正所谓君子坦荡荡,小人常戚戚。比方 AWS 就发布了自个的 IP 段。

下面咱们将测验经过 log 历史数据来找出真实的baidu蜘蛛,假设 log 格局如下;

1.2.3.4 … “Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)”

简略 shell 即可完成,经过剖析我的 log,终究能够拿到几百个baidu蜘蛛的 IP:

shell> awk '$0 ~ "Baiduspider" {print $1}' /path/to/log \
    | xargs -n1 -I {} sh -c 'echo -en {} "\t"; host {}' \
    | awk '$NF ~ "\\.baidu\\.(com|jp)\\.$" {print $1}' > baidu

123.125.71.100
123.125.71.101
123.125.71.102
123.125.71.103
123.125.71.104
123.125.71.105
...

由于成果集太臃肿了,所以我拍脑袋做了一个 24 位的 CIDR 处理:

shell> awk -F. -v OFS=. '{print $1, $2, $3, "0/24"}' baidu | sort -u

119.63.195.0/24
119.63.198.0/24
123.125.66.0/24
123.125.71.0/24
180.76.15.0/24
180.76.5.0/24
220.181.108.0/24

此外,以下 IP 是我经过其他路径获取的baidu IP 列表,其间有些数据无法经过 hostname 的办法来辨认,可是经过FT12短网址的判别,根本能够判定属于baidu,咱们能够自行判别:

61.135.165.0/24
61.135.169.0/24
61.135.190.0/24
111.206.36.0/24
112.80.254.0/24
115.239.212.0/24
123.125.67.0/24
220.181.51.0/24
220.181.165.0/24

如此成果集就精简多了,以后短网址和短链接的后台如果发现这些IP,大家就明白了。今后再有 User-Agent 是 Baiduspider 的恳求进来时,咱们只需简略判别一下 IP 是不是在 CIDR 成果中即可,是则予以放行。当然,这篇文章中baidu蜘蛛的 IP 数据也能够用在其他地方,比方制止baidu访问。 


扫描二维码推送至手机访问。

版权声明:本文由短链接发布,如需转载请注明出处。

本文链接:https://www.ft12.com/article_311.html

分享给朋友:

相关文章

微服务架构 API 的开发与治理

微服务架构 API 的开发与治理

虽然已经红了很久,但是“微服务架构”正变得越来越重要,也将继续火下去。各个公司与技术人员都在分享微服务架构的相关知识与实践经验,但我们发现,目前网上的这些相关文章中,要么上来就是很有借鉴意义的干货,要么就是以高端的专业术语来讲...

干货:实战告诉大家如何脚踏实地赚钱

干货:实战告诉大家如何脚踏实地赚钱

每一个混站长圈的朋友,几乎都听说过卢松松博客。我入行较晚,是2012年来到外地读大学,才开始自己摸索着进入站长圈,然后结识松哥博客的。最早,在松哥博客上学习各种建站和优化技术、运营技巧。踏踏实实专研了两年技术以后,开始做自己的个人工作室,然...

.NET技术加上30台服务器,是如何支撑世界最大的短网址网站的

.NET技术加上30台服务器,是如何支撑世界最大的短网址网站的

【FT12短网址】FT12短网址是一个提供网址缩短服务的网站,用户可以在通过FT12短网址将长链接转换为短链接,同时生产二维码。当下的FT12短网址已拥有420万个用户,4300万个回答,月PV5.6亿,世界排行第45。然而值得关注的是,支...

高效排查短网址系统故障:高并发引起的系统设计“踩坑”案例

高效排查短网址系统故障:高并发引起的系统设计“踩坑”案例

短网址的判定逻辑十分复杂,一方面是各种类型的网址,有正常的短链接,另外是短网址保证用户的使用,特别是商家的影响面非常广,任何一个小故障都可能引发一些社会问题,所以FT12短网址对产品的质量,对服务的连续性有严格的要求。FT12短网址的技术人...

解密京东短网址大规模内存数据库的演进之路

解密京东短网址大规模内存数据库的演进之路

京东商城研发体系基础平台团队:包括大规模容器集群调度、数据库与存储技术、消息系统与服务框架、架构与运维、机器学习与人工智能等技术方向。由京东商城首席架构师刘海锋担任部门负责人。基础平台运营多个数据中心数万台服务器,支撑京东无数在线业务。缓存...

FT12短网址:解析ESLint 的成功之道

FT12短网址:解析ESLint 的成功之道

前言本文源自于网络,FT12短网址仅做转载,对此文无所有权。难以置信,我在 2013 年 6 月构思开发了 ESLint,7 月第一次对外发布。熟悉的读者可能还记得,ESLint 最初主要设计目标是运行时加载的检查工具(linter)。在工...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。