当前位置:首页 > 短网址资讯

FT12短网址教你如何甄别真假百度蜘蛛

www.ft12.com9年前 (2017-07-21)短网址资讯1844

尽管百度的口碑并不好,可是不可否认的是,它一直是中文搜索中的霸主,所以对大多数中小型商业公司而言,都对baidu蜘蛛的抓取做法予以放行,不过还有许多不合法的蜘蛛,它们会经过 User-Agent 把自个伪装成baidu蜘蛛,此刻如果单纯以 User-Agent 来判别是不是是baidu蜘蛛就不适宜了。尽管网上能找到许多现成的baidu蜘蛛 IP 段,可是并不能确认它们的准确性,所以我计划自个搜集,进而鉴别真假baidu蜘蛛。

实际上baidu在常见问题解答中给出了鉴其他办法:当有 User-Agent 是 Baiduspider 的恳求时,咱们能够经过 host 指令反解 ip 来判别,Baiduspider 的 hostname 以 *.baidu.com 或 *.baidu.jp 的格局命名,其它的则能够视为不合法的蜘蛛。短网址的后台也经常见到这些IP的访问。

留意:有的baidu蜘蛛服务器并不遵守此规矩,本事例中无视它们。

为何baidu不自动发布它自个的 IP 段呢?这么咱们就方便了啊!答案八成是由于它怕他人封禁短网址,正所谓君子坦荡荡,小人常戚戚。比方 AWS 就发布了自个的 IP 段。

下面咱们将测验经过 log 历史数据来找出真实的baidu蜘蛛,假设 log 格局如下;

1.2.3.4 … “Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)”

简略 shell 即可完成,经过剖析我的 log,终究能够拿到几百个baidu蜘蛛的 IP:

shell> awk '$0 ~ "Baiduspider" {print $1}' /path/to/log \
    | xargs -n1 -I {} sh -c 'echo -en {} "\t"; host {}' \
    | awk '$NF ~ "\\.baidu\\.(com|jp)\\.$" {print $1}' > baidu

123.125.71.100
123.125.71.101
123.125.71.102
123.125.71.103
123.125.71.104
123.125.71.105
...

由于成果集太臃肿了,所以我拍脑袋做了一个 24 位的 CIDR 处理:

shell> awk -F. -v OFS=. '{print $1, $2, $3, "0/24"}' baidu | sort -u

119.63.195.0/24
119.63.198.0/24
123.125.66.0/24
123.125.71.0/24
180.76.15.0/24
180.76.5.0/24
220.181.108.0/24

此外,以下 IP 是我经过其他路径获取的baidu IP 列表,其间有些数据无法经过 hostname 的办法来辨认,可是经过FT12短网址的判别,根本能够判定属于baidu,咱们能够自行判别:

61.135.165.0/24
61.135.169.0/24
61.135.190.0/24
111.206.36.0/24
112.80.254.0/24
115.239.212.0/24
123.125.67.0/24
220.181.51.0/24
220.181.165.0/24

如此成果集就精简多了,以后短网址和短链接的后台如果发现这些IP,大家就明白了。今后再有 User-Agent 是 Baiduspider 的恳求进来时,咱们只需简略判别一下 IP 是不是在 CIDR 成果中即可,是则予以放行。当然,这篇文章中baidu蜘蛛的 IP 数据也能够用在其他地方,比方制止baidu访问。 ?


扫描二维码推送至手机访问。

版权声明:本文由短链接发布,如需转载请注明出处。

本文链接:https://www.ft12.com/article_311.html

分享给朋友:

相关文章

简单高效的短网址生成服务C#实现

简单高效的短网址生成服务C#实现

项目中有一处需求,需要把长网址缩为短网址,把结果通过短信、微信等渠道推送给客户。刚开始直接使用网上现成的开放服务,然后在某个周末突然手痒想自己动手实现一个别具特色的长网址(文本)缩短服务。由于以前做过socket服务,对数据包的封装排列还有…

全球纯电动车制造商出货量排名:特斯拉仅第二

全球纯电动车制造商出货量排名:特斯拉仅第二

提到电动汽车,我们往往首先想到的是特斯拉,然而根据一份最新调查数据显示,特斯拉并非全球最大的电动汽车制造商。据JATO数据提供商最新公开的纯电动车制造商排名显示,目前雷诺-日产是全球最大的纯电动车制造商,特斯拉排在第二位,其它前十名厂商分别…

一个40岁华为男的自白:作为前IBM员工,除了钱,我为什么要来华为“受虐”

一个40岁华为男的自白:作为前IBM员工,除了钱,我为什么要来华为“受虐”

我离开“我摸”(IBM的江湖俗名)加入华为的时候,老板、同事、同学、朋友都十分惊讶的问我为什么。当时总是很装逼的说:“换个环境,我想看看自己的career。”实际上入职后的好几年里,我还在问自己到底为什么来华为。别笑我如此纠结,当年华为的名…

在线教育企业7成亏损,15%濒临倒闭,你如何突围?

在线教育企业7成亏损,15%濒临倒闭,你如何突围?

[ 亿欧导读 ] 四月暮春,又到了一年一度在线教育公司交作业的时期,无论是自己晒成绩,还是第三方机构出评估,我们看到报表里的在线教育行业都是欣欣向荣、前景喜人,但真实情况如何?在线教育市场规模增幅迅猛,2019年将达2692.6亿…

勒索病毒“永恒之蓝”大爆发

勒索病毒“永恒之蓝”大爆发

2017年5月12日20时左右,新型“蠕虫”式勒索病毒“WannaCry”爆发。截至目前,该病毒已经席卷包括中国、美国、俄罗斯及欧洲在内的100多个国家。我国部分高校内网、大型企业内网和政府机构专网遭受攻击,被感染的组织和机构已经覆盖了几乎…

【官方说法】网站流量异常,如何正确反馈?

【官方说法】网站流量异常,如何正确反馈?

网站流量异常一直是站长们最头疼的问题,而每次在反馈中心提交问题,经常得到回复请详细描述您的问题,怎么详细描述问题呢?为此,学院君特邀反馈中心值班员,来给大家详解如何正确提交反馈。在反馈中心后台,值班员最常看到的反馈往往是:“我的网站流量下降…

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。