151-3895-5886

SEO之防止网站被采集

2019年09月20日 维尼网络
  采集就是使用程序通过自动化操作复制数据。

首先说明,只要是能让浏览器访问的,就没有不能采集的。

但是可以通过一定的手段让采集变得特别麻烦,进而在大量数据的情况下延迟采集完成时间,加大采集难度。

一般的情况略过不说,几种情况比较非常的:

1、验证来路,cookie,session这些,比如PHP可以用fsockopen自定义HTTPHeader,基本上这些办法没什么效果。

2、限速,限制某段时间内打开页面数量。这个只是推迟了下,大部分时间效果一般。比如某站限制一分钟之内只能打开30个网页,页面大小平均30K,则用迅雷批量download就OK了,设置限速为2K,一觉醒来什么都好了。这个办法效果也基本没有。

3、比较非常的办法,设置一个数量级的阀值,达到这样数量后,必须验证方能继续,比如打开10个页面需要输入验证码,这个时候只需要保证验证码不可识别,分配一个session,以后的浏览过程中用session保证用户合法性,这样不影响后续访问,同时可以有效防止采集。

4、第三条对spider是致命的,此时可通过手机spiderIP段,放行,其它的按照严格规则来。

5、3+4真是无敌的吗?远非可以高枕无忧,比如此站有10万个页面,则设置100个代理,在阀值前循环使用代理,这样实际上绕过了3的限制。

6、还有别的方案吗?不能,因为你的网站能用浏览器打开。


阅读更多内容
上一篇做好网站内部链接建设的几个办法
下一篇怎样才能提高网站权重

声明:本页内容由郑州维尼网络收集编辑所得,所有资料仅供用户参考,转载请保留此链接http://www.zzwn.cn/website/3727.html

本文标签:

 

相关资讯 Related Info
相关分类 News Classification
解决方案 Solutions
相关热点 Hot spot
网站设计设计怎么做好颜色的处理 网站设计设计怎么做好颜色的处理
  1. 我们的承诺
  2. 我们的实力
  3. 我们的未来
郑州做网站咨询电话 建站咨询

151-3895-5886

网站备案安全放心网站

地址:郑州市上街区和昌都汇广场 / 电话:151-3895-5886
客服QQ: 7758021 / 邮箱:admin@zzwn.cn
Copyright © 2010-2019 郑州融科网络 版权所有