爬虫抓取数据权限:一个小创业者踩的坑,撕开了规则的灰色缝隙

去年我在律所楼下的咖啡馆碰见过一个创业者,叫张磊,做外卖店铺代运营的。穿洗得发白的工装外套,坐下来点了一杯冰美式,手抖着给我翻手机里的法院传票。 他栽了。 栽在爬虫上。

爬公开数据,怎么就成侵权了?

他当时刚创业,拉不起投资,买不起几万块一年的第三方数据接口,想攒一批本地商家的联系方式做客户,就找读计算机的同学写了个几百行的简单爬虫,爬了某点评平台上公开的商家地址、电话、评分,一共十几万条。 爬的时候他特意检查了,所有信息都是不登录就能直接看的啊?他觉得这就是公开数据,拿出来用怎么了?又没偷又没抢。
本地生活平台商家公开信息爬虫爬取场景
本地生活平台商家公开信息爬虫爬取场景
法院开庭他才明白,公开可访问 ≠ 可以随意抓取商用。 平台为了攒这些商家信息,前前后后花了七八年,地推团队扫了多少街,投了多少引流广告,才攒出来这么大一个可商用的数据库。你倒好,写两行代码半个小时就拿走,拿去挖人家平台的商家当自己客户,这不就是明摆着抢饭碗吗? 最后判了十万。 刚好是他上半年赚的所有利润。一分不剩,全赔进去了。

灰色地带里,大家都在试探什么规则?

说实话,现在市面上做数据相关生意的,十个里有七八个用过爬虫,没出事的多,出事的少,区别在哪里? 之前微博告今日头条爬取内容那个案子,判下来的时候互联网法律圈都在转,法官写的裁判思路很清楚:爬虫本身不违法,没有哪条法律说写爬虫就是犯罪。核心问题从来不是能不能爬,是你有没有越权。
爬虫抓取数据侵权诉讼法院判决书实拍
爬虫抓取数据侵权诉讼法院判决书实拍
我翻了几十份近两年的公开判决,摸出来一个很有意思的规律:法官认权限,从来不是死抠你爬了什么类型的数据,是看你怎么爬,还有爬了之后用来做什么。 你绕开人家的反爬虫机制,破解了人家的验证码,爬完还把人家服务器卡得半死影响正常运营,这基本就是板上钉钉的越权侵权。你爬了数据拿去卖,拿去挖原平台的客户,拿去做跟原平台直接竞争的产品,那肯定要你赔钱。 反过来,你爬个几十上百条做学术研究,做非盈利的行业分析,发篇自媒体文章讨论讨论,基本没人找你麻烦。之前还有个做影评的自媒体,爬了几百条豆瓣评分做数据可视化,不也没事吗? 对吧?

普通玩家做爬虫,要守哪几条安全线?

普通玩家做爬虫,要守哪几条安全线?
普通玩家做爬虫,要守哪几条安全线?
好多刚入行的年轻人,还有小创业者跑来问我,我就想爬点数据做点生意,怎么做才不踩坑? 我没给他们说那些晦涩的法条,就给他们说了三条,都是从真金白银的赔偿判决里抠出来的实诚话。 第一,绝对不要主动绕开平台的反爬虫规则。人家写了robots协议明确不让爬,人家加了验证码、IP封禁反爬,你非要花心思破解绕过去,那就是你主动越界,说破大天你也占不住理。 第二,绝对不能碰平台的核心盈利资源。人家平台就是靠这个数据吃饭的,你一分钱成本不花拿走自己赚钱,换你是平台老板你告不告?别抱着法不责众的侥幸,现在平台的风控系统一抓一个准,小爬虫也能给你揪出来。 第三,绝对不能碰可识别到个人的信息。哪怕商家的电话是挂在网上公开的,那也是受法律保护的个人信息,你爬来批量打电话做营销,那就是违法,严重的还能触刑法。前两年那个爬了几十万份求职网站简历卖钱的,不也判了侵犯公民个人信息罪吗? 不过话说回来,现在数据就是新的生产资料,哪有做互联网生意完全不用爬虫的?大家都是在没画好线的新土地上找路,法律也在跟着大家的脚步慢慢挪步子,没人能提前把所有坑都标出来。 你别看见好处就往前猛冲,多低头看看脚下。很多坑,踩一次,就爬不起来了。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:爬虫抓取数据权限:一个小创业者踩的坑,撕开了规则的灰色缝隙
文章链接:https://wuhanlihunlvshi.com/cases/2664.html