爬公开数据,怎么就成侵权了?
阿凯一开始跟我喊冤,说我又没黑人家后台,所有数据都是商家挂在网上公开给人看的,凭什么说我偷? 不止阿凯,现在多少做小工具、做聚合平台的创业者都是这个思路:反正数据挂在网上,不爬白不爬。

公开数据,不等于你可以拿来做商业用途。 之前大众点评诉百度爬虫的案子,法院说得很明白:平台把商家信息整理、收录上去,花了大量的人力物力,本身就是有财产性的劳动成果。你不花一点成本,直接爬走拿来给自己的平台引流,这不就是抢人家种的稻子磨自己的米吗? 阿凯的情况更巧,他爬的不光是商家自己的官网,还爬了那家起诉他的平台花了大价钱谈来的独家优惠。相当于人家搭好了台子买好了菜,他直接端走给客人上菜收钱,换谁谁不跟你急?
爬虫抓取的红线,到底画在哪儿?
很多人总说,现在数据规则模糊,我不知道什么能爬什么不能爬。 其实红线一直清清楚楚,只是很多人故意闭着眼睛装看不见。 第一条红线:你有没有绕过对方的反爬措施? 对方设了验证码、做了IP限流,你买动态代理、搞破解绕过去,这一步就已经碰了法律的底线。严重的,还能沾上个非法获取计算机信息系统数据罪,不止赔钱,还能蹲号子。 第二条红线:你拿爬来的数据做什么? 自己写论文做研究,非盈利,没人找你麻烦。你拿来做竞品、抢流量、赚广告费,那就是商业使用,侵权没跑。 阿凯两条全占了。为了不被平台发现,专门花几百块买了动态IP池绕反爬,爬来的数据直接用来吸粉接广告,可不就是撞到人家枪口上?

想合法爬数据,普通人能做什么?

说实话,现在做互联网相关的生意,哪家不用点爬虫?总不能所有数据都手动录入吧。 真要做,记住几个实打实的准则,别踩坑。 第一,先看人家网站的robots协议,上面写了不让爬的内容,别碰。别觉得这个协议没用,现在法院判案子,都会把robots协议作为你有没有过错的依据,明知不让爬还爬,过错直接算你头上。 第二,能拿授权就一定要拿授权。哪怕对方是小商家,一年给个两三百块授权费,也比吃官司赔几万强。阿凯现在学乖了,直接找本地没入驻大平台的小餐馆谈,一家一年给两百块,拿到授权再放信息,现在做得稳当多了,还攒了一波商家的好感。 第三,别碰人家的核心竞争力数据。人家平台花了几年攒的商家资源、独家优惠,那是吃饭的本钱,你全爬走,人家肯定跟你死磕。 别侥幸。真的。 很多人说,大家都在爬,凭什么抓我? 等哪天人家平台要清理竞品,要杀鸡儆猴,你就是那只最倒霉的鸡。 法律现在也在跟着新业态走,这些一个个小老板踩出来的坑,就是法律一步步画清楚爬虫抓取数据权限的路标。没人能给你一张写满所有禁区的地图,但你只要记住,别拿不属于你的东西,别偷别人的劳动成果,就差不到哪儿去。 阿凯昨天给我发消息,说他现在重新攒了几百家授权商家,粉又慢慢涨回来了。三万块买个教训,总比把整个店搭进去强。