目录
一、 场景描述:爬虫与robots协议的使用合规
二、 爬虫与robots协议
(一) 爬虫
(二) 爬虫的分类
(三) Robots协议
三、 爬虫协议的法律属性
(一) 司法认定
(二) 自律公约
(三) 例外
四、 违反robots协议使用爬虫的法律风险
(一) 不正当竞争
(二) 非法获取计算机信息系统数据罪
(三) 其他侵权或犯罪
五、 整体评价
一 、场景描述:爬虫与robots协议的使用合规
爬虫技术在获取大量数据的同时避免了人工活动,大大提升了效率,但与此同时,爬虫技术在实际使用的过程中也不可避免的带来破解目标站点保护措施、给目标站点带来访问流量压力、获取目标站点的敏感数据等法律问题。
爬虫本身是一项技术中立的数据获取手段,不能通过立法直接加以限制,从业者为了对外表明自身网站对爬虫的态度,可以编写出robots协议(爬虫协议),告诉外部爬虫哪些信息可以抓哪些不可以,但这项协议能否等同于法律上的“协议”,其多大程度上具备法律效力值得探讨。
二 、爬虫与robots协议
(一)爬虫
是目前互联网获取第三方网站信息和数据的最常用技术手段之一,是通过编程来自动实现对目标站点和目标信息的批量获取。最早的爬虫事实上就是搜索引擎,它可以检索网站的信息并提供给其他用户访问。
(二)爬虫的分类
按爬虫功能,可以分为网页爬虫和接口爬虫,前者以搜索引擎爬虫为主,根据网页上的超链接进行遍历爬取,后者接口爬虫则是通过精准构造特定API接口的请求数据,而获得大量数据信息。
按授权情况,可以分为合法爬虫和恶意爬虫,前者以符合Robots协议规范的行为爬取网页,或爬取网络公开接口、授权接口进行爬取;后者恶意爬虫则是通过分析并自行构造参数对非公开接口进行数据爬取或提交,获取对方本不愿意被大 量获取的数据。
(三)robots协议
早期的爬虫技术使用者为了对外表明其对爬虫爬取自身内容的态度和限度,制作了一个技术声明文件,叫做Robots协议(爬虫协议),全称是“网络爬虫排除协议”(Robots Exclusion Protocol)。
可见,这里的“协议”对应的英文“Protocol”是计算机通信意义上的“协议”,而不是法律意义上的“协议agreement“。自然这样的爬虫协议是不具备法律上的“协议”效力的,它是一个君子协定,供业内人士自觉遵守。
具体而言,robots协议是网站所有者通过位于置于网站根目录下的文本文件robots.txt,提示网络机器人哪些网页不应被抓取,哪些网页可以抓取。爬虫访问某站点的时候,理论上应当第一个读取的文件就是robots.txt文件,如果该文件不存在,爬虫将能够访问网站上所有没有被口令保护的页面,如果存在,应该按照文件中标明的指令来访问网站内容,当然,很多爬虫对此“不屑一顾”。

(可以在相关网站主页后添加/robots.txt来查看该网站的robots协议,如淘宝网的“爬虫协议”截图,其中“allow”是指允许访问的内容,“disallow”是指不允许访问的内容)
三 、爬虫协议的法律属性
前文已述,爬虫协议是一种“单方技术声明”,不必然发生合同法意义上的“协议”效力,目前司法实践和行业自律中更倾向于将其作为公认的商业道德对待,如有违反,可能构成不正当竞争。
(一)司法认定
北京市第一中级人民法院在百度诉奇虎不正当竞争案件中指出:“在被告推出搜索引擎伊始,其网站亦刊载了Robots协议的内容和设置方法,说明包括被告在内的整个互联网行业对于Robots协议都是认可和遵守的。其应当被认定为行业内的通行规则,应当被认定为搜索引擎行业内公认的、应当被遵守的商业道德”。
(二)自律公约
中国互联网协会2012年11月1日发布的《互联网搜索引擎服务自律公约》第七条也直接规定:“遵循国际通行的行业惯例与商业规则,遵守机器人协议(robots协议)”。
(三)例外
值得注意的是,《互联网搜索引擎服务自律公约》第八条同时规定:“互联网站所有者设置机器人协议应遵循公平、开放和促进信息自由流动的原则,限制搜索引擎抓取应有行业公认合理的正当理由,不利用机器人协议进行不正当竞争行为,积极营造鼓励创新、公平公正的良性竞争环境”,也就是说《公约》并不是天然的认为所有的robots协议都必然应该得到遵守,robots协议也应该有正当理由,应该符合“公平、开放和促进信息自由流动的原则”,否则可能被用来从事不正当竞争。
四 、违反robots协议使用爬虫的法律风险
(一)不正当竞争
前文中列举了百度与奇虎公司的案例,除此以外,还包括使用爬虫(尤其是接口口类的爬虫)时常常需要绕过权利人为保护数据采取的技术措施,这种行为也仍然会被法院认定为不正当竞争。
典型的案例如北京爱奇艺科技有限公司与上海千杉网络技术发展有限公司、悦观网络技术(上海)有限公司其他不正当竞争纠纷,上海市浦东新区人民法院一审认定:“两被告辩称‘电视猫MoreTV’软件通过爬虫技术抓取“爱奇艺”网站链接地址,具体方式是搜索获得整个播放页面,将链接地址保存在“电视猫MoreTV”软件的服务器上……本院认为,‘电视猫MoreTV’软件不能直接通过搜索获取网页并解析得到“爱奇艺”视频正片的播放地址,必须破解“爱奇艺”网站的验证算法,并取得有效的密钥后才能生成“爱奇艺”视频正片的播放地址。两被告辩称破解原告技术保护措施的难度很低,但无论其难度高低,也不能掩盖两被告采取了破解原告技术保护措施的事实。因此,两被告确采取了技术措施,使‘电视猫MoreTV’软件播放来源于‘爱奇艺’网站视频时绕过了原告片前广告的投放平台,得以直接播放正片”。
(二)非法获取计算机信息系统数据罪
一旦上述破解和获取行为达到一定严重程度,则可能触犯刑法构成犯罪。
典型的案例如全国首例利用“爬虫”技术侵入计算机信息系统抓取数据案:
北京海淀法院依法查明被告人张某、宋某、侯某经共谋,采用技术手段抓取被害单位北京某网络技术有限公司服务器中存储的视频数据,并由侯某指使被告人郭某破解北京某网络技术有限公司的防抓取措施,使用“tt_spider”文件实施视频数据抓取行为,造成被害单位北京某网络技术有限公司损失技术服务费人民币2万元。
经鉴定,“tt_spider”文件中包含通过分类视频列表、相关视频及评论等接口对被害单位服务器进行数据抓取,并将结果存入到数据库中的逻辑。在数据抓取的过程中使用伪造device_id绕过服务器的身份校验,使用伪造UA及IP绕过服务器的访问频率限制。海淀法院经审理后认为,被告单位上海某网络科技有限公司违反国家规定,采用技术手段获取计算机信息系统中存储的数据,情节严重,其行为已构成非法获取计算机信息系统数据罪,应予惩处
(三)其他侵权或犯罪
爬虫根据爬取的信息内容不同,也可能因此引发法律风险,尤其是如果爬取的是没有著作权的作品内容、没有授权的个人信息、隐私、商业秘密等,爬取的主体可能因此承担侵犯著作权、隐私权、商业秘密等民事或刑事责任。
五 、整体评价
爬虫作为一项批量获取信息的技术,被普遍用于搜索引擎等领域,其本身所具有的中立性应当获得法律认可。
爬虫协议(robots协议)尽管由当方面作出,但仍应当获得法律的支持和认可,因为它是从业者对数据流通与否自行作出的意思表示,这个意思表示应当获得通过爬虫获取信息一方的尊重。
然而,目前立法尚无规定要求爬虫必须将查看和遵守robots协议作为前置环节,导致诸多爬虫协议的设置也只是事后防御性的,执行过程中流于形式,缺乏实际意义,建议通过行业标准、国家标准或者立法等加以改善。
另外一方面,关于robots协议本身的有效性问题,我们认为对公益类或公共服务类的网站制定的robots协议应当对其正当性、合理性等进行审查,一方面这类站点的数据本身就有“取之于民、用之于民”的目的,另外正当性审查能促使网站更大程度向公众开放数据。
但单纯的民间站点或商业网站的运营者,如果这些主体对网站上的内容有独立控制的法定权利,则自然能够推导出其有独立自主的权利决定robots协议的内容和范围,不应对其进行内容审查,这是其作为数据控制者对数据享有权利的一部分体现。
一、 场景描述:爬虫与robots协议的使用合规
二、 爬虫与robots协议
(一) 爬虫
(二) 爬虫的分类
(三) Robots协议
三、 爬虫协议的法律属性
(一) 司法认定
(二) 自律公约
(三) 例外
四、 违反robots协议使用爬虫的法律风险
(一) 不正当竞争
(二) 非法获取计算机信息系统数据罪
(三) 其他侵权或犯罪
五、 整体评价
一 、场景描述:爬虫与robots协议的使用合规
爬虫技术在获取大量数据的同时避免了人工活动,大大提升了效率,但与此同时,爬虫技术在实际使用的过程中也不可避免的带来破解目标站点保护措施、给目标站点带来访问流量压力、获取目标站点的敏感数据等法律问题。
爬虫本身是一项技术中立的数据获取手段,不能通过立法直接加以限制,从业者为了对外表明自身网站对爬虫的态度,可以编写出robots协议(爬虫协议),告诉外部爬虫哪些信息可以抓哪些不可以,但这项协议能否等同于法律上的“协议”,其多大程度上具备法律效力值得探讨。
二 、爬虫与robots协议
(一)爬虫
是目前互联网获取第三方网站信息和数据的最常用技术手段之一,是通过编程来自动实现对目标站点和目标信息的批量获取。最早的爬虫事实上就是搜索引擎,它可以检索网站的信息并提供给其他用户访问。
(二)爬虫的分类
按爬虫功能,可以分为网页爬虫和接口爬虫,前者以搜索引擎爬虫为主,根据网页上的超链接进行遍历爬取,后者接口爬虫则是通过精准构造特定API接口的请求数据,而获得大量数据信息。
按授权情况,可以分为合法爬虫和恶意爬虫,前者以符合Robots协议规范的行为爬取网页,或爬取网络公开接口、授权接口进行爬取;后者恶意爬虫则是通过分析并自行构造参数对非公开接口进行数据爬取或提交,获取对方本不愿意被大 量获取的数据。
(三)robots协议
早期的爬虫技术使用者为了对外表明其对爬虫爬取自身内容的态度和限度,制作了一个技术声明文件,叫做Robots协议(爬虫协议),全称是“网络爬虫排除协议”(Robots Exclusion Protocol)。
可见,这里的“协议”对应的英文“Protocol”是计算机通信意义上的“协议”,而不是法律意义上的“协议agreement“。自然这样的爬虫协议是不具备法律上的“协议”效力的,它是一个君子协定,供业内人士自觉遵守。
具体而言,robots协议是网站所有者通过位于置于网站根目录下的文本文件robots.txt,提示网络机器人哪些网页不应被抓取,哪些网页可以抓取。爬虫访问某站点的时候,理论上应当第一个读取的文件就是robots.txt文件,如果该文件不存在,爬虫将能够访问网站上所有没有被口令保护的页面,如果存在,应该按照文件中标明的指令来访问网站内容,当然,很多爬虫对此“不屑一顾”。

(可以在相关网站主页后添加/robots.txt来查看该网站的robots协议,如淘宝网的“爬虫协议”截图,其中“allow”是指允许访问的内容,“disallow”是指不允许访问的内容)
三 、爬虫协议的法律属性
前文已述,爬虫协议是一种“单方技术声明”,不必然发生合同法意义上的“协议”效力,目前司法实践和行业自律中更倾向于将其作为公认的商业道德对待,如有违反,可能构成不正当竞争。
(一)司法认定
北京市第一中级人民法院在百度诉奇虎不正当竞争案件中指出:“在被告推出搜索引擎伊始,其网站亦刊载了Robots协议的内容和设置方法,说明包括被告在内的整个互联网行业对于Robots协议都是认可和遵守的。其应当被认定为行业内的通行规则,应当被认定为搜索引擎行业内公认的、应当被遵守的商业道德”。
(二)自律公约
中国互联网协会2012年11月1日发布的《互联网搜索引擎服务自律公约》第七条也直接规定:“遵循国际通行的行业惯例与商业规则,遵守机器人协议(robots协议)”。
(三)例外
值得注意的是,《互联网搜索引擎服务自律公约》第八条同时规定:“互联网站所有者设置机器人协议应遵循公平、开放和促进信息自由流动的原则,限制搜索引擎抓取应有行业公认合理的正当理由,不利用机器人协议进行不正当竞争行为,积极营造鼓励创新、公平公正的良性竞争环境”,也就是说《公约》并不是天然的认为所有的robots协议都必然应该得到遵守,robots协议也应该有正当理由,应该符合“公平、开放和促进信息自由流动的原则”,否则可能被用来从事不正当竞争。
四 、违反robots协议使用爬虫的法律风险
(一)不正当竞争
前文中列举了百度与奇虎公司的案例,除此以外,还包括使用爬虫(尤其是接口口类的爬虫)时常常需要绕过权利人为保护数据采取的技术措施,这种行为也仍然会被法院认定为不正当竞争。
典型的案例如北京爱奇艺科技有限公司与上海千杉网络技术发展有限公司、悦观网络技术(上海)有限公司其他不正当竞争纠纷,上海市浦东新区人民法院一审认定:“两被告辩称‘电视猫MoreTV’软件通过爬虫技术抓取“爱奇艺”网站链接地址,具体方式是搜索获得整个播放页面,将链接地址保存在“电视猫MoreTV”软件的服务器上……本院认为,‘电视猫MoreTV’软件不能直接通过搜索获取网页并解析得到“爱奇艺”视频正片的播放地址,必须破解“爱奇艺”网站的验证算法,并取得有效的密钥后才能生成“爱奇艺”视频正片的播放地址。两被告辩称破解原告技术保护措施的难度很低,但无论其难度高低,也不能掩盖两被告采取了破解原告技术保护措施的事实。因此,两被告确采取了技术措施,使‘电视猫MoreTV’软件播放来源于‘爱奇艺’网站视频时绕过了原告片前广告的投放平台,得以直接播放正片”。
(二)非法获取计算机信息系统数据罪
一旦上述破解和获取行为达到一定严重程度,则可能触犯刑法构成犯罪。
典型的案例如全国首例利用“爬虫”技术侵入计算机信息系统抓取数据案:
北京海淀法院依法查明被告人张某、宋某、侯某经共谋,采用技术手段抓取被害单位北京某网络技术有限公司服务器中存储的视频数据,并由侯某指使被告人郭某破解北京某网络技术有限公司的防抓取措施,使用“tt_spider”文件实施视频数据抓取行为,造成被害单位北京某网络技术有限公司损失技术服务费人民币2万元。
经鉴定,“tt_spider”文件中包含通过分类视频列表、相关视频及评论等接口对被害单位服务器进行数据抓取,并将结果存入到数据库中的逻辑。在数据抓取的过程中使用伪造device_id绕过服务器的身份校验,使用伪造UA及IP绕过服务器的访问频率限制。海淀法院经审理后认为,被告单位上海某网络科技有限公司违反国家规定,采用技术手段获取计算机信息系统中存储的数据,情节严重,其行为已构成非法获取计算机信息系统数据罪,应予惩处
(三)其他侵权或犯罪
爬虫根据爬取的信息内容不同,也可能因此引发法律风险,尤其是如果爬取的是没有著作权的作品内容、没有授权的个人信息、隐私、商业秘密等,爬取的主体可能因此承担侵犯著作权、隐私权、商业秘密等民事或刑事责任。
五 、整体评价
爬虫作为一项批量获取信息的技术,被普遍用于搜索引擎等领域,其本身所具有的中立性应当获得法律认可。
爬虫协议(robots协议)尽管由当方面作出,但仍应当获得法律的支持和认可,因为它是从业者对数据流通与否自行作出的意思表示,这个意思表示应当获得通过爬虫获取信息一方的尊重。
然而,目前立法尚无规定要求爬虫必须将查看和遵守robots协议作为前置环节,导致诸多爬虫协议的设置也只是事后防御性的,执行过程中流于形式,缺乏实际意义,建议通过行业标准、国家标准或者立法等加以改善。
另外一方面,关于robots协议本身的有效性问题,我们认为对公益类或公共服务类的网站制定的robots协议应当对其正当性、合理性等进行审查,一方面这类站点的数据本身就有“取之于民、用之于民”的目的,另外正当性审查能促使网站更大程度向公众开放数据。
但单纯的民间站点或商业网站的运营者,如果这些主体对网站上的内容有独立控制的法定权利,则自然能够推导出其有独立自主的权利决定robots协议的内容和范围,不应对其进行内容审查,这是其作为数据控制者对数据享有权利的一部分体现。
