金融大数据的法律实践(下)

来源:安理律师

文章摘要
讲座摘要 首先,王新锐律师简要分析了大数据时代用户数据的价值,并就用户个人信息的分类及处理环节进行总结,提出个人、监管者、媒体对此的关注点。

讲座摘要
首先,王新锐律师简要分析了大数据时代用户数据的价值,并就用户个人信息的分类及处理环节进行总结,提出个人、监管者、媒体对此的关注点。之后,王律师以立法框架、实际案例和业内实践三大部分为线索,通过“2014年3·15曝光鼎盛、大唐红旗”等生动案例具体解释前期提到的各项相关法律条文,并分享以“数据脱敏、数据整合、内部隔离”为代表的业内最佳实践经验。上一期安理周刊主要和读者分享用户数据的价值和部分立法实践的内容,本期安理周刊将继续解读立法实践,并提示大数据领域创业过程中的风险点。
演讲全文
第二部分
▌法律细节
(1)法律框架
(2)实际案例
(3)业界实践
▍法律规定:最高人民法院《关于审理利用信息网络侵害人身权益民事纠纷案件适用法律若干问题的规定》
第十二条网络用户或者网络服务提供者利用网络公开自然人基因信息、病历资料、健康检查资料、犯罪记录、家庭住址、私人活动等个人隐私和其他个人信息,造成他人损害,被侵权人请求其承担侵权责任的,人民法院应予支持。但下列情形除外:
(一)经自然人书面同意且在约定范围内公开;
(二)为促进社会公共利益且在必要范围内;
(三)学校、科研机构等基于公共利益为学术研究或者统计的目的,经自然人书面同意,且公开的方式不足以识别特定自然人;
(四)自然人自行在网络上公开的信息或者其他已合法公开的个人信息;
(五)以合法渠道获取的个人信息;
(六)法律或者行政法规另有规定。
网络用户或者网络服务提供者以违反社会公共利益、社会公德的方式公开前款第四项、第五项规定的个人信息,或者公开该信息侵害权利人值得保护的重大利益,权利人请求网络用户或者网络服务提供者承担侵权责任的,人民法院应予支持。
最高院也提到了关于个人信息,他们之间是不完全一致的,但是有一个大的方向,一个基本的东西是一致的。这是我前面提到的关于敏感信息的问题,这些东西你可以认为,这些信息基本是个人隐私的东西,基因信息、病例、健康检查资料、犯罪记录。我们把个人隐私这一块做一个更详细的解释,隐私不管是在美国还是在其他国家,隐私权一直是缺乏非常清晰的定义,尤其我们在互联网这个阶段,大家看到了很多文章去辩论。如果你往五年以前看,辩论的焦点和现在相差了很多,现在你在网络上任何行为,比如说我浏览网站的记录,我购买在淘宝上的支付记录。隐私权的范围在不断扩大,而且隐私权在不同国家的定义也是不一样的。欧洲有一些历史教训,尤其是德国纳粹对个人信息的控制,使得欧洲人对信息特别的重视,信息在欧洲在隐私权中是上升到宪法层面,上升到基本人权。所以欧洲在征信、数据这一块特别的严格。我们给企业的建议,如果你现在APP做完了以后想国际化,你可能想去相对宽松一点的地方,比如说东南亚去试一试,你不要直接杀到欧洲去,欧洲对个人信息严格的程度你很难适应。美国强调个人的言论自由,他强调数据的能动性、合理性,这也是征信、隐私权这一块各个国家的区别。现在美国法规有大量的判例,他也没有把隐私权做一个完整的定义。但是基本上隐私权是个人不被打扰的权利,比如,我很多的好的事情、坏的事情,不想让别人知道。
个人信息中有一部分跟这个没有关系,我在网上的浏览记录,我不愿意让你知道,但是这种行为信息相对没有那么敏感。
公开的方式不足以识别特定自然人。如果你能够识别特定自然人,你这个数据带有一定的敏感性。如果这个信息跟自然人没有特别多的关系,没有特定的识别性。比如说现在淘宝每年会规定特定的统计数据,包括北京的男生喜欢买什么东西,上海的女生买什么东西最多。有的时候淘宝公布过关于女性内衣罩杯的数据。如果你是公布一个特定人的数据,一定是违法,而且是严重违法。但是如果你公布的是一个统计数据,公布的是一个省,没有办法识别到具体的自然人,他没有伤害谁,
也有人问,按说女性内衣一个很私密的东西,把这个统计数据公布出来,会不会伤害到用户的个人信息,如果是整体的统计结论公布还好,如果特定能够识别出个人,就有很大的问题,这是它的界限。
▍法律规定:国家标准化管理委员会《信息安全技术公共及商用服务信息系统个人信息保护指南》
5.2.3 处理个人信息前要征得个人信息主体的同意,包括默许同意或明示同意。收集个人一般信息时,可认为个人信息主体默许同意,如果个人信息主体明确反对,要停止收集或删除个人信息;收集个人敏感信息时,要得到个人信息主体的明示同意。
这个指南从立法角度来说并不是强制性的东西,但是做数据业务员这一块的客户,我们都会推荐他们去看,而且这个指南里面有一些东西是有原则性,收集一般信息的时候我们要默许同意,如果他明确反对,你就不要收集了。但是如果收集敏感信息的时候,一定要明示。
▍法律规定:国务院《征信业管理条例》
第二条本条例所称征信业务,是指对企业、事业单位等组织(以下统称企业)的信用信息和个人的信用信息进行采集、整理、保存、加工,并向信息使用者提供的活动。
第十三条采集个人信息应当经信息主体本人同意,未经本人同意不得采集。但是,依照法律、行政法规规定公开的信息除外。企业的董事、监事、高级管理人员与其履行职务相关的信息,不作为个人信息。
第十四条禁止征信机构采集个人的宗教信仰、基因、指纹、血型、疾病和病史信息以及法律、行政法规规定禁止采集的其他个人信息。征信机构不得采集个人的收入、存款、有价证券、商业保险、不动产的信息和纳税数额信息。但是,征信机构明确告知信息主体提供该信息可能产生的不利后果,并取得其书面同意的除外。
第十五条信息提供者向征信机构提供个人不良信息,应当事先告知信息主体本人。但是,依照法律、行政法规规定公开的不良信息除外。
征信是现在互联网金融、金融大数据中一个非常热点的事情。原来征信停留在国家的系统里面,银行的征信中心。现在央行批了8家开始做征信业务,这里面一方面有很多的商业机会,另一方面,可能征信会改变中国整个社会的信用状况。有时候技术方面的进步,或者是制度方面的进步,我们更有信心,中国在信用制度方面有很大的问题,很多专家会呼吁立法,但是呼吁了那么多年,改变很小,支付宝通过技术手段和商业模式解决了一定的信用问题,使得原来很多交易不能发生。它产生了增量的交易,支付宝现在的市场价值凸显出来。当你有了问题的时候,技术的手段,包括创新可以带来很多的机会,这也是金融大数据的机会所在。征信是一个挺复杂的事,但是从法规定义上来说,还是可以判断的。采集、整理、保存、加工,并向信息使用者提供的行为。征信要包含不同的连镳,把这些数据从不同地方拿到以后进行处理。如果单是只做一个环节,恐怕就是大数据的技术服务,这也是很多公司在做的时候自己有疑问,他说我做的到底是不是征信,经常有咨询公司来问我,说我做的是征信业务,还是数据的分析业务,我们是数据挖掘、数据分析。如果你说我们做的是征信业务,就意味着按照法规规定,必须拿个人征信的牌照,个人征信的牌照难度很高。
采集个人信息应当经信息主体本人同意,征信要求他的数据一定要有个人的同意。所以征信不是随随便便可以去做的。现在嘀嘀打车、快的打车,这车来了,你说我不坐了,这其实是一个带有违约的行为。这个行为本身,嘀嘀和快的能不能把这个东西拿去做征信,这个人信用特别差,他打了十次车,八次都没有去,这个人绝对不能借钱给他。这个可不可以?如果你没有经过他同意,这个行为不行。征信不是说他做了一个有问题的行为,一定能把这个行为用到征信的库里。
黑名单的制度。我跟你说,我要让你上黑名单,你同不同意,他一定说不同意。黑名单跟征信有时候是有交叉的。整体来说这是不同的法律问题。今天我们讲到的法律问题没有一个完全的结果,只是有一个大的框架,大家不要觉得每件事情都有一个确定的结果,不管是从技术上还是法律上都是这样。
征信机构不得采集个人收入、存款、有价证券、商业保险、不动产的信息和纳税数额信息。不能采集的信息是一个禁区,因为这个信息最好用,现在从征信管理条例上来讲,是明确禁止的。法律规定这么明确的事,但是很多机构都不注意这个,他们想要的还是怎么样能够尽量多的采集用户数据。但是在法规不断收紧的时代,是有问题的。
▍法律规定:人民银行《关于做好个人征信业务准备工作的通知》
人民银行印发《关于做好个人征信业务准备工作的通知》,要求芝麻信用管理有限公司、腾讯征信有限公司等八家机构(后附名单)做好个人征信业务的准备工作,准备时间为六个月。
培育社会征信机构,是贯彻落实党中央、国务院关于推进社会信用体系建设、建立健全社会征信体系等一系列方针政策的重要举措,对于规范发展征信市场、服务实体经济具有积极意义。
征信这一块的法律法规非常复杂。现在有阿里、腾讯等八家征信公司,到今年年后可能牌照发放,就可以做一些个人征信的事情。
这段话是人民银行副行长潘功胜讲的,我们能够从讲话中读到一些信息,这些信息代表新的创新方向。积极利用互联网、大数据等新技术条件发展新业态征信。现在中国基本上能够去银行贷款的人和拿信用卡的人是高度重合的,大概有一亿多人。剩下的人有一个问题,他贷不到款,也拿不到信用卡,他只有一个办法,就是找亲戚朋友借钱。这些人中有一部分人的信用情况还是非常不错的,这也是目前金融大数据的一个发展方向,通过大数据的方法找出其中一些不错的,我们去做贷款。从这些传统的我们覆盖的人群里也有一些坏分子,传统的方法发现不了,我们用新的方法发现他。新业态征信是互联网金融中一个非常大的热点。
推动政务信息尤其是负面信息的公开。要建立信息主体的异议投诉及责任处理机制,建立个人信用修复制度性安排。你干了一个事以后,你的信用一下子下降了,你干什么事都很痛苦,所以你不敢随便干坏事。但是问题是,是不是做了这个事情以后,是不是永远没有办法修复,永远被列为很差的信用,不是。你过一个阶段以后,重新的把这些违约的信息修复。
▍芝麻信用的数据来源
内容包括:基本信息、注册信息、兴趣偏好、支付和资金、人脉关系、黑名单信息、外部应用信息
来源包括:电商数据来自阿里巴巴,互联网金融数据来自蚂蚁金融,众多合作公共机构及合作伙伴,各种用户自主信息提交渠道
比较实际的案例芝麻信用,如果你想研究金融大数据这是最典型的案例,它的公开信息较多。他这已经是C端了,对很多用户放开了,你很多的数据可以得到。芝麻信用给你打一个分数,这个分数涉及到基本的数据来源,涉及到个人基本信息、网站注册信息,你看他注册的时候是不是实名注册,兴趣偏好是什么,我们客户得出一个特别好玩的数据,如果你特别热爱网游,你的违约度是比较高的。如果你是从事经管工作的,你的违约度是比较低的。以前在传统评价机制里,不会把这个跟个人兴趣挂钩。填写注册的时候,如果名字邮箱里面有一个英文很长的名字,他的个人信用就会变好,因为这意味着这个人受教育程度还可以,他能起一个英文名字,还能拼对。人际关系、你是被你的朋友所决定的,看看你身边的朋友是谁,就知道这个人大概的情况是什么样的。如果一个人身边的朋友都是CEO,十有八九这个人自己也是CEO。人脉有时候跟这相关,但是有时候是有欺骗性的。有的人只是加了你的微信,但是其实两个人并不认识。这一点还有待于检验。黑名单就是看你这个人是不是经常在网上有欺诈行为。外部应用,就是阿里和其他的合作、其他的公司有违约的行为,把他收集过来。他的收集来源于阿里巴巴自身、电商的数据、公共合作机构、用户。比如说用户想干一个事情,他说你愿意自主提供信息吗?
▍芝麻分是怎么得出的
芝麻分的影响因素:身份特质、信用历史、行为偏好、履约能力、人脉关系
用雷达图的显示用户在五个方面的表现好坏,越饱满信用越好。
这是他们现在打分的机制。这是特别典型的互联网金融中,金融大数据的应用。跟阿里不同的应用还是有一些,只不过阿里覆盖的人群和他们覆盖的不一样。把互联网的各种数据总结过来,你也不清楚他的具体算法是怎么回事,但是最后算出来你的信用分数超过六百分,基本上能干很多事情,在他们来看,基本上信用还可以。而你某一项特别差,信用特别差,你可能会很快的低下去,做很多事情的时候也是不被信任。阿里信用也会区分,你的信用是六百分以上,他们给你提供很多的服务。比如你酒店住宿的时候,说你这个人信用度很高,酒店的押金就不收了。
▍负面案例
3·15晚会曝光鼎盛、大唐红旗案例
2014年央视315晚会曝光鼎开、大唐旗下高鸿等公司存在向智能手机植入恶意程序等问题,该程序会造成恶意扣费以及泄露用户个人信息。用户手机出现恶意扣费的情况,经调查发现,用户手机被植入两个恶意木马程序,一个可以远程安装、卸载应用软件,另一个可以获取手机中的个人信息。
鼎开公司通过植入方式获利,每个月装机量达到130万台。而大唐电信旗下高鸿股份公司开发的大唐神器,每个月装机量达100万台,已经在用户手机上悄然安装4600万个软件。除了恶意软件安装,这些程序还获取用户手机上的IMEI、应用使用时间、地址等隐私数据。
这个负面案例是3.15晚会曝光个人用户搜集的负面案例。这个案例超出了合法性、必要性、正当性。他装了这个东西以后,基本上你手机里所有的信息都会给你抓走,发到他的服务器里面去。大家最近听到一个消息,小米在台湾,台湾要求他们的议员不要用小米手机,原因是因为他们认为小米把他们的信息抓取以后,传回北京。在合规性上做的不够好、不够严谨,国外的这些区域,可能他国家本身不是特别发达,但是他们在个人信息保护这一块,标准更低。类似这种公司,抓到你的数据以后,不知不觉的把你的数据发到各个地方,而且再给你推送广告,而且用的还是你的流量,你还删不掉。你被曝光以后,你做这些事情以后,索赔的金额更高。
▍大数据业务实践
一、数据收集环节(用户授权)
二、跨行业合作(数据合法性)
三、收费方式(效果衡量)
四、反欺诈(身份和行为)
大数据在业务实践层面要注意的,我们经常处理这几个环节,也是公司做业务实际会遇到的环节,这些环节如果没有处理好,后果很恶劣。
第一,数据收集环节,明确什么样的数据我要收集,拿回去给第三方用的时候,要经过什么样的程序让你同意。数据收集是所有大数据业务的基础,如果数据来源的合法性丧失了,后面做的越大,危险越大,不良影响越大。
第二,跨行业合作。一个互联网企业跟一个金融机构合作,我帮助你分析你的客户,对方会说,你本身做的算法的这些东西安全性是不是够。数据谁来提供?你把数据提供给我,还是我把数据提供给你。我把数据提供给你,我的用户信息怎么办?大数据的不同数据源的复杂性就体现在这一块,怎么样能够让大数据保持它的合法性,就是在之前的授权尽量的清晰,有些事一定要跟用户说。你想做去租车、租房的服务,是不是要得到明确的许可。
第三,收费方式,现在大数据公司的各方面还是有很多的盈利点。我把数据筛选、打分、查询,按照这些收钱。我们帮助你带了客户,后面再做更精确的营销。现在互联网金融P2P的坏账特别多,我怎么把这个人从人群中抓出来。坏账分为两件事:第一,还款意愿。第二,还款能力。传统机构重点评价的是还款能力。现在互联网金融会把还款意愿加进去。你帮助互联网金融机构增加营销精确性,减少欺诈,催收的环节,而且一旦在市场做的很好,你的收入是非常可观的。
第四,反欺诈。我们自己一个客户,现在可以看到怎么样把大数据实际应用于一个场景。如果做互联网金融的产品,会有一个现象,每次推出一个新的互联网金融的产品,一个新的P2P上线的时候,会来一群人带有非常典型的欺诈性质,而且这群人占比还不低,我们提到一家国内非常知名的互联网公司做一个产品上线以后,第一天来了四万多人,这四万个ID中大部分是惯犯。每一个新饭馆开张,会来一帮吃白食的、吃霸王餐的,他们专门干这个事。但是你今天刚刚开张,不想伸张,这些人保证吃成功。在互联网金融上也有一帮这样的人,每次有一个新产品上线,这个产品越大,这些人越多。如果在线下放贷款的时候,来了以后你没有见到真人,他们行为不一样,各方面能够看到差别。在互联网上这些人都是ID,你怎么把这些坏分子揪出来?来的坏人太多了,一天四万人个,每个人带一点钱,损失非常大。我们这个客户专门研究这一类人的行为,这一类人专门在网上做网络欺诈。一方面他们去看这些人是哪些,比如说这些人来吃霸王餐,这些餐馆的保安都在哪。你就会识别出这个又来了。还有一种是关于具体身份识别,还有一种是关于他行为的判断。警察在广场上抽人,大家不要觉得检查是随机的,他一定是快速的判断这个人形迹可疑在什么地方。这个人目光很闪躲、他穿的衣服跟自己的行为是不符的。这个有点类似,他们研究这一类在网上搞欺诈行为的人,一方面他们可以在百度贴吧搜这些人,是不是这些人在网上留下了很多痕迹。观察这些人的行为,包括他的设备信息号,如果一个设备反复的异常去用,就会有问题。我们一个客户帮助一个互联网公司在第一天内揪出70%、80%的欺诈,这就是价值。如果你想做这个事情,自己没有能力通过各种方法抓住这些人。如果一天来四万个ID,你是传统金融公司,审这四万ID,你需要花很多时间、很多钱干这个事情,你审的时间又长。现在大数据公司可以做到,因为他数据的丰富性,即时性,他可以在第一时间把这些坏分子抓出来。在反欺诈这一块,互联网金融是做的很不错的。
▍数据安全合规
一、数据脱敏
二、数据整合
三、内部隔离
核心是关于“可识别性”
关于数据合规,这是一个专业的技术,从法律的角度,这个制度做到什么程度以后,拿给监管部门说,你认为这个东西是不是合规性够了。这几点是客户跟监管部门,跟合作机构解释的。
第一,数据要做脱敏。不要直接把数据拿给合作方看,如果得到授权情况下,他得到一些具体数据,你要把整个数据脱敏。这个人在你这儿是合规的,但是出去的时候是一个长串的字符,没有把个人的姓名、邮箱、电话给出去。
第二,数据整合。信用评分很典型,我给到你的时候,我不告诉你他具体干了什么事,但是我告诉你他的信用分是六百以下。这就直接避免了把可识别信息给他。
第三,内部隔离。一方面包括数据本身的隔离,不同的数据如果都存在一个硬盘上,哪天硬盘突然被人偷走了,你这个公司就完蛋了。现在我们看到国外的一些验证门、数据泄露,都和这个有关,一旦被攻破,所有的数据都被拿走了。
核心是关于可识别性。大数据的算法通常不是通过专利保护,而是通过商业秘密的方法保护。你好不容易得出一个算法,一定不会公开。大数据也是很难通过专利的方式保护。意味着你的数据一旦被抄袭,你怎么证明这是侵权行为,让他停止侵权。这就是采取保护措施,一是要求所有员工签好保密协议,约定清楚,对他有一个约束。二是要有证据留存,很多公司在商业秘密案件中败诉,是因为这个算法的版本不断更新,他很难去证明侵犯了哪个版本。定期的把算法、这些东西刻录成光盘,按时间序列保存起来。你基本上可以判断我这个东西比你早还是比你晚。在商业秘密第一是接触性,他能接触到你的商业秘密。第二,相似性,在诉讼中,相似性要到正规的鉴定机构去鉴定。如果你做这一块业务,你需要在商业秘密保护上做一些投入,这样你的算法,不至于最核心的东西被偷走。我们在做融资的过程中,有一些特别担心的,你最核心的是算法,你的算法被拿出去以后,你的公司价值马上打一个折扣。
第三部分
▌核心风险点
一、监管
二、知识产权
三、数据外泄
四、用户投诉
五、媒体曝光
最后一部分,我们在做大数据的时候遇到的核心风险点。你作为一个从业者怎么样规避这些风险。
第一,监管。监管以后会越来越严格,个人数据关系到社会稳定,关系到安全,所以监管一定不会放松。
第二,知识产权。一方面跟商业秘密保护有关。另一方面涉及到各方数据的所有权、数据加工以后的权利,包括公司的员工作品,员工说我走了,把这个算法都带走,这样行不行。很多做数据业务的人都会到处“扒数据”,到各个网站上把他的数据扒一遍。如果你只是小范围的扒,也很难被发现。但如果你全部扒下来,在网站里集合,这种行为已经构成了对他的数据的替代性。而且他在编辑整理数据的过程中投入了劳动,在这方面就构成不正当竞争,已有实际的案例判决构成侵权。我自己2004年参加司法考试,我司法考试以后,每年手机上都会收到推荐我去参加司法考试班的短信。我知道在什么渠道提供了我的电话,他知道我是要考司法考试的人,一定是有人偷偷拿我的电话卖掉,让他这么精准的投广告到我。这种数据泄露让用户精确的感受到是谁把我的信息卖了。以后这种纠纷会越来越多。让用户感觉到心理上的安全感,如果用户突然想,我也是被侵犯的,他的安全感下降了,你的产品商业价值也下降了,因为他不敢用这个产品了。
第三,数据外泄分为客观外泄和主观外泄。
第四,用户投诉,要让用户感觉到你的数据不准确,我需要一个投诉的通道,把这个数据纠正。比如说有人在境外刷卡,有一个拖欠行为,后来没有得到修正,这个用户发现我做房贷做不下来,做车贷做不下来,后来发现他把这个机构告了。
第五,媒体曝光。负面的例子我们前面提到了。做大数据一方面有一个黑盒子,把你的算法精心的保护起来,另一方面也要提高透明度。比如芝麻信用,它会尽量把自己的基本算法构成向用户披露。
我今天重点讲的还是在金融大数据的过程中,有哪些东西是我们必须要去注意到的,还有很多东西是商业操作,真正做实务的时候可能会有切身的感受,因为是另外一个层面的东西。大数据这一块里面有非常虚、非常无聊,被媒体神秘化,甚至很多做这个行业的人刻意把这个行业神秘化的东西,让大家感觉到我很厉害,实际上大数据基本上是一个试错的过程。这种公司,当你有足够的数据量进来,有资金的支持,能够去试错,最后做一个相对合理的模型出来。希望有非常合理的大数据公司,而且它最后一定会改变互联网金融生态,最后乃至整个社会的生态。从互联网的例子上,现在已经把很多东西做改变。后面会有一些更有意思的事情发生。

技术驱动法律,专业成就未来