数据合规是一个比较新的领域,很多问题都难以通过公开渠道检索到答案。此时,实务人士间的思想碰撞、交流就显得尤为珍贵。
CONTENT
「门牌号转经纬度的告知同意」
「AIGC和深度合成的区别」
「境内代表处数据出境路径」
「个人信息Token化」
「AI算法被误导后会影响后人吗」
门牌号转经纬度的告知同意
-问:请教个问题,将精确到门牌号的地址文本信息转化为经纬度信息属于新增收集个人数据吗?
-答1:不属于吧,应该说是新增对地址的处理和使用方式吧。
-答2:衍生数据。要不要重新告知还是看是否超出之前的处理目的吧。
-答3:这个也可以参考。
总结:不属于收集新的个人信息,但个人理解还是要在隐私政策披露一下。
AIGC和深度合成技术的区别
-问:生成式人工智能技术和深度合成技术有什么区别?
-答1:AIGC-gpt;深度合成-deep fake。
-答2:生成式:从无到有;深度合成:把有变成另一个有。
-答3:Chat GPT的回答:深度合成(DeepFakes)和AIGC(Artificial Intelligence Generated Content)都是基于人工智能技术生成虚假内容的方法,但它们之间有一些区别:(1)目的不同:深度合成的主要目的是通过将一个人的面部特征合成到另一个人的身体上来创造虚假的视频或图片,而AIGC的目的是通过机器学习算法生成各种类型的虚假内容,包括音频、视频、文本等。(2)技术不同:深度合成主要使用深度学习技术,如生成对抗网络(GANs)和变分自编码器(VAEs),而AIGC使用各种机器学习算法,如支持向量机(SVM)和随机森林(Random Forests)。(3)应用不同:深度合成主要应用于娱乐和诈骗等领域,而AIGC可用于各种任务,如自然语言处理、图像处理、音频处理等。
-答4:可以看看这一篇,中国的人工智能监管之路。

-答5:洪老师这篇也可以参考:我国生成式AI新规的认识和理解:和深度合成规则的主要异同,“因此,深度合成技术做广义理解的话,是可以包括目前常见的生成式AI”
-答6:比如,我拿你的脸炼一个lora,我用不同的底模可以生成不同风格的你。底模你就理解成生成,是从无到有。lora是把你的脸换到底模生成的东西上,是深度合成,是把已有的东西变成另一个。也就是你讲的包含。
总结:从无到有和从A到B。
境内代表处数据出境路径
-问:求问代表处如果没到安全评估要求,目前又走不了scc备案,打算解决这个gap呢。涉及业务和员工数据的出境,体量比较小,基本在境内没有存储。收到网信办的反馈是说,不具有独立法人资格,目前走不了备案。
-答1:走认证?似乎也不现实呀,主要的系统都在境外。
-答2:也可以选择承担风险。
-答3:能不能让境外公司指定派遣单位去做?
-答4:员工数据或许可以?但是还有业务联络产生的出境。这个问题应该是普遍问题,甚至有些可能还有敏感行业,比如外资银行境内分行,再保险公司的境内分公司等。
-答5:建议多跟网信办老师沟通。
-答6:金融数据有本地化的一般规定。
总结:认证费钱,还是多沟通,量少也可以先观望一下。
个人信息Token化
-问:客户想通过个人信息的Token化规避数据出境安全评估,这样是不是有点不太可行呀。Token化,可以看一下这篇:数字化新业态下数据安全创新——Token化。就是他们觉得token化的个人信息,就是PIPL下的匿名化信息。。这应该不对吧?token化还是可逆的。
-答1:Token完全随机生成,并通过保存一一映射关系表(这种是狭义的Token化生成方式)。因为Token与明文没有算法关系,只能通过Token化服务才能进行正、反向关联,因此是最安全的方案。Token化安全性假定就是Token和明文的无关性,如果任何一个人或系统非法保存、构造了一份Token与明文的对照字典或者具有构造这个字典的能力,Token化的安全机制就彻底破坏了,因此Token化安全的核心就是防止这个表的生成。
-答2:国内没有技术可以达到匿名化。
-答3:目前也只有去标识化、 都没看到匿名化相关的标准等落地的文件。后续数据还要继续用,肯定是要秘钥解了还原的。不然费那劲出境干啥呢。不然就搞个什么隐私计算,比对结果成了,都未必需要出境。
-答4:理论抽象上和ID、Hash等没有看到实质差异,类似微信读书案的说理依然适用。实战攻防上就是去年Aloni Cohen攻破k-匿名,魔法一样精彩的工作。
-答5:这里可以理解为就是假名。有一张token数据库维护明文和假名的一一对应关系。业务数据库上所有明文都替换成假名了。然后开发人员是没办法直接访问token数据库。
-答6:不可逆只是匿名化其中一个特征。而且即使token不可逆又如何,还是可以通过关联其他信息可识别出特定自然人,属于个人信息,能解决安全问题,但实现不了匿名化,或者说在现有技术下,还能有使用价值的“匿名化”都是假匿名化。
总结:匿名化都是骗人的,有价值的都不是匿名化。
AI算法被误导后会影响后人吗
-问:想请教一下 同一款ai产品,如果一个用户误导成功了,其他用户提问的时候是否会得到一个误导成功的结果呀?
-答1:一次不至于的。
-答2:我觉得取决于这款大模型的数据库来源,如果很依赖用户问答且人工干预不到位,我理解是有这种可能?
-答3:你想问能不能自己finetune吧,并且自己finetune的会不会影响别人吧。1.看是否开放finetune能力。2.你自己finetune的不影响别人,有些情况下是隔离的。
-答4:百度文心的回答。


总结:还要考虑对话的连续性,个人理解这种情况较难发生。文心一言本次表现不错。
AIGC和深度合成的区别
作者:何琛来源:数据何规

数据合规是一个比较新的领域,很多问题都难以通过公开渠道检索到答案。此时,实务人士间的思想碰撞、交流就显得尤为珍贵。