在当今数据驱动的社会中,医疗保健领域的数据利用对于提高服务质量、优化资源分配以及推动公共卫生战略的制定至关重要。然而,医疗数据的敏感性要求在数据利用与个人隐私保护之间找到平衡。为此,隐私增强技术(Privacy Enhancing Technologies, PETs)的应用成为解决这一挑战的关键途径。本文介绍了G7数据保护机构(Data Protection Authorities, DPAs)新兴技术工作组所开展的一项用例研究,旨在探讨如何利用合成数据技术在不损害真实患者隐私的前提下,支持医疗保健规划和资源分配系统的开发与测试。
本研究背景基于合成数据的概念,即通过算法从现有的真实医疗处方数据集中生成的模拟数据。合成数据的使用旨在模拟真实数据的特性和统计规律,同时去除或改变与个人身份直接或间接相关的标识符,以降低数据被重新识别的风险。研究的目的在于展示合成数据如何在不泄露患者隐私的情况下,为医疗保健系统规划和资源分配提供有价值的洞察和支持。
研究采用了一种假设性的用例,通过合成数据来模拟真实医疗处方数据集,以便在开发和测试阶段替代真实患者数据。该用例详细阐述了合成数据的生成过程,包括数据准备、分析、合成以及验证等关键阶段。此外,研究还探讨了在合成数据生成过程中应采取的技术和组织措施,以确保数据的质量和安全性。
研究背景
(一)系统功能
案例研究中所提出的合成数据旨在支持一个具有多项功能的医疗保健规划和资源分配系统。以下是该系统所具备的功能:
1. 识别高处方率地区:
系统能够识别出那些对于特定疾病处方率较高的地区,这些地区可能由于现有的医疗基础设施不足而服务不足。
2. 分析特定地区或条件的趋势:
系统允许分析特定地区或疾病的趋势,以便进行资源分配、提高服务交付效率,并帮助政策制定者进行预算分配。
3. 规划紧急服务的分配和准备:
通过合成数据,系统可以帮助规划紧急服务的分配和准备,确保在需要时能够迅速有效地响应。
4. 确定新的医疗设施或服务的需求地点:
系统可以识别出最需要新医疗设施或服务的地区,从而更精确地满足社区的医疗需求。
5. 开发长期公共卫生战略:
合成数据还可以用于开发长期的公共卫生战略,如预防性健康计划,通过监测和分析数据来预防疾病的发生和传播。
其中,合成数据对于上述功能开发具有重要的作用。在部署涉及真实患者数据的全国性系统之前,卫生当局将使用合成数据设计和测试一个小规模的原型系统。这有助于在早期阶段识别任何潜在的问题、数据处理问题或数据解释的不准确性。具体包括如下作用:
1. 处理罕见但合理的情景:
合成数据被用来复制系统必须能够处理的罕见但合理的情景。由于真实世界中可能没有足够的数据来充分测试这些情景,通过在合成数据集中对罕见情况过度采样,使其规模扩大到与合成数据集的大小相匹配,从而实现这一目的。
2. 复制真实世界处方数据的细节:
合成数据能够复制真实世界处方数据的粒度,这对于系统进行更深入、更细致的分析是必要的。与使用聚合数据相比,这种方法可以产生更准确的结果,因为聚合数据可能会忽略对于理解潜在趋势必要的细节。
3. 展示系统功能:
合成数据的使用可以证明系统功能按预期工作,这有助于在规划系统全面实施之前获得利益相关者的信任。
4. 促进快速创新:
通过首先在合成数据上测试其有效性,卫生当局可以开始开发系统,并确定使用真实数据的适当治理机制。这种方法促进了快速创新,因为它允许在真实数据使用之前进行系统开发的测试和调整。
(二)主要参与者
1. 国家卫生部门地区分支机构
国家卫生部门的地区分支机构负责管理和维护各自地理区域内处方药物的数据库。这些分支机构使用自己的数据库生成合成数据,并将其提供给第三方开发团队,以便合成全国数据。这些分支机构拥有内部分析团队,负责执行数据合成任务。他们的职责包括:
软件测试:确保合成数据生成软件经过测试,具备处理不同数据类型和支持各种场景所需的所有功能。
验证:确保用于处理合成数据的系统正确且高效地运行。对于合成数据生成软件,这意味着进行独立的测试,以验证合成数据生成算法是否正确复制了原始处方数据的统计特性。
可识别性测试:确保合成数据中无法识别任何个人。
2. 第三方解决方案提供商
第三方解决方案提供商使用合成数据来设计和测试公共卫生规划系统原型。他们的测试工作包括功能测试,如医疗资源分配和服务交付规划。测试过程涉及性能测试和对合成数据进行的分析测试。具体职责包括:
性能测试:评估用于处理合成数据的系统。例如,确保测试系统软件在计算上高效,并且能够处理不断增加的数据量而不出现显著的性能下降。
(三)数据集特征
各地区分支机构持有的处方数据集包含了在其各自区域内分发的处方药物信息。合并后的数据集包含了大约6000万人的数据,超过7亿行,其中包括以下类型的数据:
处方详情:包括处方的年月、药物名称、剂量、频率和持续时间。
药房位置:处方开具的地理区域。使用独特的字母数字代码来表示每个地理区域。
健康状况:关于药物所开处方的疾病或状况的基本信息,例如II型糖尿病。
基本人口统计信息:关于患者的基本信息——包括年龄范围、性别和患者居住的地理区域。
(四)合成数据生成流程
合成数据生成的流程图展示了从处方数据到生成全国合成数据的整个过程。数据被准备并且区域级数据被合并成一个单一的数据集,然后由国家卫生部门合成。采用集中化的方法进行合成,因为从合并的处方数据集池中合成数据,相较于将单独合成的数据集汇集成国家数据集的联邦化方法,能更好地满足目的的需要。合成完成后,数据被提供给第三方开发团队进行开发和测试。
(五)使用场景
通过对合成数据集的分析,可以发现特定群体中处方率的模式。以下是一些可能的发现示例:
- 特定地区糖尿病药物处方率:如果在某特定地理区域内,50-60岁年龄组的II型糖尿病药物处方率高于平均水平,这可能表明该地区对相关医疗资源的需求较高,从而可能应当增加资源分配。
-高血压药物处方率:在不同地理区域的50-70岁年龄组中,如果高血压药物的处方率较低,这将引发对可能的环境因素的研究,这些因素可能降低了疾病的发病率。
-精神科药物处方率:如果某地区精神科药物的处方率高于平均水平,这可能表明需要在该地区增加心理健康设施的供给。
-特定药物的国家趋势:为了流行病学监测的目的,可以监测特定药物的全国趋势。例如,监测全国范围内流感的水平。
合成数据的使用允许在不泄露真实患者数据的情况下开发和测试能够产生这些洞察的系统,从而有助于保护患者的隐私。这种方法减少了对真实个人数据的依赖,同时为医疗保健系统提供了必要的数据支持,使其能够更有效地满足当地需求。
面临的挑战
1、隐私与效用之间的平衡:
需要减少对真实患者个人数据的访问需求,同时保持数据的统计效用。这涉及到在保护患者隐私和确保合成数据对于分析和决策制定仍具有实用性之间找到恰当的平衡点。
2、个人数据的识别风险:真实患者身份的识别可能会对他们产生重大影响,并且可能影响他们对卫生当局处理其数据的信任。因此,合成数据的生成和使用必须确保个人隐私得到充分保护,以维护公众对卫生机构的信任。
3、专业知识的需求:合成数据项目的成功实施需要在多个领域具备高水平的专业知识,包括:
-健康知识:对医疗保健领域的深入理解,以确保数据的准确性和相关性。
-统计和数据分析专长:能够处理和分析大量数据,提取有用信息,并确保合成数据的统计特性与原始数据相匹配。
-人工智能和合成数据集生成:掌握先进的机器学习技术和数据合成方法,以生成高质量的合成数据集。
-隐私技术:了解和应用隐私保护技术,如差分隐私等,以确保在数据处理过程中个人隐私不被泄露。
数据处理过程
(一)数据准备阶段
去标识化:从处方数据集中移除所有可能直接或间接识别个人的信息,如姓名、地址、电话号码等。
数据标准化:确保数据集中的各个字段遵循统一的格式和编码标准,以便于后续处理。
数据清洗:识别并纠正数据中的错误、不一致或异常值,以提高数据质量。
(二)数据分析阶段
统计分析:对原始数据进行深入的统计分析,以了解数据的分布、相关性和模式。
特征工程:识别对合成数据生成至关重要的数据特征和属性。
数据模型构建:创建数据模型,以模拟原始数据集的结构和统计特性。
(三)合成数据生成阶段
1. 选择合适的合成技术:
在合成数据生成阶段,首先需要选择一个能够处理数据多样性并生成高质量合成数据的技术。这可能包括变分自编码器(VAEs)、生成对抗网络(GANs)和贝叶斯网络等。
选择的依据包括数据的特性(如数据类型、分布和复杂性)以及合成数据的预期用途。
2. 数据模型/字典的构建:
为了更好地理解数据集的结构和特征,构建一个数据模型或字典是至关重要的。这有助于确定合成数据生成的最佳方法。数据模型包括数据的结构,如表格、列、数据类型(例如数值型、分类型)以及不同实体之间的关系(例如处方和健康状况之间的关系)。
合成数据生成算法必须能够复制原始数据集中的统计特性,如约束条件(例如主键和外键),确保不同数据实体之间的引用完整性;指定数值数据的有效范围(例如,剂量数量)以及分类数据的可能类别(例如,健康状况的类型);额外的元数据,如缺失值的频率和典型数据分布,以评估数据质量和用于治理和管理目的。
3. 模型训练与验证集的划分:
在模型训练之前,将数据集分为训练集和验证集,通常比例为70%用于训练,30%用于验证。训练集用于训练合成数据生成模型,而验证集用于评估模型的性能和准确性。
4. 选择必要的技术组织措施保护隐私
为了确保合成数据的生成满足隐私保护的要求,实施差分隐私(DP)作为一种额外的技术措施。通过在模型输出中添加噪声,确保合成数据的生成是差分隐私的,从而降低从合成数据中识别个体的风险。
如果使用基于神经网络的模型(如GANs),在模型训练期间添加梯度噪声,以防止模型学习复制个体的确切细节。
如果使用其他模型,可能需要在目标函数中添加噪声,以确保模型学习的是一般化的模式,而不是关于个体的具体信息。
如果使用机器学习方法并且训练时间过长,那么模型可能会过度拟合训练数据。过度拟合可能导致模型复制特定的数据点而不是一般模式,这可能会增加泄露可识别信息的风险。验证技术对于确保模型泛化良好且没有过度拟合训练数据至关重要,例如,在训练期间监控模型在验证集上的性能,如果验证集上的性能开始下降(表明模型可能开始过度拟合训练数据),他们就会停止训练。还可以使用距离度量来量化真实数据和合成数据分布之间的差异。特别是如果训练数据集中的异常值或离群值被复制,过度拟合可以被检测到(例如,通过极小距离的比较)。
(四)合成数据验证阶段
1. 效用评估:
验证合成数据是否满足预定目的的效用评估是这一阶段的核心。这包括比较合成数据集与原始数据集,以确保合成数据在统计特性上与原始数据保持一致。进行关键模式和分布的统计比较,例如疾病、处方药物和年龄范围等,以确保合成数据能够反映原始数据的关键特征。
还通过随机三方边际查询来计算真实数据和合成数据之间的平均相对误差(MRE)。MRE是一个量化指标,用于衡量合成数据在捕获多个属性联合分布方面的准确性。举例来说,计算特定年龄、医疗状况和药物的人数,并比较真实数据和合成数据的计数结果。通过MRE的计算,可以对合成数据的实用性进行定量评估,确保合成数据在分析和决策支持中的有效性。
在效用评估过程中,国家卫生部门还需要检查合成数据集的一致性和真实性。这包括确保合成数据中没有复制真实患者的数据,通过手动检查和修正任何不合逻辑的记录(例如,为男性开具的避孕药物),可以进一步提高合成数据的质量和可信度。
此外国家卫生部门使用开源软件包来评估合成数据,并将其与原始数据进行比较。这些软件包提供了多种度量标准,如边际分布和相关性度量,以评估合成数据在保持原始数据集中变量间关系(例如特定健康状况和处方之间的关系)方面的性能。
2. 重新识别风险评估:
国家卫生部门进行重新识别风险的评估,包括使用模拟攻击场景进行的入侵测试,以评估合成数据抵抗潜在重新识别尝试的强度。
这可能包括动机攻击者模拟和异常检测,以评估将合成记录与真实个体关联的可行性。
(1)异常检测:
应用适当的统计方法进行异常检测,确保合成数据集中不包含不真实或代表罕见边缘情况或个体的数据点。通过异常检测,可以识别和排除那些与原始数据过于接近的合成数据点,从而降低重新识别的风险。
(2)外部安全测试:
国家卫生部门可能需要聘请外部安全测试公司进行额外的对抗性攻击和基准测试,例如成员推断攻击、属性推断攻击和模型反演攻击:
成员推断攻击:这些攻击旨在确定特定的数据点是否是训练数据集的一部分。
属性推断攻击:这些攻击尝试根据合成数据和曾有公开信息的特定记录,推断训练数据集中个体的敏感属性。
模型反演攻击:这些攻击试图从模型的参数或输出中重建训练数据。这是为了帮助识别任何潜在的弱点,这些弱点如果模型信息被故意或意外泄露,可能会被利用,因为在泄露事件中,数据可能更容易受到模型反演攻击的威胁。
并且不公开发布合成数据生成器,以降低其被逆向工程破解数据的风险。对生成器的访问严格限制在内部必要的员工。不将整个训练数据提供给第三方解决方案提供商。相反,他们只提供一部分真实处方数据给提供商,以测试攻击的成功程度。
3. 采取必要的组织措施保护隐私:
(1)访问控制:
严格控制对原始数据集的访问,建立基于角色的访问控制系统,确保只有具备相应角色的人员才能访问数据。并且设定严格的访问数据的记录
(2)职责分离:
在数据处理过程中,职责分离原则得到执行,以减少未经授权的数据访问和潜在的重新识别风险。这意味着有权访问原始可识别处方数据的员工与参与数据分析的员工是分开的。
(3)合同协议:
与第三方解决方案提供商和外部安全测试公司签订合同,明确禁止任何尝试重新识别个人的条款。所有参与服务的外部人员也必须接受有关数据处理、信息治理和信息安全的专门培训。
4. 对系统采取持续的监控
一旦系统开发完成,卫生当局将接管全面控制权。使用合成数据测试系统的功能,确保在引入真实数据之前,系统能够按预期工作。
如果随着时间的推移引入了新功能(例如,需要分析的新变量),或者目的范围发生变化,卫生当局可能需要生成新的合成数据来测试这些新功能,并反映真实数据随时间的变化,国家卫生部门将重复数据收集、合成、验证和测试的整个过程,以确保新的合成数据集仍然符合隐私保护和数据效用的要求。
注:本文由作者与AI共同完成。头图为AI生图。
G7 DPAs发布合成数据在医疗行业的使用案例
作者:朱玲凤来源:那一片数据星辰

在当今数据驱动的社会中,医疗保健领域的数据利用对于提高服务质量、优化资源分配以及推动公共卫生战略的制定至关重要。然而,医疗数据的敏感性要求在数据利用与个人隐私保护之间找到平衡。