数据隐私是有代价的。有一些安全技术可以保护敏感的用户数据免受攻击者的攻击,如客户地址,因为攻击者可能会试图从人工智能模型中提取这些数据。但这样的保护技术通常会使这些模型不那么准确。
麻省理工学院的研究人员最近开发了一个基于名为PAC privacy的新隐私指标框架,该框架可以保持人工智能模型的性能,同时确保医疗图像或财务记录等敏感数据免受攻击者的攻击。现在,他们将这项工作向前推进了一步,使他们的技术在计算上更高效,改善了准确性和隐私之间的权衡,并创建了一个正式的模板,该模板可用于私有化几乎任何算法,而无需访问该算法的内部工作原理。
该团队利用他们新版本的PAC Privacy将用于数据分析和机器学习任务的几种经典算法私有化。
他们还证明,越“稳定”的算法越容易用他们的方法私有化。即使训练数据略有修改,稳定算法的预测也保持一致。更高的稳定性有助于算法对以前看不见的数据做出更准确的预测。
研究人员表示,新的PAC隐私框架效率提高,以及实施该框架可以遵循的四步模板,将使该技术更容易在现实世界中部署。
麻省理工学院研究生、该隐私框架论文的主要作者Mayuri Sridhar说:“我们倾向于认为鲁棒性(稳健性)和隐私性与构建高性能算法无关,甚至可能存在冲突。首先,我们制作一个工作算法,然后我们使其健壮,然后是私有的。我们已经证明,这并不总是正确的框架。如果你让你的算法在各种环境中表现更好,你基本上可以免费获得隐私。”
Sridhar将于秋季开始在普渡大学担任助理教授;另一位资深作者Srini Devadas是麻省理工学院电气工程教授。该研究将在IEEE安全与隐私研讨会上发表。该研究将在IEEE安全与隐私研讨会上发表。
估算噪声
为了保护用于训练AI模型的敏感数据,工程师经常在模型中添加噪声或通用随机性,这样对手就更难猜测原始训练数据。这种噪声会降低模型的准确性,因此可以添加的噪声越少越好。
PAC Privacy会自动估计需要添加到算法中的最小噪声量,以实现所需的隐私级别。
最初的PAC隐私算法在数据集的不同样本上多次运行用户的AI模型。它测量这些输出之间的方差和相关性,并使用这些信息来估计需要添加多少噪声来保护数据。
PAC Privacy的这种新变体以相同的方式工作,但不需要表示输出之间的整个数据相关性矩阵;它只需要输出方差。
Sridhar解释说:“因为你正在估计的东西比整个协方差矩阵小得多,所以你可以做得更快。”这意味着可以扩展到更大的数据集。
添加噪声会损害结果的效用,因此将效用损失降至最低非常重要。由于计算成本,原始的PAC隐私算法仅限于添加各向同性噪声,这些噪声在所有方向上都是均匀添加的。由于新变体估计了各向异性噪声,而各向异性噪声是根据训练数据的特定特征量身定制的,因此用户可以添加更少的总体噪声来实现相同的隐私水平,从而提高私有化算法的准确性。
隐私和稳定性
当研究PAC隐私时,Sridhar假设更稳定的算法更容易通过这种技术私有化。她使用了更有效的PAC Privacy变体,在几个经典算法上测试了这一理论。
当训练数据略有变化时,更稳定的算法的输出方差较小。PAC Privacy将数据集分解为块,对每个数据块运行算法,并测量输出之间的差异。方差越大,必须添加越多的噪声来私有化算法。
她解释说,采用稳定性技术来减少算法输出的方差也会减少私有化所需添加的噪声量。
她说:“在最好的情况下,我们可以实现这些双赢的局面。”
该团队表明,尽管他们测试了算法,但这些隐私保证仍然很强,并且PAC privacy的新变体需要更少的试验来估计噪声。他们还在攻击模拟中测试了该方法,证明其隐私保证可以抵御最先进的攻击。
Devadas说:“我们想探索如何与PAC Privacy共同设计算法,这样算法从一开始就更加稳定、安全和健壮。”研究人员还希望用更复杂的算法测试他们的方法,并进一步探索隐私效用权衡。
Sridhar说:“现在的问题是:这些双赢局面何时发生,我们如何才能让它们更频繁地发生?”
威斯康星大学麦迪逊分校计算机科学系助理教授Xiayao Yu没有参与这项研究,他评论说:“我认为PAC隐私在这种情况下比其他隐私定义的关键优势在于,它是一个黑匣子——你不需要手动分析每一个单独的查询来私有化结果。它可以完全自动完成。我们正在积极构建一个支持PAC的数据库,通过扩展现有的SQL引擎来支持实用、自动化和高效的私人数据分析。”
这项研究部分得到了思科系统公司、Capital One、美国国防部和MathWorks奖学金的支持。
热门跟贴