美国商务部禁止在人口普查和 BEA 数据中注入噪声
美国商务部禁止注入噪声
美国商务部已发布一项命令,禁止在人口普查局(Census Bureau)和经济分析局(BEA)发布的所有统计产品中进行“噪声注入”(noise infusion)。该命令要求部门优先使用“粗化”(coarsening)作为首选的披露回避方法,仅在万不得已时才允许使用“抑制”(suppression)。明确禁止在所有统计产品中使用噪声注入。
该指令实际上禁止了差分隐私(differential privacy),这是一种通过向数据集添加校准随机噪声来保护个人隐私的数学框架。该命令规定,这不应与现有的宪法、法定或监管保密义务相冲突,这意味着机构仍必须保护私人数据,但不能使用噪声注入来实现这一目标。
噪声注入与差分隐私的作用
噪声注入是披露回避(disclosure avoidance)——即在发布有用统计数据的同时保持原始原始数据秘密——的关键工具。在 U.S. Census 的背景下,这至关重要,因为联邦法律要求人口普查局对个人记录进行保密。
常见的披露回避技术
- Coarsening (Generalization): 降低数据的精度(例如,报告年龄范围而不是具体的出生日期)。
- Suppression: 移除低于某些阈值的数据(例如,如果不满五人,则不发布计数)。
- Noise Addition: 向统计数据中添加随机数以隐藏真实值,这是差分隐私的核心组成部分。
- Swapping: 在不同记录之间随机交换属性。
- Sampling: 从数据集中随机移除记录。
差分隐私在 2020 Census 中被采用,是因为之前的技术(如 swapping)被发现容易受到重构攻击(reconstruction attacks),攻击者可以利用已发布的统计数据重建个人记录。选择差分隐私并非因为其数学上的优雅,而是因为它在减轻这些新发现的隐私风险的同时,保留了最大的效用。
对数据效用与隐私的影响
从披露回避工具箱中移除噪声注入,会在数据效用与隐私之间造成严重的权衡。由于针对统计发布内容的隐私攻击通常涉及求解方程组,完美的准确统计数据会使这些攻击变得轻而易举。
禁止噪声的风险
- 增加脆弱性: 由于缺乏随机性,攻击者可以更容易地重新识别个人,这可能导致针对性的诈骗、欺诈或数据的政治武器化。
- 降低效用: Coarsening 和 suppression 是“钝器”。对于涉及小规模人口或少数群体等复杂数据集,这些方法通常要么破坏数据的效用,要么使数据极易受到攻击。
- 技术倒退: 许多其他统计方法,包括 imputation 和 sampling,在技术上都会引入噪声。禁止“噪声注入”可能会在执行标准统计工作的方式上产生矛盾。
对禁令的看法
关于准确性与隐私之间的平衡,这一决定在统计学家、研究人员和公众中引发了重大辩论。
反对差分隐私的论点
一些批评者认为,差分隐私为 2020 Census 数据引入了不可接受的不准确性。
"数据发布的方式在下游产生了严重问题,因为大多数摄取数据的研究人员和统计学家并未准备好接收带有噪声的数据值... 它本质上是要求每个数据用户根据确切的披露机制来重写他们的整个分析流程。"
其他人建议,向官方政府数据中添加噪声从根本上是不诚实的,或者类似于欺诈性会计,认为公众应该能够访问实际的数字,无论隐私风险如何。
支持隐私保护的论点
隐私倡导者强调,缺乏保护可能会导致“监控国家”或数据针对弱势群体的武器化。
"如果你开始发布并利用数据针对具有各种属性的人,他们就会撒谎或不回答。那么你剩下的就比没有还糟糕:人们试图根据错误的数据采取行动。"
还有人担心,该禁令可能会通过允许政治操作人员更准确地重建房屋级数据以用于选区划分,从而促进“反应性杰利蝾螈”(reactionary gerrymandering)。