미국 상무부, 인구조사 및 BEA 데이터에서 노이즈 인퓨전 금지
노이즈 인퓨전 금지
미국 상무부는 인구조사국과 경제분석국(BEA)이 발표하는 모든 통계 제품에서 '노이즈 인퓨전'을 금지하는 명령을 내렸습니다. 이 명령은 부서가 정확성과 객관성을 우선시하도록 명령하며, 노이즈 인퓨전의任何 사용이 부서 정책과 일치하지 않음을 명시합니다.
새로운 지침에 따라, 미국 상무부는 공개 회피 방법에 대한 엄격한 우선순위를 정했습니다:
- 세분화 감소: 이는 모든 통계 제품에 대한 선호 방법입니다.
- 삭제: 법에 의해 세분화 감소가 금지되거나 제품의 사용성을 크게 떨어뜨리는 경우에만 마지막 수단으로 허용됩니다.
- 노이즈 인퓨전: 모든 통계 제품에 대해 엄격히 금지됩니다.
차분 프라이버시와 노이즈의 역할
노이즈 인퓨전은 차분 프라이버시의 핵심 구성 요소로, 과학자들에 의해 대규모 데이터셋에서 개인의 프라이버시를 보호하는 금 표준으로 널리 간주됩니다. 차분 프라이버시는 일반적으로 기여도 경계 설정(어떤 singolo 개인이 통계에 미치는 영향을 제한)과 신중하게 조정된 노이즈 추가를 결합하여, 개별 기록이 publiés된 통계로부터 재구성되지 않도록 보장합니다.
역사적으로, 미국 인구조사국은 1990년부터 2010년까지 '스와핑'(레코드 간 속성 교체)을 사용했습니다. 그러나 연구자들은 스와핑이 안전하지 않으며 개별 기록 재구성을 허용한다는 사실을 발견했습니다. 이로 인해 국은 2020 인구조사에서 차분 프라이버시를 채택하여 이러한 재구성 공격을 방지하면서 가능한 최고 수준의 유용성을 유지하게 되었습니다.
데이터 유용성과 프라이버시에 미치는 영향
공개 회피 툴박스에서 노이즈 인퓨전을 제거하면 데이터 유용성과 프라이버시 사이의 중요한 trade-off가 발생합니다. 통계 공개에 대한 프라이버시 공격은 종종 방정식 시스템을 푸는 것을 포함하기 때문에, 완벽히 정확한 통계는 이러한 공격을 사소하게 만듭니다. 노이즈는 공격자가 확률과 불확실성을 다루도록 강제하여 재식별을 훨씬 어렵게 만듭니다.
세분화 감소와 삭제의 위험
세분화 감소(속성을 덜 정밀하게 만드는 것)와 삭제(특정 임계값 이하의 데이터 제거)는 '둔한 도구'로 간주됩니다. 소규모 인구 또는 소수 집단을 포함하는 복잡한 데이터 제품에 대해 이러한 방법은 종종 다음과 같이 작용합니다:
- 유용성 파괴: 데이터가 인구통계학자와 사회 과학자에게 유용할 정도로 너무 모호해집니다.
- 취약성 증가: 충분히 세분화 감소가 이루어지지 않으면 데이터가 프라이버시 공격에 취약한 상태로 남습니다.
금지에 대한 관점
이 결정은 기술 전문가, 정책 입안자, 일반 대중 사이에서 상당한 논쟁을 촉발했으며, 정확한 데이터에 대한 필요성과 프라이버시 권리 사이의 근본적인 긴장을 반영합니다.
금지에 대한 반대 의견 (프라이버시 및 보안 우려)
비평가들은 금지가 데이터의 무기화를 촉진한다고 주장합니다. 재식별을 쉽게 만들면 데이터가 선거구 조작이나 표적 감시에 사용될 수 있습니다.
"데이터를 출판하고 다양한 속성을 가진 사람들에게 무기로 사용하기 시작하면, 그들은 그저 거짓말을 하거나 답변하지 않을 것입니다. 그러면 당신은 아무것도 아닌 것보다 더 나쁜 상황에 처하게 됩니다: 나쁜 데이터를 바탕으로 행동하려는 사람들만 남게 됩니다.
다른 사람들은 인구조사 데이터가 억압적인 정권에 의해 특정 종교 또는 민족 집단을 표적으로 삼는 데 사용된 역사적 precedents를 지적하며, 차분 프라이버시가 그러한 남용에 대한必要한 방화벽이라고 주장합니다.
금지에 대한 찬성 의견 (정확성 및 투명성 우려)
일부 인구조사 데이터 사용자들은 2020 인구조사의 차분 프라이버시 구현이 문제가 있다고 느꼈습니다. 비평가들은 도입된 노이즈가 고급 통계 도구를 갖추지 못한 연구자들이 노이즈가 있는 데이터셋을 분석하기 어렵게 만들었다고 주장합니다.
"데이터가 공개된 방식 때문에 하류에서 심각한 문제가 발생했으며, 대부분의 연구자와 통계학자는 노이즈가 있는 데이터 값을 받을 준비가 되어 있지 않았습니다.
일부는 정부가 전혀 데이터를 '합성'해서는 안 된다고 주장하며, 데이터가 공개하기에 너무 위험하다면 처음부터 수집해서는 안 된다고 제안합니다.
공개 회피 기술 요약
| 기술 | 설명 | 새 명령 하의 상태 |
|---|---|---|
| 세분화 감소 | 정밀도 감소(예: 카운티 $ | |
| ightarrow$ 주) | 선호됨 | |
| 삭제 | 임계값 이하의 데이터 제거 | 최후의 수단 |
| 노이즈 인퓨전 | 참 값을 숨기기 위한 무작위 값 추가 | 금지됨 |
| 스와핑 | 레코드 간 속성 교체 | 금지됨 (무작위성을 포함하기 때문에) |
| 샘플링 | 레코드 무작위 제거 | 금지됨 (무작위성을 포함하기 때문에) |