머신러닝 전문가: Margaret Mitchell과의 인터뷰
Dr. Margaret Mitchell은 윤리적 AI의 선구자이자 전 Google Ethical AI Group의 공동 리더로서, 머신러닝에서 가장 시급한 문제는 시스템을 설계하는 사람들의 다양성과 포용성을 보장하는 것이라고 강조합니다. Mitchell에 따르면, 이러한 인적 요소는 기술적 결과, 편향 완화, 그리고 AI 배포의 전반적인 안전성에 직접적인 영향을 미칩니다.
윤리적 AI와 편향 완화의 필연성
윤리적 AI는 훈련 데이터가 세상의 일부만을 나타내기 때문에 필요합니다. 이는 모델이 해로운 편향을 내면화하고 전파하게 만들 수 있습니다. Mitchell 박사는 안면 인식, 보행자 인식, 자연어 처리(NLP) 도구와 같이 개인의 정체성과 프라이버시에 영향을 미치는 인간 중심 기술을 데이터 윤리가 가장 중요한 분야로 꼽습니다.
해로운 편향의 인식
편향은 다양한 어휘나 관점을 결여한 팀에게는 보이지 않는 방식으로 나타나는 경우가 많습니다. Mitchell 박사는 모델 실패의 두 가지 주요 사례를 강조합니다:
- Descriptive Bias: 보조 기술에서 모델이 백인을 "people"로 설명하는 반면 흑인을 "Black people"로 설명하여, 백인성을 기본값으로 취급할 수 있습니다.
- Contextual Misinterpretation: 일몰과 불꽃놀이 이미지를 학습한 모델은 하늘의 밝은 색상을 긍정적인 속성으로 연관시키기 때문에 파괴적인 폭발 장면을 "beautiful"라고 설명할 수 있습니다. 이는 벤치마크 성능과 실제 세계의 안전성 사이의 위험한 격차를 보여줍니다.
Model Cards와 기술적 투명성
Model Cards는 하드웨어에 사양이 있는 것처럼 머신러닝 모델에 대한 문서를 제공하기 위해 설계된 표준화된 산출물입니다. Timnit Gebru와 공동 개발한 Model Cards는 윤리를 추상적인 개념에서 필수적인 출시 산출물로 이동시켜, 엔지니어가 모델의 동작과 한계를 문서화하도록 유도하는 것을 목표로 합니다.
결정 임계값의 역할
결정 임계값에 관한 투명성은 모델 안전성에 필수적입니다. 분류 시스템에서 모델이 "yes" 또는 "no"를 결정하는 임계값(예: 0.7)은 오류율에 상당한 영향을 미칠 수 있습니다. Mitchell 박사는 일부 기관이 이러한 임계값을 이해하거나 조정하지 않고 기본 파라미터 설정을 사용하여 안면 인식 기술을 사용함으로써, 흑인 여성과 같은 특정 인구 통계 그룹에 대해 불균형적으로 높은 실패율을 초래했다고 언급합니다.
모델 문서화의 미래 방향
At Hugging Face에서, Mitchell 박사는 Model Cards를 정적인 보고서에서 대화형 도구로 진화시키기 위해 노력하고 있습니다. 이를 통해 사용자는 결정 임계값을 실시간으로 변경하여 거짓 음성(false-negative) 비율이 어떻게 변하는지 확인할 수 있으며, 모델이 어떻게 배포될지에 대한 더 정보에 입각한 결정을 내릴 수 있습니다.
다양성을 기술적 최적화로 보기
다양성과 포용성은 단순한 사회적 목표가 아니라 모델의 결과를 개선하는 기술적 필요성입니다. Mitchell 박사는 다양성을 프로젝트의 "search space"를 확장하는 방법으로 정의합니다.
"Just how you want to have a Gaussian approach over different start states, so too do you want that at the table when you’re starting projects because it gives you this larger search space making it easier to attain a local optimum."
더 넓은 범위의 인종, 민족, 성별, 능력을 포함함으로써, ML 팀은 "beating the last numbers"에만 집중하는 "macho" 문화에서 벗어나, 대신 AI 내의 엄격한 평가와 고정관념 및 성차별을 식별하는 데 집중할 수 있습니다.
Hugging Face에서의 현재 연구 및 이니셔티브
Dr. Mitchell의 현재 연구는 여러 학제간 분야를ครอบ습니다:
- Interdisciplinary Research: AI, 법, 철학 사이의 간극을 결합하며, 세계 인권 선언(UDHR)을 AI에 적용하는 것을 포함합니다.
- Data Governance: 대규모 데이터가 전 세계로 확산되지 않고 검토될 수 있는 프레임워크를 개발하기 위한 Big Science 프로젝트에 참여합니다.
- Accessibility Tools: 비프로그래머가 SQL이나 코드를 작성할 필요 없이 데이터를 직접 쿼리할 수 있도록 AI에 대한 진입 장벽을 낮추는 방법을 개발합니다.
- Statistical Testing: 언어 모델의 출력이 자연어를 특징짓는 Zipfian 분포를 따르는지 테스트하는 도구를 만듭니다.
AI 실무자를 위한 조언
Mitchell 박사는 개인의 분야 내 위치에 따라 다른 접근 방식을 제안합니다:
- 소외된 개인들을 위해: 자신의 관점에 대한 자신감을 유지하고, 관리자가 다른 방식의 사고방식에 기반하여 당신의 기여를 들이받지 않게 하세요.
- 다수 그룹에 속한 이들을 위해: 내부에서 "pipeline problem"을 해결하기 위해 주변 사람들을 지원하고 끌어올려 주는 데 집중하세요.
- 일반적인 기술적 조언: 항상 시스템의 엄격한 평가를 우선시하세요.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch