Mistral AI Shieldstral 1.0 3B 출시

Mistral AI는 정책 적응형 멀티모달 안전 분류기로 설계된 3B 파라미터 오픈 웨이트 모델인 Shieldstral을 선보였습니다. 고정된 유해성 분류 체계를 사용하는 기존의 가드레일 모델과 달리, Shieldstral은 사용자가 추론 시점에 평문 질문으로 안전 정책을 정의할 수 있도록 하여, 텍스트 안전성 측면에서 자기 크기의 최대 7배에 달하는 모델과 대등한 성능을 내고 멀티모달 중재 분야에서 새로운 SOTA를 구축할 수 있게 합니다.

이진 질의응답을 통한 정책 적응형 중재

Shieldstral은 콘텐츠 중재를 이진 질의응답 작업으로 취급합니다. 이 접근 방식은 다양한 애플리케이션이나 대상에 따라 안전 정의가 변경될 때 재학습할 필요를 없애줍니다. 모델에 대한 각 요청은 세 가지 구성 요소로 이루어집니다:

  • <Instruct>: 평가 컨텍스트, 엄격도 수준, 그리고 무엇이 안전하지 않은 콘텐츠를 구성하는지에 대한 선택적 정의를 정의합니다.
  • <Query>: 단일 yes/no 질문 (예: "이 콘텐츠가 신체적 폭력을 조장합니까?").
  • <Document>: 평가 대상 콘텐츠로, 프롬프트, 응답, 프롬프트-응답 쌍 또는 선택적 텍스트가 포함된 이미지일 수 있습니다.

yesno 로짓(logits)만 읽고 소프트맥스 정규화(softmax-normalizing)를 수행함으로써, 모델은 보정된 연속적 안전 점수를 생성합니다. 이 단일 인터페이스는 프롬프트 분류, 응답 중재, 거부 탐지 및 독성 탐지를 하나의 문제로 통합합니다.

주요 기술 역량

Shieldstral은 다양한 모달리티에 걸쳐 효율성과 유연성을 갖도록 설계되었습니다:

  • 멀티모달 지원: 단일 자연어 인터페이스가 텍스트, 이미지 및 결합된 텍스트-이미지 콘텐츠를 처리합니다.
  • 하드웨어 효율성: 3B 모델은 단일 16GB GPU에서 실행할 수 있습니다.
  • 연속적 점수 산출: 이산적인 레이블 대신, 모델은 단일 순전파(forward pass)를 통해 확률을 제공하여 개발자가 신뢰도에 따라 결과의 임계값을 설정하거나 순위를 매길 수 있게 합니다.
  • 오픈 웨이트: 모델은 Apache 2.0 라이선스 하에 공개됩니다.

학습 방법론

Mistral AI는 3B 파라미터 모델의 크기 제한을 극복하기 위해 데이터 품질과 다양성에 집중하여 Shieldstral을 개발했습니다:

이질적 데이터의 통합

공개 안전 데이터셋의 상충하는 분류 체계와 레이블을 처리하기 위해, Mistral AI는 데이터셋별 프로세서를 사용하여 모든 데이터를 일관된 instruction-query-document 형식으로 변환했습니다. 팀은 과적합을 방지하기 위해 지시어와 질의어의 어구를 다양화했으며, 소스에 따라 엄격도를 보정했습니다 (예: 적대적 탈옥에는 엄격하게, 응답 품질 데이터에는 관대하게).

정책 판별

모델이 단순히 고정된 레이블을 암기하는 것을 방지하기 위해, 팀은 LLM을 사용하여 안전한 텍스트의 대조 쌍(contrastive pairs)을 생성했습니다. 이러한 쌍은 재작성 시 하나의 특정 정책은 위반하지만 유사한 "형제" 정책은 위반하지 않도록 설계되어, 모델이 서로 다른 안전 정책 사이의 정밀한 경계를 구분하도록 학습시킵니다.

멀티모달 그라운딩

시각적 안전 데이터의 부족으로 인해, Mistral AI는 고품질의 네거티브 샘플로서 범용 이미지 데이터셋을 중재 데이터셋에 보충했습니다. 또한 이미지-질의 쌍을 필터링하여 환각(hallucination)과 잘못 레이블링된 데이터를 줄이기 위해 비전-언어 리랭커(vision-language reranker)를 사용했습니다.

모델 병합

Shieldstral은 LoRA로 미세 조정하고 SLERP를 통해 체크포인트를 병합하여 생성되었습니다. 최종 모델은 공개 데이터로 보정된 체크포인트, 세밀한 정책 판별에 집중한 체크포인트, 그리고 지시 이행 능력을 유지하기 위한 베이스 인스트럭트(base instruct) 모델을 결합합니다.

개발 인프라

Shieldstral은 맞춤형 모델을 학습, 정렬 및 평가하기 위한 Mistral AI의 플랫폼인 Forge를 사용하여 구축되었습니다. Forge는 인프라, 데이터 및 모델 샤딩(sharding), 로깅을 처리하여 연구 팀이 데이터 큐레이션에 집중할 수 있도록 했습니다.

향후 방향

Mistral AI는 다국어 커버리지, 긴 문서에 대한 견고성, 그리고 더 넓은 범위의 멀티모달 안전성 분야에서 Shieldstral의 기능을 지속적으로 개선할 계획입니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch