Mistral Shieldstral 1.0 3B 출시
Shieldstral 1.0 3B: 정책 적응형 멀티모달 안전 분류기
Mistral AI가 멀티모달 콘텐츠 중재를 위해 설계된 30억 파라미터 규모의 오픈 웨이트 모델인 Shieldstral 1.0 3B를 출시했습니다. 가중치에 고정된 유해 카테고리 분류 체계를 사용하는 기존 가드레일 모델과 달리, Shieldstral은 중재를 이진 질의응답(binary question-answering) 작업으로 처리하여 개발자가 재학습 없이 추론 시점에 평문 질문을 사용하여 안전 정책을 정의할 수 있도록 합니다.
이진 질의응답 작업으로서의 중재
Shieldstral은 콘텐츠 중재를 이진 질의응답 작업으로 프레임화하여 작동합니다. 이 접근 방식은 "안전한" 콘텐츠의 정의가 달라질 수 있는 다양한 배포 환경에서 모델이 매우 유연하고 적응력을 갖출 수 있게 합니다.
모델에 대한 각 요청은 세 가지 구성 요소로 이루어집니다:
<Instruct>: 평가 컨텍스트, 원하는 엄격함, 그리고 무엇이 안전하지 않은 콘텐츠를 구성하는지에 대한 선택적 정의.<Query>: 단일 yes/no 질문 (예: "이 콘텐츠가 신체적 폭력을 조장합니까?").<Document>: 판단 대상이 되는 콘텐츠로, 프롬프트, 응답, 프롬프트-응답 쌍 또는 선택적 텍스트가 포함된 이미지일 수 있습니다.
추론 시 모델은 yes와 no 로짓(logits)을 분석하고 이를 소프트맥스 정규화(softmax-normalize)하여 연속적인 안전 점수를 생성합니다. 이 공식은 프롬프트 분류, 응답 중재, 거부 탐지 및 독성 탐지를 단일 인터페이스로 통합합니다.
주요 기술적 하이라이트
Shieldstral은 크기 대비 효율적이고 높은 성능을 내도록 설계되었으며, 크기가 최대 7배 큰 오픈 가드 모델의 성능과 대등하거나 이를 능가합니다.
성능 및 효율성
- 리소스 요구 사항: 3B 모델은 단일 16GB GPU에서 실행될 수 있을 만큼 작습니다.
- 보정된 안전 점수: 이산적인 레이블 대신 모델은 확률을 반환하여 사용자가 자체 임계값을 설정하거나 신뢰도에 따라 결과를 정렬할 수 있습니다.
- 멀티모달 능력: 단일 인터페이스가 텍스트, 이미지 및 결합된 텍스트-이미지 콘텐츠를 처리합니다.
학습 방법론
적은 파라미터 수로 높은 성능을 달성하기 위해 Mistral은 데이터의 품질과 다양성에 집중했습니다:
- 이질적 데이터의 통합: Mistral은 다양한 분류 체계를 가진 다양한 공개 안전 데이터셋을 표준화된 instruction-query-document 형식으로 변환했습니다. 특정 문구에 모델이 과적합되는 것을 방지하기 위해 지시어와 쿼리의 어구를 다양화했습니다.
- 판별 능력 교육: 모델이 단순히 레이블을 암기하는 것을 방지하기 위해, Mistral은 대조 쌍(contrastive pairs)을 사용했습니다. 이는 특정 정책은 위반하지만 유사한 다른 정책은 위반하지 않도록 설계된 안전한 텍스트의 재작성본입니다. 이를 통해 모델은 주어진 정책의 정확한 경계에 대해 추론하는 법을 배웁니다.
- 시각적 안전 접지(Visual Safety Grounding): 안전하지 않은 이미지는 텍스트보다 합성하기 어렵기 때문에, Mistral은 제한된 중재 데이터셋을 일반 목적의 이미지 데이터셋(고품질 네거티브 데이터로 사용)으로 보완하고, 환각(hallucination) 및 잘못 레이블링된 데이터를 줄이기 위해 비전-언어 리랭커(vision-language reranker)를 사용했습니다.
- 모델 병합: 최종 모델은 공개 데이터로 보정된 체크포인트, 정책 판별에 집중한 체크포인트, 그리고 기본 instruct 모델을 SLERP(Spherical Linear Interpolation)를 사용하여 병합하여 생성되었습니다.
커뮤니티 통찰 및 반론
기술적 접근 방식은 효율성과 유연성 측면에서 찬사를 받고 있지만, 커뮤니티 논의에서는 이러한 모델의 배포와 관련된 몇 가지 실질적인 우려 사항이 강조되고 있습니다.
유연성 vs 신뢰성
일부 사용자들은 모델이 정말로 임의의 규칙 세트를 처리할 수 있는지, 아니면 학습된 데이터셋의 "기성 도덕(prefab morals)"에 국한되는지에 대해 회의적인 시각을 보였습니다. 한 사용자는 다음과 같이 언급했습니다:
"이 모델이 임의의 규칙 세트로 중재를 수행할 수 있는지 궁금합니다... 단순히 '우리는 섹스를 싫어한다'/'우리는 섹스를 싫어하지 않는다' '우리는 폭력을 싫어한다'/'우리는 폭력을 싫어하지 않는다' 식인가요, 아니면 정말 주장하는 만큼 유연한가요?"
설명 가능성 부족
모델이 추론 과정에 대한 설명 대신 이진 확률을 반환하기 때문에, 일부 개발자들은 사용자가 왜 자신의 콘텐츠가 플래그 지정되었는지 알기를 원하는 운영 환경에서 모델의 유용성이 제한된다고 주장합니다.
"추론 과정을 전혀 설명하지 않는다는 점이... 이 모델의 유용성에 의문을 갖게 합니다. 예를 들어 운영 환경에 배포했는데 사용자가 '왜 이 프롬프트가 유해하다고 간주됩니까?'라고 묻는다면, 사용자에게 구체적인 이유를 제공할 방법이 없습니다."
미묘한 텍스트에서의 오탐(False Positives)
커뮤니티 구성원들의 초기 테스트에 따르면 모델이 미묘하거나 역사적인 텍스트를 처리하는 데 어려움을 겪을 수 있음을 시사합니다. 한 사용자는 모델이 볼테르의 관용론(Treatise on Tolerance) 첫 장을 보호받는 집단에 대한 폭력을 조장하는 것으로 플래그 지정했다고 보고했습니다.
가용성
Shieldstral 1.0 3B는 Apache 2.0 라이선스로 출시되었으며 Hugging Face에서 다운로드할 수 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch