Qwen3Guard 릴리스: LLM을 위한 실시간 안전 가드레일
Qwen은 Qwen3Guard를 출시했습니다. 이는 Qwen 생태계 내 최초의 안전 가드레일 모델군이며, Qwen3 기반 모델을 기반으로 안전 분류를 위해 파인튜닝되었습니다. Qwen3Guard는 사용자 프롬프트와 모델 응답 모두에서 위험을 정밀하게 감지하고, 위험 수준과 분류를 지정하여 정확한 콘텐츠 검증을 지원합니다.
실시간 스트리밍 안전 감지
Qwen3Guard-Stream은 토큰 생성 과정 중 저지연, 실시간 검증을 가능하게 합니다. 기존 가드 모델이 텍스트가 완전히 생성된 뒤에 평가하는 것과 달리, Qwen3Guard-Stream은 트랜스포머 최종 레이어에 부착된 두 개의 경량 분류 헤드를 활용합니다. 이 구조 덕분에 모델은 응답을 토큰 단위로 생성하면서 즉시 안전 분류를 출력하여, 반응성을 희생하지 않고 안전성을 보장합니다.
모델 변형 및 배포 옵션
Qwen3Guard는 두 가지 특화 변형으로 제공되며, 각각 0.6B, 4B, 8B 파라미터 규모로 다양한 자원 제약에 맞출 수 있습니다:
Qwen3Guard-Gen: 전체 사용자 프롬프트와 모델 응답을 입력으로 받는 생성 모델입니다. 오프라인 안전 주석, 데이터셋 필터링, 강화 학습(RL)용 안전 기반 보상 제공에 최적화되었습니다.Qwen3Guard-Stream: 응답 생성 중 실시간 스트리밍 안전 감지를 위한 특화 모델입니다.
3단계 심각도 분류
이진 "안전" 또는 "위험" 라벨보다 유연성을 제공하기 위해 Qwen3Guard는 논란 라벨을 도입했습니다. 이 3단계 시스템을 통해 개발자는 사용 사례에 맞춰 동적 안전 정책을 구현할 수 있습니다:
- 엄격 모드: 논란 사례를 위험으로 재분류할 수 있습니다.
- 완화 모드: 논란 사례를 안전으로 재분류할 수 있습니다.
이 설계는 이진 라벨링 제약으로 인해 충돌하기 쉬운 다양한 데이터셋 표준에서도 Qwen3Guard가 견고한 성능을 유지하도록 합니다.
다국어 지원 및 글로벌 적용
Qwen3Guard는 119개 언어 및 방언을 지원하여 다양한 언어 환경에서도 일관된 안전 성능을 제공합니다. 지원되는 언어군은 다음과 같습니다:
- 인도-유럽어족: 영어, 스페인어, 프랑스어, 독일어, 러시아어, 힌디어, 벵골어 등.
- 중-티베트어족: 간체 중국어, 번체 중국어, 광동어, 버마어 등.
- 아프리카-아시아어족: 다양한 아랍어 방언, 히브리어 등.
- 오스트로네시아어족: 인도네시아어, 말레이어, 타갈로그어 등.
- 드라비다어족: 타밀어, 텔루구어, 칸나다어, 말라얄람어 등.
- 투르크어족: 터키어, 카자흐어, 우즈베크어 등.
- 태카다이어족: 태국어, 라오어.
- 우랄어족: 핀란드어, 에스토니아어, 헝가리어.
- 오스트로아시아어족: 베트남어, 크메르어.
- 기타: 일본어, 한국어, 조지아어, 스와힐리어.
기술 구현 및 적용
Qwen3Guard-Gen 워크플로우
Qwen3Guard-Gen은 안전 분류에 최적화된 채팅 템플릿을 사용합니다. 안전 라벨(안전, 위험, 논란)과 구체적인 위험 카테고리(예: 폭력, 개인식별정보(PII), 성적 콘텐츠, 저작권 위반)를 식별하는 구조화된 출력을 생성합니다. 응답 검증 시 모델이 거부했는지도 함께 표시합니다.
Qwen3Guard-Stream 워크플로우
Qwen3Guard-Stream은 두 단계 프로세스로 동작합니다:
- 프롬프트 수준 검사: 사용자의 입력을 즉시 평가합니다. 프롬프트가 위험하다고 판단되면 LLM이 응답을 생성하기 전에 대화를 중단할 수 있습니다.
- 토큰 수준 중재: 대화가 진행되면 LLM이 생성하는 각 토큰이 실시간으로
Qwen3Guard-Stream에 전달되어, 생성 과정 전반에 걸쳐 동적 위험 완화를 수행합니다.
고급 사용 사례
직접 검증 외에도 Qwen3Guard는 다음과 같이 활용됩니다:
- 안전 강화 학습(RL):
Qwen3Guard-Gen을 사용해 모델의 안전성을 높이면서도 유용성을 유지합니다. - 실시간 개입:
Qwen3Guard-Stream을 통해 기본 모델을 재학습하지 않고도 안전한 출력을 보장합니다.