rinna의 일본어 Stable Diffusion 출시
TL;DR
rinna는 일본어 프롬프트를 받아 일본 문화가 반영된 이미지를 생성하는 파인‑튜닝된 텍스트‑투‑이미지 모델인 일본어 Stable Diffusion을 발표했습니다. 이는 영어 중심의 원본 Stable Diffusion이 가진 한계를 보완합니다.
배경: Stable Diffusion
Stable Diffusion은 CompVis, Stability AI, LAION이 공동으로 만든 모델로, CLIP 텍스트 인코더와 잠재 확산 모델을 사용해 텍스트로부터 이미지를 생성합니다. 주로 LAION‑5B의 영어 서브셋으로 학습되어 영어 프롬프트와 서구 문화에 맞는 결과를 가장 잘 도출합니다. 이 모델은 약 10 GB VRAM GPU에서 추론이 가능해, 적당한 계산 비용으로 높은 품질을 제공합니다.
왜 일본어 전용 모델이 필요한가?
원본 모델은 비영어 프롬프트를 번역해야 하며, 일본어 고유 용어, 은어, 의성어, 고유명사를 종종 오해합니다. 예를 들어 일본어 "サラリーマン"(샐러리맨)은 일반 영어 "businessman"과는 다른 문화적 이미지를 전달합니다. 일본어 Stable Diffusion은 다음을 목표로 구축되었습니다:
- 일본식 시각 스타일의 이미지 생성
- 일본어에 맞게 변형된 영어 단어를 올바르게 이해
- 일본어 의성어 인식
- 일본어 고유명사 처리
학습 데이터
- 일본어 캡션과 짝을 이룬 약 1억 장의 이미지, 여기에는 LAION‑5B의 일본어 서브셋이 포함됩니다.
- 저품질 샘플은 rinna가 공개한 모델
japanese-cloob-vit-b-16을 사용해 품질 임계값 이하인 항목을 필터링했습니다.
학습 절차
일본어 데이터셋이 원본 모델에 사용된 영어 데이터셋의 약 1/20 규모이므로, rinna는 처음부터 학습하는 대신 Stable Diffusion을 파인‑튜닝했습니다. 이 과정은 PITI 접근법(arXiv:2205.12952)을 참고한 두 단계로 진행되었습니다.
Stage 1 – 일본어 전용 텍스트 인코더
- 잠재 확산 모델은 고정되었습니다.
- 영어 CLIP 텍스트 인코더를 일본어 전용 인코더로 교체했으며, 이는 일본어에 맞춘 sentence‑piece 토크나이저로 학습되었습니다.
- 일본어 텍스트에 CLIP 토크나이저를 적용하면 의미 없는 바이트‑레벨 토큰(
['ãĤ', 'µ', …])이 생성되는 반면, 맞춤 토크나이저는['▁', 'サラリーマン', '▁', '油', '絵']와 같은 의미 있는 토큰을 제공합니다. - 이 단계가 끝난 후 모델은 일본어 프롬프트를 해석할 수 있게 되었지만, 여전히 서구식 이미지(예: 서양 얼굴을 가진 샐러리맨)를 생성했습니다.
Stage 2 – 텍스트 인코더와 잠재 확산 모델의 공동 파인‑튜닝
- 텍스트 인코더와 잠재 확산 모델을 동시에 학습했습니다.
- 이 공동 파인‑튜닝을 통해 모델은 일본식 이미지, 예를 들어 일본 얼굴을 가진 샐러리맨 등을 생성할 수 있게 되었습니다.
오픈 릴리스 전략
rinna는 영어를 넘어 AI를 민주화하기 위해 오픈‑소스 철학을 따릅니다. 이미 GPT‑1B, BERT‑base, CLIP‑ViT‑B‑16의 일본어 버전을 공개했으며, 이번에 일본어 Stable Diffusion을 포트폴리오에 추가했습니다. 모든 자산은 공개되어 있습니다:
- Model card: https://huggingface.co/rinna/japanese-stable-diffusion
- Demo Space: https://huggingface.co/spaces/rinna/japanese-stable-diffusion
- GitHub repository: https://github.com/rinnakk/japanese-stable-diffusion
- Colab notebook: https://colab.research.google.com/github/rinnakk/japanese-stable-diffusion/blob/master/scripts/txt2img.ipynb
제한 사항 및 향후 과제
일본어 Stable Diffusion은 원본 모델보다 범용성이 낮으며 여전히 정확도 격차가 존재합니다. rinna는 언어별 모델 개선을 지속할 계획이며, 일본어 음성을 위한 자체 지도 학습 모델도 탐색 중입니다. 이를 통해 다국어 AI 생태계를 확장하고자 합니다.
Sources
- OriginalJapanese Stable Diffusion