rinna 發布的日文 Stable Diffusion
TL;DR
rinna 宣佈了日文 Stable Diffusion,這是一個微調的文字轉圖像模型,接受日文提示並產生反映日本文化的圖像,解決了以英語為中心的原始 Stable Diffusion 的限制。
背景:Stable Diffusion
Stable Diffusion 由 CompVis、Stability AI 與 LAION 開發,使用 CLIP 文字編碼器與潛在擴散模型從文字生成圖像。它主要在 LAION‑5B 的英文子集上進行訓練,因此在英文提示下最為有效,且產生的結果符合西方文化規範。該模型可在約 10 GB VRAM 的 GPU 上執行推論,以適度的計算成本提供高品質的圖像。
為何需要日文專屬模型?
原始模型需要將非英文提示翻譯成英文,且常常誤解日文特有的詞彙、俚語、擬聲詞與專有名詞。例如,日文「サラリーマン」(上班族)傳達的文化形象與一般英文的「businessman」不同。日文 Stable Diffusion 的建構目標為:
- 產生符合日式視覺風格的圖像。
- 正確理解日文化的英文詞彙。
- 辨識日文擬聲詞。
- 處理日文專有名詞。
訓練資料
- 約 1 億張搭配日文說明的影像,包含 LAION‑5B 的日文子集。
- 使用 rinna 發布的模型
japanese-cloob-vit-b-16篩除低品質樣本,剔除低於品質門檻的項目。
訓練流程
由於日文資料集約為原始模型英文資料集的 1/20 左右,rinna 以微調 Stable Diffusion 的方式而非從頭訓練。此流程遵循受 PITI 方法 (arXiv:2205.12952) 啟發的兩個階段。
階段 1 – 日文專屬文字編碼器
- 將潛在擴散模型凍結。
- 將英文 CLIP 文字編碼器替換為使用為日文設計的 sentence‑piece 分詞器訓練的日文編碼器。
- 在日文上使用 CLIP 分詞器會產生不可讀的位元層級 token(例如
['ãĤ', 'µ', …]),而自訂分詞器則會產生有意義的 token,如['▁', 'サラリーマン', '▁', '油', '絵']。 - 此階段結束後,模型能夠理解日文提示,但仍產生西式風格的圖像(例如,臉部為西方特徵的上班族)。
階段 2 – 文字編碼器與潛在擴散模型的聯合微調
- 文字編碼器與潛在擴散模型同步訓練。
- 此聯合微調使模型能產生日式風格的圖像,例如臉部呈日本特徵的上班族。
開源發布策略
rinna 採取開源哲學,致力於讓 AI 超越英語的限制。公司已發布日文版的 GPT‑1B、BERT‑base 與 CLIP‑ViT‑B‑16,現在再將日文 Stable Diffusion 加入其產品線。所有資源皆公開可取得:
- Model card: https://huggingface.co/rinna/japanese-stable-diffusion
- Demo Space: https://huggingface.co/spaces/rinna/japanese-stable-diffusion
- GitHub repository: https://github.com/rinnakk/japanese-stable-diffusion
- Colab notebook: https://colab.research.google.com/github/rinnakk/japanese-stable-diffusion/blob/master/scripts/txt2img.ipynb
限制與未來工作
日文 Stable Diffusion 的多功能性不及原始模型,仍存在精確度不足的問題。rinna 計畫持續改進語言專屬模型,並探索用於日文語音的自監督模型,以擴展多語言 AI 生態系統。
Sources
- OriginalJapanese Stable Diffusion