rinna 发布的日语 Stable Diffusion
TL;DR
rinna 宣布了日语 Stable Diffusion,这是一款经过微调的文本到图像模型,接受日语提示并生成反映日本文化的图像,解决了以英语为中心的原始 Stable Diffusion 的局限性。
背景:Stable Diffusion
Stable Diffusion 由 CompVis、Stability AI 和 LAION 创建,使用 CLIP 文本编码器和潜在扩散模型根据文本生成图像。它主要在 LAION‑5B 的英文子集上进行训练,因此在英文提示下效果最佳,生成的结果符合西方文化规范。该模型可在约 10 GB 显存的 GPU 上进行推理,以适中的计算成本提供高质量的图像。
为什么需要日语专用模型?
原始模型需要将非英文提示翻译成英文,而且常常误解日语特有的词汇、俚语、拟声词和专有名词。例如,日语词汇 “サラリーマン”(上班族)传达的文化形象与通用的英文 “businessman” 不同。日语 Stable Diffusion 的构建目标是:
- 生成具有日本视觉风格的图像。
- 正确理解日语化的英文词汇。
- 识别日语拟声词。
- 处理日语专有名词。
训练数据
- 约 1 亿张配有日语字幕的图像,包括 LAION‑5B 的日语子集。
- 使用 rinna 发布的模型
japanese-cloob-vit-b-16过滤低质量样本,剔除低于质量阈值的项目。
训练流程
由于日语数据集大约只有原始模型英文数据集的 1/20,rinna 采用微调 Stable Diffusion 而非从头训练。该过程遵循受 PITI 方法(arXiv:2205.12952)启发的两阶段流程。
第 1 阶段 – 日语专用文本编码器
- 冻结潜在扩散模型。
- 将英文 CLIP 文本编码器替换为在专为日语设计的 sentence‑piece 分词器上训练的日语编码器。
- 在日语文本上使用 CLIP 分词器会得到不可读的字节级 token(例如
['ãĤ', 'µ', …]),而自定义分词器会产生有意义的 token,如['▁', 'サラリーマン', '▁', '油', '絵']。 - 此阶段结束后,模型能够理解日语提示,但仍生成西式风格的图像(例如,拥有西方面孔的上班族)。
第 2 阶段 – 文本编码器与潜在扩散模型的联合微调
- 文本编码器和潜在扩散模型一起进行训练。
- 这种联合微调使模型能够生成日式风格的图像,例如拥有日本面孔的上班族。
开源发布策略
rinna 坚持开源理念,致力于让 AI 超越英语的局限。公司已发布了 GPT‑1B、BERT‑base 和 CLIP‑ViT‑B‑16 的日语版本,现在又将日语 Stable Diffusion 加入其产品线。所有资源均可公开获取:
- Model card: https://huggingface.co/rinna/japanese-stable-diffusion
- Demo Space: https://huggingface.co/spaces/rinna/japanese-stable-diffusion
- GitHub repository: https://github.com/rinnakk/japanese-stable-diffusion
- Colab notebook: https://colab.research.google.com/github/rinnakk/japanese-stable-diffusion/blob/master/scripts/txt2img.ipynb
局限性与未来工作
日语 Stable Diffusion 的通用性不如原始模型,仍存在准确性不足。rinna 计划继续改进语言专用模型,并正在探索用于日语语音的自监督模型,以扩展多语言 AI 生态系统。
Sources
- OriginalJapanese Stable Diffusion