rinna 发布的日语 Stable Diffusion

TL;DR

rinna 宣布了日语 Stable Diffusion,这是一款经过微调的文本到图像模型,接受日语提示并生成反映日本文化的图像,解决了以英语为中心的原始 Stable Diffusion 的局限性。

背景:Stable Diffusion

Stable Diffusion 由 CompVis、Stability AI 和 LAION 创建,使用 CLIP 文本编码器和潜在扩散模型根据文本生成图像。它主要在 LAION‑5B 的英文子集上进行训练,因此在英文提示下效果最佳,生成的结果符合西方文化规范。该模型可在约 10 GB 显存的 GPU 上进行推理,以适中的计算成本提供高质量的图像。

为什么需要日语专用模型?

原始模型需要将非英文提示翻译成英文,而且常常误解日语特有的词汇、俚语、拟声词和专有名词。例如,日语词汇 “サラリーマン”(上班族)传达的文化形象与通用的英文 “businessman” 不同。日语 Stable Diffusion 的构建目标是:

  • 生成具有日本视觉风格的图像。
  • 正确理解日语化的英文词汇。
  • 识别日语拟声词。
  • 处理日语专有名词。

训练数据

  • 约 1 亿张配有日语字幕的图像,包括 LAION‑5B 的日语子集。
  • 使用 rinna 发布的模型 japanese-cloob-vit-b-16 过滤低质量样本,剔除低于质量阈值的项目。

训练流程

由于日语数据集大约只有原始模型英文数据集的 1/20,rinna 采用微调 Stable Diffusion 而非从头训练。该过程遵循受 PITI 方法(arXiv:2205.12952)启发的两阶段流程。

第 1 阶段 – 日语专用文本编码器

  • 冻结潜在扩散模型。
  • 将英文 CLIP 文本编码器替换为在专为日语设计的 sentence‑piece 分词器上训练的日语编码器。
  • 在日语文本上使用 CLIP 分词器会得到不可读的字节级 token(例如 ['ãĤ', 'µ', …]),而自定义分词器会产生有意义的 token,如 ['▁', 'サラリーマン', '▁', '油', '絵']
  • 此阶段结束后,模型能够理解日语提示,但仍生成西式风格的图像(例如,拥有西方面孔的上班族)。

第 2 阶段 – 文本编码器与潜在扩散模型的联合微调

  • 文本编码器和潜在扩散模型一起进行训练。
  • 这种联合微调使模型能够生成日式风格的图像,例如拥有日本面孔的上班族。

开源发布策略

rinna 坚持开源理念,致力于让 AI 超越英语的局限。公司已发布了 GPT‑1B、BERT‑base 和 CLIP‑ViT‑B‑16 的日语版本,现在又将日语 Stable Diffusion 加入其产品线。所有资源均可公开获取:

局限性与未来工作

日语 Stable Diffusion 的通用性不如原始模型,仍存在准确性不足。rinna 计划继续改进语言专用模型,并正在探索用于日语语音的自监督模型,以扩展多语言 AI 生态系统。

Sources