Grok 画像生成リリースの発表

xAI は、Grok に統合された新しい自己回帰型画像生成モデルである Aurora を導入しました。このアップデートにより、Grok はフォトリアルなレンダリングとテキスト指示への厳格な遵守に重点を置きつつ、画像から画像への編集のためのネイティブなマルチモーダル・サポートを導入し、高品質な画像を生成できるようになります。

Aurora モデルのアーキテクチャとトレーニング

Aurora は、自己回帰型 Mixture-of-Experts (MoE) ネットワークとして構築されています。このモデルは、テキストと画像が交互に配置されたデータから次のトークンを予測するように設計されています。世界に対する深い理解とレンダリングにおける高い忠実度を実現するために、xAI はインターネットから取得した数十億の例を用いて Aurora をトレーニングしました。

コア画像生成機能

Aurora により、Grok は、従来の画像生成モデルが苦戦することが多いいくつかの領域において、高品質な画像を生成できるようになります。主な機能は以下の通りです:

  • 実世界のエンティティのレンダリング: 実世界のオブジェクトやエンティティの正確な視覚的詳細。
  • テキストとロゴの統合: 画像内に正確なテキストやロゴをレンダリングする能力。
  • 人物のポートレート: 人間や有名人のリアルなポートレートの作成。
  • 多様なコンテンツタイプ: フォトリアルな風景やサイバーパンクな都市から、芸術的なスケッチやコミックスタイルのイラストまで、幅広いスタイルをサポート。

マルチモーダル入力と画像編集

テキストから画像への生成を超えて、Aurora はマルチモーダル入力のネイティブなサポートを備えています。これにより、モデルはユーザーが提供した画像を、インスピレーションの参照用、または編集の直接的な対象として使用できます。例えば、ユーザーが猫の画像を提供し、モデルに「猫をアニメスタイルにして」とプロンプトを入力すると、元の画像をスタイライズしたバージョンが生成されます。

利用可能性と展開

2024年12月9日現在、これらの画像生成機能は、一部の国々の platform 上で利用可能です。xAI は、この機能が発表から1週間以内にすべてのユーザーに展開される予定であると述べています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch