Grok 圖像生成發佈

xAI 已推出 Aurora,這是一款整合至 Grok 中的全新自回歸圖像生成模型。此次更新使 Grok 能夠產出高品質圖像,重點在於寫實渲染與嚴格遵循文本指令,同時引入了針對圖像到圖像編輯的原生多模態支援。

Aurora 模型架構與訓練

Aurora 是以自回歸混合專家 (MoE) 網路構建而成。該模型旨在從交織文本與圖像的數據中預測下一個 token。為了實現對世界的深度理解與高保真渲染,xAI 在來自網路的數十億個範例上對 Aurora 進行了訓練。

核心圖像生成能力

Aurora 讓 Grok 能夠在傳統圖像生成模型經常遇到困難的多個領域中生成高品質圖像。關鍵能力包括:

  • 真實世界實體渲染: 真實世界物體與實體的精確視覺細節。
  • 文本與 Logo 整合: 在圖像中渲染準確文本與 Logo 的能力。
  • 人物肖像: 創建寫實的人類與名人肖像。
  • 多樣化內容類型: 支援廣泛的風格,從寫實風景與賽博龐克城市到藝術素描與漫畫風格插圖。

多模態輸入與圖像編輯

除了文本到圖像生成之外,Aurora 還具備原生的多模態輸入支援。這使得模型可以將使用者提供的圖像作為靈感參考或作為直接編輯的目標。例如,使用者可以提供一張貓的圖像,並提示模型「將這隻貓變成動漫風格」,從而得到原經圖像的風格化版本。

可用性與部署

截至 2024 年 12 月 9 日,這些圖像生成能力已在特定國家的 platform 上可用。xAI 表示,該功能將在公告發佈後的一週內推送到所有使用者。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch