Gemini 音樂生成與 Lyria 3
Google DeepMind 已將 Lyria 3 生成式音樂模型整合至 Gemini 應用程式,讓使用者能夠使用文字或圖像創作 30 秒的 AI 生成音軌。此更新將 Gemini 的創意工具組從圖像與影片擴展至高品質、可自訂的音訊生成。
Lyria 3 功能與特點
Lyria 3 是 Google DeepMind 最新的生成式音樂模型,旨在將使用者提示轉換為朗朗上口且高品質的音軌。它在三個主要方面優於先前的 Lyria 模型:根據提示自動生成歌詞、提升對節奏、歌聲與風格的創意控制,以及製作更真實且音樂結構更複雜的音軌。
使用者可透過兩種主要輸入方式產生音樂:
- Text-to-Track(文字生成音軌): 使用者可描述特定的情緒、類型或回憶,以創作純音樂或含歌詞的音軌。例如,使用者可以根據個人回憶請求一段「有趣的非洲節拍音軌」。
- Image and Video-to-Track(影像與影片生成音軌): 使用者可上傳照片或影片,Gemini 會根據視覺內容的氛圍創作帶有歌詞的音軌。
每段生成的音軌長度為 30 秒,並附有由 Nano Banana 製作的自訂封面藝術。
與 YouTube Dream Track 的整合
Lyria 3 也正整合至 YouTube 的 Dream Track。最初在美國推出,現正擴展至其他國家的創作者,該模型提升了 YouTube Shorts 配樂的品質,讓創作者能產生更客製化的歌詞段落或伴奏音軌。
音訊驗證與 SynthID
為確保 AI 生成內容的辨識,Gemini 應用程式中產生的所有音軌皆嵌入了 SynthID——一種不可感知的浮水印。Google 亦在 Gemini 應用程式內擴充了驗證工具,加入音訊驗證功能。使用者可上傳音訊檔案並詢問 Gemini 是否由 Google AI 生成;模型將檢查 SynthID 浮水印,並以自身推理提供回應。
負責任的 AI 開發與版權
Google DeepMind 表示,Lyria 3 的設計旨在促進原創表達,而非模仿現有藝術家。當使用者以特定藝術家的名稱作為提示時,Gemini 會將此請求視為對風格或氛圍的廣泛創意靈感,而非直接仿效。
為保護智慧財產權,Google 已實施過濾機制,將輸出內容與現有作品比對。使用者必須遵守 Google 的服務條款與生成式 AI 禁止使用政策,該政策禁止侵犯智慧財產權與隱私權。亦提供舉報機制,以處理可能侵權的內容。
可用性與存取方式
Lyria 3 於 Gemini 應用程式中提供,適用於年滿 18 歲以上、使用英語、德語、西班牙語、法語、印地語、日語、韓語與葡萄牙語的使用者。此功能今日已在桌面版推出,未來數天內將於行動版推出。擁有 Google AI Plus、Pro 與 Ultra 訂閱的使用者享有更高的使用上限。