OpenAI Sora 2 發布
OpenAI 宣佈了 Sora 2,這是一款旗艦級的影像與音訊生成模型,旨在作為更精確的世界模擬器。Sora 2 在前代基礎上提升了物理寫實度、增強了可控性,並整合了同步的對話與音效。
先進的世界模擬與物理精準度
Sora 2 被設計得更能遵守物理定律,減少先前影像模型中出現的「過度樂觀」現象——物體會變形或瞬移以符合提示。該模型現在能精確模擬複雜的動態,例如在立式划板上做後空翻時的浮力與剛性,或投籃失手後籃球從背板彈回的情形。
OpenAI 將此進展形容為「影片界的 GPT-3.5 時刻」,超越原始 Sora 模型的基本物體恆存概念,朝能模擬失敗與真實物理交互的系統前進。此能力被視為打造深度理解物理世界的 AI 系統的關鍵一步。
多模態能力與可控性
Sora 2 在多個層面擴展了其生成能力:
- 整合音訊: 模型能產生高度寫實的複雜背景音景、語音與音效。
- 增強可控性: Sora 2 能在多個鏡頭中遵循複雜指令,同時保持一致的世界狀態。
- 風格多樣性: 模型在電影、寫實與動畫風格上皆表現出色。
- 實境注入: 使用者可透過提供參考影片,將真實人物、動物或物件插入生成的環境,讓模型精確呈現外觀與聲音。
Sora 社交應用程式與「角色」
為了部署 Sora 2,OpenAI 正推出名為「Sora」的 iOS 社交應用程式。該應用的核心功能是「角色」,使用者可透過一次性影片與音訊錄製,為自己或朋友建立數位肖像。這些角色之後可高保真地放入任何 Sora 生成的場景中。
此應用程式的設計重點在於創作勝於消費,提供可自訂的資訊流,背後由自然語言可指示的推薦演算法驅動。使用者可透過基於大型語言模型的指令與定期的福祉調查來控制資訊流。
安全與責任框架
OpenAI 已實施多項防護措施,以因應生成式影片與社群媒體相關的風險:
- 肖像控制: 使用者對其角色擁有端對端的控制權,包括撤銷存取或移除任何包含其肖像的影片的能力。
- 青少年保護: 應用預設每日可在資訊流中看到的生成次數上限,對角色權限更嚴格,並提供透過 ChatGPT 管理的家長控制。
- 內容審查: 除了自動化安全機制外,OpenAI 正擴大人工審查團隊,以檢視霸凌與有害內容。
- 營利模式: OpenAI 表示目前的計畫僅限於在計算需求高峰期間提供付費的額外影片生成選項,明確避免使用優化資訊流停留時間的模型。
可用性與存取方式
Sora 2 正透過邀請制在美國與加拿大開始推出。使用者可透過 Sora iOS 應用程式與 sora.com 取得存取。
- 免費層級: 初期提供免費使用,具慷慨的限制,但受計算資源限制。
- Sora 2 Pro: 為實驗性、高品質模型,供 ChatGPT Pro 使用者於 sora.com 使用,未來亦將於應用程式內提供。
- API 存取: OpenAI 計畫未來透過 API 發布 Sora 2。Sora 1 Turbo 仍供現有使用者使用。
Sources
- OriginalSora 2 is here