OFASys:多模態多任務學習框架
Qwen 推出 OFASys,一個旨在簡化多模態多任務學習的 AI 框架。透過使用簡單的「Instruction」介面,系統允許開發者僅用一行程式碼即可構建多模態多任務學習工作,省去資料前處理、模型構建與訓練穩定性的複雜性。
透過 Instruction 簡化任務定義
OFASys 以基於模板的 Instruction 系統取代繁雜的實作流程。Instruction 使用特定語法(例如 input -> output)定義任務的輸入與期望輸出,使系統能自動處理底層資料管線。
- 影像說明範例:指令
[IMAGE:img] -> cap告訴系統資料集中有一個綁定至img欄位的影像輸入,且輸出應為cap欄位中的文字序列。 - 自然語言推理(NLI)範例:對於 NLI 任務,系統支援編碼器的多重輸入,並提供如
no_loss之類的訊號以避免對重複輸入計算損失,同時使用closed_set來表示封閉的標籤集合。
系統架構與設計
OFASys 採用模組化設計,將 Instruction 轉換為可執行的任務計畫。此架構確保不同模態能透過一致的內部介面進行處理。
任務計畫組件
每個任務計畫由包含以下內容的模型層級構成:
- 特定模態組件:前處理器、後處理器與適配器,負責處理特定資料類型的細節。
- 通用模型:一個與模態無關的計算模型,融合多模態輸入並產生輸出。由於輸入與輸出皆被視為表示序列,通用模型不受模態限制,保持高度彈性。
訓練與執行
為了管理多任務學習的規模,OFASys 實作了以下機制:
- 參數共享:預設情況下,系統在適配器與通用模型之間共享可訓練參數,以最大化跨樣本的最佳化效果。
- 任務與邏輯排程器:任務排程器負責聯合最佳化與任務優先順序,而邏輯排程器則管理跨多個實體裝置的工作流程。
- 階段式組件:提供即用型的生成器與評估標準,以支援訓練與推論。
效能驗證:OFA+ 模型
為了展示此框架的效能,Qwen 開發了 OFA+,一個能同時處理文字、影像、語音、影片與動作資料的通用模型。
研究人員比較了模型的三個版本:
- OFA+(通用型):基於 OFA 的通用模型。
- OFA+(通用型 MoE):利用模態層級的 Mixture of Experts(MoE)進行改進的版本。
- OFA+(專家型):原始 OFA 模型,針對特定任務微調以作為基線比較。
結果顯示,OFA+ 在擴展至 7 種不同模態、23 個多樣任務的同時,仍保留超過 95% 的專家模型效能。這表明多任務學習能為通用模型提供廣泛能力,同時不犧牲特定任務的最高表現。