OFASys:多模態多任務學習框架

Qwen 推出 OFASys,一個旨在簡化多模態多任務學習的 AI 框架。透過使用簡單的「Instruction」介面,系統允許開發者僅用一行程式碼即可構建多模態多任務學習工作,省去資料前處理、模型構建與訓練穩定性的複雜性。

透過 Instruction 簡化任務定義

OFASys 以基於模板的 Instruction 系統取代繁雜的實作流程。Instruction 使用特定語法(例如 input -> output)定義任務的輸入與期望輸出,使系統能自動處理底層資料管線。

  • 影像說明範例:指令 [IMAGE:img] -> cap 告訴系統資料集中有一個綁定至 img 欄位的影像輸入,且輸出應為 cap 欄位中的文字序列。
  • 自然語言推理(NLI)範例:對於 NLI 任務,系統支援編碼器的多重輸入,並提供如 no_loss 之類的訊號以避免對重複輸入計算損失,同時使用 closed_set 來表示封閉的標籤集合。

系統架構與設計

OFASys 採用模組化設計,將 Instruction 轉換為可執行的任務計畫。此架構確保不同模態能透過一致的內部介面進行處理。

任務計畫組件

每個任務計畫由包含以下內容的模型層級構成:

  • 特定模態組件:前處理器、後處理器與適配器,負責處理特定資料類型的細節。
  • 通用模型:一個與模態無關的計算模型,融合多模態輸入並產生輸出。由於輸入與輸出皆被視為表示序列,通用模型不受模態限制,保持高度彈性。

訓練與執行

為了管理多任務學習的規模,OFASys 實作了以下機制:

  • 參數共享:預設情況下,系統在適配器與通用模型之間共享可訓練參數,以最大化跨樣本的最佳化效果。
  • 任務與邏輯排程器:任務排程器負責聯合最佳化與任務優先順序,而邏輯排程器則管理跨多個實體裝置的工作流程。
  • 階段式組件:提供即用型的生成器與評估標準,以支援訓練與推論。

效能驗證:OFA+ 模型

為了展示此框架的效能,Qwen 開發了 OFA+,一個能同時處理文字、影像、語音、影片與動作資料的通用模型。

研究人員比較了模型的三個版本:

  1. OFA+(通用型):基於 OFA 的通用模型。
  2. OFA+(通用型 MoE):利用模態層級的 Mixture of Experts(MoE)進行改進的版本。
  3. OFA+(專家型):原始 OFA 模型,針對特定任務微調以作為基線比較。

結果顯示,OFA+ 在擴展至 7 種不同模態、23 個多樣任務的同時,仍保留超過 95% 的專家模型效能。這表明多任務學習能為通用模型提供廣泛能力,同時不犧牲特定任務的最高表現。

Sources