OpenAI 研究:透過精選數據集微調來改善語言模型行為
OpenAI 已證明,透過在少於 100 個範例的精選小型數據集上進行微調,可以針對特定的行為價值觀改善語言模型的行為。這種方法允許模型操作員將模型可能行為的通用集合限制在針對特定社會背景或應用程式量身定制的一組特定價值觀中。
透過小規模微調實現行為對齊
在高度精選的小規模數據集上進行微調,是將模型輸出與期望的行為價值觀對齊的有效方法。OpenAI 發現,隨著模型規模的增加,此過程會變得更加有效,這表明較大的語言模型需要較少的樣本來使其行為適應特定的價值觀。這種方法提供了一個比從頭開始重新訓練模型更具擴展性的替代方案,而重新訓練模型在嘗試為大型且多樣化的人群進行模型對齊時是必要的,以避免邊緣化少數群體的聲音。
三步驟對齊流程
OpenAI 開發了一種流程,使用以下三個步驟在特定的社會背景下改善模型行為:
1. 定義敏感主題類別
研究人員識別了對人類福祉有直接影響的類別,並根據國際人權法和西方追求人類平等的社會運動來制定期望的行為。優先考慮的類別包括:
- 虐待、暴力與威脅: 反對暴力與威脅,並鼓勵尋求當局的幫助。
- 身心健康: 反對將非傳統醫學作為科學替代方案,並拒絕診斷疾病或開立處方。
- 人類特徵與行為: 支持善良與討喜的客觀性,並反對不健康的審美標準。
- 不公與不平等: 反對人類的不公、不平等和有害的刻板印象,特別是針對國際法定義的社會群體。
- 政治觀點與破壞穩定: 除非人權或法律受到破壞,否則保持非黨派性,並反對干預民主程序。
- 人際關係: 反對非自願行為或違反信任的行為。
- 性活動: 反對非法且非自願的性活動。
- 恐怖主義: 反對恐怖主義活動或威脅。
2. 數據集製作與微調
研究人員製作了一個以價值觀為目標的數據集,由 80 個以問答格式呈現的文本樣本組成,每個樣本的字數在 40 到 340 字之間。該數據集總計約 120KB,約佔 GPT-3 總訓練數據(570GB)的 0.000000211%
GPT-3 模型(參數規模從 125M 到 175B)隨後使用標準微調工具在此數據集上進行了微調。
3. 評估指標
為了衡量對齊的有效性,OpenAI 使用了定量與定性的指標組合:
- 人類評估: 三名不同的受試者根據文本與指定情感立場的契合程度,將樣本評分從 1 到 5 分。
- 毒性評分: 使用 Perspective API,儘管研究人員指出毒性評分可能包含人口統計學和種族偏見(例如,將身份術語或非裔美國英語標記為具有毒性)。
- 共現指標: 用於檢查性別、種族和宗教。
評估過程比較了基礎 GPT-3 模型、價值觀目標 GPT-3 模型以及對照 GPT-3 模型(在規模和風格相似但沒有目標價值觀的數據集上進行微調)。
關鍵發現與影響
定性探測與人類評估顯示,價值觀目標模型比基礎模型或對照模型更緊密地遵循期望的行為。這種行為的改善發生在不損害下游任務性能的情況下。
OpenAI 指出,這項技術尚處於起步階段,並針對以下幾個開放性問題提出了疑問:關於該方法論對現實世界提示詞分佈的穩健性、對於與用戶價值觀不符的輸出的問責制,以及將此研究應用於非英語語言和其他生成式模態(如圖像、影片或音訊)的可能性。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch