OpenAI 使用人類回饋進行書籍摘要 (2021)

方法:來自人類回饋的強化學習與遞迴任務分解

OpenAI 的方法利用來自人類回饋的強化學習來訓練一個模型,該模型先對書籍的小節進行摘要,然後遞迴地將這些摘要摘要成更高層次的摘要。正如該貼文所述,「我們的模型先對書籍的小節進行摘要,然後將這些摘要摘要成更高層次的摘要,如此反覆。」

動機:擴大人類監督以解決對齊問題

此工作透過開發可擴展的監督技術來應對對齊問題,適用於人類評估困難的任務,例如書籍摘要。該貼文解釋:「為了未來安全地部署強大且通用的人工智慧,我們需要確保機器學習模型的行為符合人類意圖。這項挑戰已被稱為 對齊問題。」

方法論:結合來自人類回饋的強化學習與遞迴分解

此方法結合來自人類回饋的強化學習,使模型輸出符合人類偏好,並在書的各個部分上層次應用。該貼文指出,他們使用此技術訓練了一個模型來摘要整本書。

範例:經典書籍的示範

該貼文展示了包括《愛麗絲夢遊仙境》、《傲慢與偏見》、《羅密歐與朱麗葉》、《十二年奴隸生涯》和《我的一生》等書籍的樣本摘要,並提供《愛麗絲夢遊仙境》的原文作為參考。書封圖片和輪播導覽使讀者能夠檢視這些摘要。

含義:朝向可擴展的人工智慧對齊

透過展示對長文本進行有效摘要的能力,此方法闡明了一條在其他複雜且難以評估的任務上對齊人工智慧系統的路徑。該貼文指出,類似此種可擴展的監督技術有望提升未來通用人工智慧系統的對齊程度。

Sources