OpenAI GPT-4 發佈
OpenAI 已發佈 GPT-4,這是一個大型語言模型,與其前身 GPT-3.5 相比,展現出顯著提升的推理能力、更廣泛的通識知識以及在解決複雜問題時更高的準確度。此次發佈標誌著 OpenAI 擴展策略的延續,利用增加的數據和計算量來創建更複雜的深度學習模型。
進階推理與問題解決
GPT-4 在複雜推理任務和創意協作方面展現出卓越的性能。它可以生成、編輯和迭代技術與創意寫作任務,例如創作歌曲或編寫劇本,並能適應使用者的特定寫作風格。
在實際的推理測試中,GPT-4 在排程和邏輯問題方面優於 GPT-3.5。例如,在一個需要協調三個人可用時間以進行 30 分鐘會議的情境中,GPT-4 能正確識別出共同的可用時間窗口(12 pm - 12:30 pm),而 GPT-3.5 則無法識別出正確的窗口。
標準化測試表現
GPT-4 在專業和學術考試的考生百分位數得分中顯示出顯著的進步:
- Uniform Bar Exam: GPT-4 得分位於第 90 百分位數,而 GPT-3.5 則位於第 10 百分位數。
- Biology Olympiad: GPT-4 (含視覺功能) 得分位於第 99 百分位數,而 GPT-3.5 則位於第 31 百分位數。
安全性與對齊改進
OpenAI 花了六個月的時間專注於讓 GPT-4 更安全且更符合對齊要求。根據內部評估,GPT-4 回應不允許內容請求的可能性比 GPT-3.5 低 82%,且產生事實性回應的可能性比 GPT-3.5 高 40%。
這些改進是透過幾種關鍵方法實現的:
- Training with Human Feedback: 模型納入了更多的人類回饋,包括 ChatGPT 使用者提交的數據,以及來自超過 50 位 AI 安全與安全專家早期回饋的數據。
- Real-World Application: 從先前模型的實際部署經驗中汲取的教訓被整合到了安全研究與監控系統中。
- GPT-4-Assisted Research: 模型自身的推理與指令遵循能力被用於創建用於微調的訓練數據,並用於迭代訓練與監控的分類器。
基礎設施與限制
GPT-4 是在 Microsoft Azure AI 超級電腦上訓練的,這也促進了其向全球使用者提供的服務。
儘管有這些進展,OpenAI 承認 GPT-4 仍存在已知的限制,包括社會偏見、幻覺以及容易受到對抗性提示詞的影響。公司旨在透過透明度、使用者教育以及擴大公眾輸入來解決這些問題,以形塑未來的模型。
可用性
GPT-4 可透過 ChatGPT Plus 提供給使用者,並作為 API 提供給開發者以構建應用程式與服務。
Sources
- OriginalGPT-4