OpenAI 學者 2018 最終專案

OpenAI 已發布 2018 年學者 cohort 完成的最終專案摘要。這些專案展示了深度學習、強化學習與生成模型在創意藝術、物理模擬與語言分析等領域的應用。

生成音樂與音訊

多位學者專注於使用語言模型與生成架構來創作音樂及與音樂相關的內容。

  • Classical Music Generation: Christine Payne 開發了一個系統,將語言模型技術應用於以音符層面與和弦層面兩種方式建模古典音樂。該系統利用平行的字符與詞彙層級語言模型生成獨奏鋼琴或鋼琴與小提琴室內樂,且能針對特定作曲家或風格進行訓練。專案還包括一個音樂評論家網路,用於區分真實與偽造樣本,以及一個辨識作曲家的網路。
  • Music Commentary Generation: Nadja Rhodes 創建了「Deephypebot」,一個在網路上人類音樂寫作上訓練的語言模型。該模型以音樂屬性為條件,並加入特定的訓練步驟,以鼓勵音樂新聞常見的「華麗」描述寫作風格。

自然語言處理與語意

2018 年 cohort 的研究聚焦於提升模型在文字中表示意義與語意關係的能力。

  • Semantic Trees in LSTMs: Munashe Shumba 探討在 Long Short-Term Memory (LSTM) 網路中使用語意樹,以更好地表示句子內實體之間的關係。
  • Semantic Textual Similarity: Dolapo Martins 為 SemEval STS 任務第 4 軌道構建模型,實驗了包括 LSTM、RNN 以及 Transformer 架構在內的各種架構,以優化效能。

創意藝術與視覺生成

學者們將生成對抗網路 (GAN) 與變分自編碼器 (VAE) 應用於視覺藝術與情感表達。

  • Art Composition Attributes: Holly Grimm 開發了一個藝術構圖屬性網路,使用預訓練的 ResNet50 網路並在八項藝術構圖屬性上微調。此網路被整合到 CycleGAN 中,以根據這些屬性的目標值生成藝術構圖。
  • Emotional Landscapes: Hannah Davis 實驗使用 GAN、條件 VAE 與多尺度 VAE 生成情感景觀,映射包括喜悅、期待、恐懼、悲傷、驚訝、信任、厭惡與憤怒等具體情緒類別。

物理模擬與落地學習

兩個專案聚焦於 AI 與物理或環境世界的交叉領域。

  • Intuitive Physics: Ifa Aniemeka 建立了一個網路,僅透過觀察即可學習空間中物體運動的規則,無需對摩擦、力或動量等物理概念作明確定義。
  • Grounded Language Learning: Sophia Arakelyan 開發了一個結合 NLP 與 reinforcement learning (RL) 的專案,讓代理人在 Gridworld 環境中根據收到的指令達成目標格子,作為落地語言學習的一步。

技術技能獲取

學者們報告說在使用業界標準框架與方法論方面的技術流暢度有顯著提升。主要的發展領域包括:

  • Frameworks: 在 TensorFlow、PyTorch 與 Keras 上的熟練度提升。
  • Architectures: 實作 Recurrent Neural Networks (RNN)、LSTM、Generative Adversarial Networks (GAN) 與 Variational Autoencoders (VAE)。
  • Methodologies: 具備資料生成、特徵工程以及 reinforcement learning 演算法應用的經驗。

Sources