kermitt2/delft

a Deep Learning Framework for Text https://delft.readthedocs.io/

解決的問題

DeLFT 是一個專為文字處理設計的深度學習框架,特別針對序列標記(例如命名實體標記)與文字分類。它克服了許多 NLP 工具僅能處理簡單文字的限制,透過原生支援「富文字」——即與版面資訊、字型樣式以及結構化文件(如 PDF 或 HTML 檔案)中的位置相關聯的文字——來彌補此缺憾。

工作原理

基於 Keras 與 TensorFlow 建構,該框架實作了多種先進的深度學習架構,包括 RNN 與 Transformers。它將 HuggingFace Transformers 作為 Keras 層整合,並使用動態資料產生器處理無法完全載入記憶體的大型資料集。為優化生產環境,透過移除詞嵌入大幅縮小 RNN 模型大小,顯著縮小模型體積(通常降至 2 MB 以下)。

適用對象

適用於需要在複雜結構化文件上執行高效率序列標記或文字分類的開發者與研究人員,以及希望獲得可重現的 NLP 模型基準測試環境的使用者。

主要亮點

  • 富文字支援:可處理帶有結構化文件中版面與符號上下文資訊的標記。
  • 模型壓縮:大幅縮小 RNN 模型大小(例如從 230 MB 降至 1.8 MB),便於部署。
  • 生產就緒:透過 LMDB 高效載入預訓練嵌入,優化效能與穩健性。
  • 全面評估:內建標準指標與 n 折交叉驗證的評估框架。
  • HuggingFace 整合:可無縫將基於 Transformer 的模型作為 Keras 層整合。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch