GaoQ1/rasa_nlu_gq

turn natural language into structured data(支持中文,自定义了N种模型,支持不同的场景和任务)

解決的問題

本項目提供了一套針對 Rasa NLU 的自訂元件和擴展,專門針對中文語言處理進行了優化。它允許開發者在不修改 Rasa 核心原始碼的情況下,將更進階的實體抽取和意圖分類模型整合到他們的 Rasa 管線中。

運作方式

它作為一個附加元件,可以透過設定檔載入到 Rasa NLU 管線中。它引入了幾個專門的模組:

  • 實體抽取器:實作了 BiLSTM+CRF 和 IDCNN+CRF(空洞卷積)模型,以實現更準確的實體識別。
  • 特徵提取:整合 BERT 以生成詞向量特徵。
  • 意圖分類:添加了基於 BERT 的意圖分類器和基於 TensorFlow 的估計分類器。
  • 詞性標註:添加了一個基於 Jieba 的詞性(POS)抽取器,用於識別名稱、地點和組織。
  • 意圖修改:允許系統根據偵測到的實體反向修改意圖。

適用對象

適用於使用 Rasa 框架建置中文聊天機器人或 NLU 系統,並且需要比預設提供的功能更複雜的 NLP 工具的開發者。

亮點

  • 模組化整合:作為外掛/附加元件運行,確保與 Rasa 更新的相容性。
  • 進階 NER:支援 BiLSTM+CRF 和 IDCNN+CRF 模型進行實體抽取。
  • BERT 整合:使 BERT 向量可用於特徵提取和意圖分類。
  • 中文支援:專門包含用於中文文本的 Jieba 分詞器和詞性標註。
  • 硬體最佳化:提供設定選項以管理 TensorFlow 元件的 CPU 和 GPU 使用情況。

相關

  • 專案
  • 專案
  • 專案
  • 專案