GaoQ1/rasa_nlu_gq
turn natural language into structured data(支持中文,自定义了N种模型,支持不同的场景和任务)
解決的問題
本項目提供了一套針對 Rasa NLU 的自訂元件和擴展,專門針對中文語言處理進行了優化。它允許開發者在不修改 Rasa 核心原始碼的情況下,將更進階的實體抽取和意圖分類模型整合到他們的 Rasa 管線中。
運作方式
它作為一個附加元件,可以透過設定檔載入到 Rasa NLU 管線中。它引入了幾個專門的模組:
- 實體抽取器:實作了 BiLSTM+CRF 和 IDCNN+CRF(空洞卷積)模型,以實現更準確的實體識別。
- 特徵提取:整合 BERT 以生成詞向量特徵。
- 意圖分類:添加了基於 BERT 的意圖分類器和基於 TensorFlow 的估計分類器。
- 詞性標註:添加了一個基於 Jieba 的詞性(POS)抽取器,用於識別名稱、地點和組織。
- 意圖修改:允許系統根據偵測到的實體反向修改意圖。
適用對象
適用於使用 Rasa 框架建置中文聊天機器人或 NLU 系統,並且需要比預設提供的功能更複雜的 NLP 工具的開發者。
亮點
- 模組化整合:作為外掛/附加元件運行,確保與 Rasa 更新的相容性。
- 進階 NER:支援 BiLSTM+CRF 和 IDCNN+CRF 模型進行實體抽取。
- BERT 整合:使 BERT 向量可用於特徵提取和意圖分類。
- 中文支援:專門包含用於中文文本的 Jieba 分詞器和詞性標註。
- 硬體最佳化:提供設定選項以管理 TensorFlow 元件的 CPU 和 GPU 使用情況。
相關
- 專案
- 專案
- 專案
- 專案