GaoQ1/rasa_nlu_gq

turn natural language into structured data(支持中文,自定义了N种模型,支持不同的场景和任务)

解决的问题

本项目提供了一套针对 Rasa NLU 的自定义组件和扩展,专门针对中文语言处理进行了优化。它允许开发者在不修改 Rasa 核心源代码的情况下,将更高级的实体抽取和意图分类模型集成到他们的 Rasa 管道中。

工作原理

它作为一个附加组件,可以通过配置文件加载到 Rasa NLU 管道中。它引入了几个专门的模块:

  • 实体抽取器:实现了 BiLSTM+CRF 和 IDCNN+CRF(空洞卷积)模型,以实现更准确的实体识别。
  • 特征提取:集成 BERT 以生成词向量特征。
  • 意图分类:添加了基于 BERT 的意图分类器和基于 TensorFlow 的估计分类器。
  • 词性标注:添加了一个基于 Jieba 的词性(POS)抽取器,用于识别名称、地点和组织。
  • 意图修改:允许系统根据检测到的实体反向修改意图。

适用人群

适用于使用 Rasa 框架构建中文聊天机器人或 NLU 系统,并且需要比默认提供的功能更复杂的 NLP 工具的开发人员。

亮点

  • 模块化集成:作为插件/附加组件运行,确保与 Rasa 更新的兼容性。
  • 高级 NER:支持 BiLSTM+CRF 和 IDCNN+CRF 模型进行实体抽取。
  • BERT 集成:使 BERT 向量可用于特征提取和意图分类。
  • 中文支持:专门包含用于中文文本的 Jieba 分词器和词性标注。
  • 硬件优化:提供配置选项以管理 TensorFlow 组件的 CPU 和 GPU 使用情况。

相关

  • 项目
  • 项目
  • 项目
  • 项目