kermitt2/delft

a Deep Learning Framework for Text https://delft.readthedocs.io/

解决的问题

DeLFT 是一个专为文本处理设计的深度学习框架,特别针对序列标注(如命名实体标注)和文本分类。它解决了许多 NLP 工具仅能处理简单文本的局限性,通过原生支持「富文本」——即与布局信息、字体样式和结构化文档(如 PDF 或 HTML 文件)中位置相关联的文本——来弥补这一不足。

工作原理

基于 Keras 和 TensorFlow 构建,该框架实现了多种最先进的深度学习架构,包括 RNN 和 Transformers。它将 HuggingFace Transformers 作为 Keras 层集成,并使用动态数据生成器处理无法完全加载到内存中的大型数据集。为优化生产环境,通过移除词嵌入显著减小 RNN 模型的大小,大幅缩小模型体积(通常降至 2 MB 以下)。

适用人群

适用于需要在复杂结构化文档上执行高性能序列标注或文本分类的开发者和研究人员,以及希望获得可复现的 NLP 模型基准测试环境的用户。

主要亮点

  • 富文本支持:能够处理带有结构化文档中布局和符号上下文信息的标记。
  • 模型压缩:显著减小 RNN 模型大小(例如从 230 MB 降至 1.8 MB),便于部署。
  • 生产就绪:通过 LMDB 高效加载预训练嵌入,优化性能和鲁棒性。
  • 全面评估:内置标准指标和 n 折交叉验证的评估框架。
  • HuggingFace 集成:可无缝将基于 Transformer 的模型作为 Keras 层集成。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch