JohnSnowLabs/spark-nlp

State of the Art Natural Language Processing

解决的问题

Spark NLP 旨在为机器学习管道提供高性能、高准确率的自然语言处理(NLP)标注,可跨分布式环境扩展。它解决了在生产环境中大规模运行前沿 NLP 模型的挑战,尤其适用于使用 Apache Spark 生态系统的用户。

工作原理

该库原生构建于 Apache Spark 之上,扩展了 Spark 的分布式处理能力以支持 NLP 任务。用户可以创建标注器流水线来处理文本、图像和语音。它支持超过 100,000 个预训练模型,并原生支持从 TensorFlow、ONNX、OpenVINO 和 Llama.cpp(GGUF)导入模型。

适用人群

适用于需要大规模执行 NLP 的数据工程师和机器学习实践者,支持 200 多种语言,以及 Python、Scala、Java 和 Kotlin 等多种编程语言。

主要亮点

  • 海量模型库:支持 200 多种语言的超过 100,000 个预训练流水线和模型。
  • 分布式扩展:与 Apache Spark 原生集成,可在集群中无缝扩展。
  • 广泛的任务支持:涵盖从分词、命名实体识别到机器翻译、摘要生成,以及 Llama-2、Mistral、Phi 等 LLM 模型。
  • 跨平台兼容性:支持 Python、JVM(Java、Scala、Kotlin)以及 Databricks、EMR、GCP Dataproc 等平台。
  • 多模态能力:支持图像分类、图像转文本(字幕生成)和自动语音识别。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目