JohnSnowLabs/spark-nlp
State of the Art Natural Language Processing
解决的问题
Spark NLP 旨在为机器学习管道提供高性能、高准确率的自然语言处理(NLP)标注,可跨分布式环境扩展。它解决了在生产环境中大规模运行前沿 NLP 模型的挑战,尤其适用于使用 Apache Spark 生态系统的用户。
工作原理
该库原生构建于 Apache Spark 之上,扩展了 Spark 的分布式处理能力以支持 NLP 任务。用户可以创建标注器流水线来处理文本、图像和语音。它支持超过 100,000 个预训练模型,并原生支持从 TensorFlow、ONNX、OpenVINO 和 Llama.cpp(GGUF)导入模型。
适用人群
适用于需要大规模执行 NLP 的数据工程师和机器学习实践者,支持 200 多种语言,以及 Python、Scala、Java 和 Kotlin 等多种编程语言。
主要亮点
- 海量模型库:支持 200 多种语言的超过 100,000 个预训练流水线和模型。
- 分布式扩展:与 Apache Spark 原生集成,可在集群中无缝扩展。
- 广泛的任务支持:涵盖从分词、命名实体识别到机器翻译、摘要生成,以及 Llama-2、Mistral、Phi 等 LLM 模型。
- 跨平台兼容性:支持 Python、JVM(Java、Scala、Kotlin)以及 Databricks、EMR、GCP Dataproc 等平台。
- 多模态能力:支持图像分类、图像转文本(字幕生成)和自动语音识别。
相关
- 项目
- 项目
- 项目
- 项目
- 项目