JohnSnowLabs/spark-nlp
State of the Art Natural Language Processing
解決的問題
Spark NLP 是為機器學習流程設計,提供高效率、高準確度的自然語言處理(NLP)標註,可跨分散式環境擴展。它解決了在生產環境中大規模運行先進 NLP 模型的挑戰,特別是針對使用 Apache Spark 生態系統的使用者。
如何運作
此套件原生建構於 Apache Spark 之上,擴展 Spark 的分散式處理能力以支援 NLP 任務。使用者可建立標註器流程來處理文字、影像與語音。支援超過 100,000 種預訓練模型,並原生支援從 TensorFlow、ONNX、OpenVINO 與 Llama.cpp(GGUF)匯入模型。
適用對象
適用於需要大規模執行 NLP 的資料工程師與機器學習實務者,支援 200 多種語言,以及 Python、Scala、Java 與 Kotlin 等多種程式語言。
主要特色
- 龐大的模型庫:支援 200 多種語言的超過 100,000 種預訓練流程與模型。
- 分散式擴展:與 Apache Spark 原生整合,可在叢集上無縫擴展。
- 廣泛的任務支援:涵蓋從分詞、命名實體辨識到機器翻譯、摘要生成,以及 Llama-2、Mistral、Phi 等 LLM 模型。
- 跨平台相容性:支援 Python、JVM(Java、Scala、Kotlin)以及 Databricks、EMR、GCP Dataproc 等平台。
- 多模態能力:支援影像分類、影像轉文字(字幕生成)與自動語音辨識。
相關
- 專案
- 專案
- 專案
- 專案
- 專案