JohnSnowLabs/spark-nlp

State of the Art Natural Language Processing

何を解決するか

Spark NLP は、分散環境でスケーラブルに動作する高パフォーマンスで正確な自然言語処理(NLP)のアノテーションを機械学習パイプラインに提供することを目的としています。特に Apache Spark エコシステムを利用しているユーザーにとって、本番環境で最先端の NLP モデルを大規模に実行する課題に対処します。

動作方法

Apache Spark 上にネイティブに構築されたこのライブラリは、Spark の分散処理機能を NLP タスクに拡張します。ユーザーはテキスト、画像、音声を処理するためのアノテーターパイプラインを作成できます。100,000 以上の事前学習済みモデルをサポートしており、TensorFlow、ONNX、OpenVINO、Llama.cpp(GGUF)からのモデルのインポートもネイティブにサポートしています。

対象ユーザー

スケーラブルな NLP を必要とするデータエンジニアや機械学習実践者向けです。200 以上の言語をサポートし、Python、Scala、Java、Kotlin などの複数のプログラミング言語に対応しています。

主な特徴

  • 巨大なモデルハブ: 200 以上の言語で 100,000 以上の事前学習済みパイプラインとモデルにアクセス可能。
  • 分散スケーリング: Apache Spark とのネイティブ統合により、クラスタ上でスムーズにスケーリング可能。
  • 広範なタスク対応: トークン化、NER から機械翻訳、要約、Llama-2、Mistral、Phi などの LLM までカバー。
  • クロスプラットフォーム互換性: Python、JVM(Java、Scala、Kotlin)および Databricks、EMR、GCP Dataproc などのプラットフォームで動作。
  • マルチモーダル機能: 画像分類、画像からテキスト生成(キャプション)、音声認識をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト