JohnSnowLabs/spark-nlp

State of the Art Natural Language Processing

해결하는 문제

Spark NLP는 분산 환경에서 확장 가능한 고성능 정확한 자연어 처리(NLP) 어노테이션을 기계 학습 파이프라인에 제공하도록 설계되었습니다. 특히 Apache Spark 생태계를 사용하는 사용자들이 본격적인 NLP 모델을 대규모로 운영하는 문제를 해결합니다.

작동 방식

Apache Spark 위에 네이티브로 구축된 이 라이브러리는 Spark의 분산 처리 기능을 NLP 작업에 확장합니다. 사용자는 텍스트, 이미지, 음성 처리를 위한 어노테이터 파이프라인을 생성할 수 있습니다. 10만 개 이상의 사전 학습된 모델을 지원하며, TensorFlow, ONNX, OpenVINO, Llama.cpp(GGUF)에서 모델을 가져오는 것을 네이티브로 지원합니다.

대상 사용자

대규모 NLP를 수행해야 하는 데이터 엔지니어 및 머신러닝 전문가를 위한 것입니다. 200개 이상의 언어를 지원하며, Python, Scala, Java, Kotlin 등 다양한 프로그래밍 언어를 지원합니다.

주요 특징

  • 거대한 모델 허브: 200개 이상의 언어에서 10만 개 이상의 사전 학습된 파이프라인과 모델에 접근 가능.
  • 분산 스케일링: Apache Spark와의 네이티브 통합으로 클러스터에서 원활한 확장성 제공.
  • 광범위한 작업 지원: 토큰화, NER부터 기계 번역, 요약, Llama-2, Mistral, Phi와 같은 LLM까지 포괄.
  • 크로스 플랫폼 호환성: Python, JVM(Java, Scala, Kotlin), Databricks, EMR, GCP Dataproc 등 다양한 플랫폼에서 작동.
  • 다중 모달 기능: 이미지 분류, 이미지-텍스트 변환(캡셔닝), 음성 인식을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트