cltk/cltk

The Classical Language Toolkit

해결하는 문제

CLTK는 현대 언어와는 다른 언어적 특성과 연구 목표를 가진 전기 및 역사적 언어를 위해 특별히 설계된 자연어 처리(NLP) 도구를 제공합니다. 대부분의 표준 NLP 소프트웨어가 현대 언어를 대상으로 개발되어 있기 때문에 이 분야에는 공백이 존재합니다.

작동 방식

이 툴킷은 사용자가 언어 주석 처리에 사용할 백엔드를 선택할 수 있는 모듈식 처리 파이프라인을 사용합니다. 다음과 같은 백엔드를 지원합니다:

  • GenAI/LLMs: OpenAI(클라우드 기반) 및 Ollama(로컬 LLM, Llama 3.1 또는 Qwen 2.5 등).
  • 판별형 NLP: Stanford Stanza.

사용자는 언어(예: lati1261은 라틴어)를 지정하고 백엔드를 선택하여 NLP 작업을 수행할 수 있습니다.

대상 사용자

역사적 텍스트를 분석하기 위해 표준화된 Python 기반 프레임워크가 필요한 전기 언어 연구자 및 학자들.

주요 특징

  • 다중 백엔드 지원: LLM(OpenAI, Ollama)과 전통적 NLP 도구(Stanza)와 통합 가능.
  • 모듈식 파이프라인: 알고리즘의 다양성과 사전 설정된 기본값의 균형을 제공.
  • 광범위한 언어 지원: 거의 20개의 언어에 대한 파이프라인과 모델을 제공.
  • 로컬 LLM 통합: Ollama를 통해 로컬 모델을 사용하여 데이터 프라이버시 보장 또는 오프라인 접근 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트