cltk/cltk
The Classical Language Toolkit
何を解決するか
CLTK は、現代語とは異なる言語的特徴や研究目的を持つ、前近代および歴史的言語に特化した自然言語処理(NLP)ツールを提供します。多くの標準的なNLPソフトウェアが現代語向けに構築されているため、この分野にはギャップがありました。
仕組み
このツールキットはモジュール式の処理パイプラインを使用しており、ユーザーは言語の注釈に使用するバックエンドを自由に選択できます。以下のバックエンドをサポートしています:
- GenAI/LLMs: OpenAI(クラウドベース)および Ollama(ローカルLLM、Llama 3.1 や Qwen 2.5 など)。
- 判別型NLP: Stanford Stanza。
ユーザーは言語(例:lati1261 はラテン語)を指定し、バックエンドを選択してNLPタスクを実行できます。
対象ユーザー
歴史的テキストの分析に標準化された、Pythonベースのフレームワークを必要とする前近代言語の研究者や学者。
特徴
- マルチバックエンド対応: LLM(OpenAI、Ollama)と従来のNLPツール(Stanza)と統合可能。
- モジュール式パイプライン: アルゴリズムの多様性と事前設定されたデフォルトのバランスを実現。
- 広範な言語対応: ほぼ20の言語に対応するパイプラインとモデルを提供。
- ローカルLLM統合: Ollamaを介してローカルモデルを使用可能。データプライバシーの確保やオフラインアクセスを実現。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト