cltk/cltk

The Classical Language Toolkit

解決的問題

CLTK 提供專為前現代與歷史語言設計的自然語言處理(NLP)工具,這些語言通常具有與現代語言不同的語言特徵與研究目標。它彌補了大多數標準 NLP 軟體皆以現代語言為設計基礎的缺口。

工作原理

該工具包使用模組化處理流程,允許使用者在不同後端之間選擇以進行語言註解。它支援多種後端,包括:

  • GenAI/LLMs:支援 OpenAI(雲端)與 Ollama(本地 LLM,如 Llama 3.1 或 Qwen 2.5)。
  • 判別式 NLP:支援 Stanford Stanza。

使用者可指定語言(例如 lati1261 表示拉丁語),並選擇後端來執行 NLP 任務。

適用對象

需要標準化、基於 Python 的框架來分析歷史文本的前現代語言研究者與學者。

主要亮點

  • 多後端支援:與 LLM(OpenAI、Ollama)和傳統 NLP 工具(Stanza)整合。
  • 模組化流程:在演算法多樣性與預設設定之間取得平衡。
  • 廣泛的語言支援:為近 20 種語言提供流程與模型。
  • 本地 LLM 整合:透過 Ollama 使用本地模型,確保資料隱私或離線存取。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案