cltk/cltk
The Classical Language Toolkit
解決的問題
CLTK 提供專為前現代與歷史語言設計的自然語言處理(NLP)工具,這些語言通常具有與現代語言不同的語言特徵與研究目標。它彌補了大多數標準 NLP 軟體皆以現代語言為設計基礎的缺口。
工作原理
該工具包使用模組化處理流程,允許使用者在不同後端之間選擇以進行語言註解。它支援多種後端,包括:
- GenAI/LLMs:支援 OpenAI(雲端)與 Ollama(本地 LLM,如 Llama 3.1 或 Qwen 2.5)。
- 判別式 NLP:支援 Stanford Stanza。
使用者可指定語言(例如 lati1261 表示拉丁語),並選擇後端來執行 NLP 任務。
適用對象
需要標準化、基於 Python 的框架來分析歷史文本的前現代語言研究者與學者。
主要亮點
- 多後端支援:與 LLM(OpenAI、Ollama)和傳統 NLP 工具(Stanza)整合。
- 模組化流程:在演算法多樣性與預設設定之間取得平衡。
- 廣泛的語言支援:為近 20 種語言提供流程與模型。
- 本地 LLM 整合:透過 Ollama 使用本地模型,確保資料隱私或離線存取。
相關
- 專案
- 專案
- 專案
- 專案
- 專案