cltk/cltk

The Classical Language Toolkit

解决的问题

CLTK 提供专为前现代和历史语言设计的自然语言处理(NLP)工具,这些语言通常具有与现代语言不同的语言特征和研究目标。它填补了大多数标准 NLP 软件均面向现代语言这一空白。

工作原理

该工具包使用模块化处理流水线,允许用户在不同后端之间选择以进行语言注释。它支持多种后端,包括:

  • GenAI/LLMs:支持 OpenAI(基于云)和 Ollama(本地 LLM,如 Llama 3.1 或 Qwen 2.5)。
  • 判别式 NLP:支持 Stanford Stanza。

用户可以指定语言(例如 lati1261 表示拉丁语),并选择后端来执行 NLP 任务。

适用人群

需要标准化、基于 Python 的框架来分析历史文本的前现代语言研究者和学者。

主要亮点

  • 多后端支持:与 LLM(OpenAI、Ollama)和传统 NLP 工具(Stanza)集成。
  • 模块化流水线:在算法多样性与预配置默认值之间取得平衡。
  • 广泛的语言支持:为近 20 种语言提供流水线和模型。
  • 本地 LLM 集成:通过 Ollama 使用本地模型,确保数据隐私或离线访问。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目