tiktoken-go/tokenizer

Pure Go implementation of OpenAI's tiktoken tokenizer

解决的问题

该项目提供了 OpenAI 令牌化器的纯 Go 实现,使 Go 开发者能够将文本编码和解码为与 OpenAI 模型兼容的标记。这消除了在处理 LLM 输入文本时依赖外部依赖或 JavaScript 包装器的需要。

工作原理

该库将文本转换为标记 ID(编码),并将这些 ID 转换回原始文本(解码)。它将 OpenAI 的词汇表作为 Go 映射嵌入,直接编译到二进制文件中。这与 Python 版本的 tiktoken 不同,后者在运行时下载字典;通过在编译时嵌入,该库实现了更快的启动时间和性能。

适用人群

需要在不离开 Go 生态系统的情况下计算标记数量或为 OpenAI 模型准备文本的 Go 开发者。

主要亮点

  • 纯 Go 实现:无外部 C 或 JavaScript 依赖。
  • 支持多种编码:支持 cl100k_baseo200k_baser50k_basep50k_basep50k_edit 编码。
  • 集成 CLI 工具:包含用于编码、解码和计算标记的命令行工具。
  • 编译时词汇表:词汇表以映射形式嵌入,提升性能和启动速度。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目