tiktoken-go/tokenizer
Pure Go implementation of OpenAI's tiktoken tokenizer
解決的問題
本專案提供 OpenAI 標記化器的純粹 Go 實作,讓 Go 開發者能將文字編碼與解碼為與 OpenAI 模型相容的標記。這消除了在處理 LLM 輸入文字時依賴外部相依性或 JavaScript 包裝器的需要。
工作原理
該函式庫將文字轉換為標記 ID(編碼),並將這些 ID 轉換回原始文字(解碼)。它將 OpenAI 的詞彙表作為 Go 映射內嵌,直接編譯至二進位檔中。這與 Python 版本的 tiktoken 不同,後者在執行時下載字典;透過在編譯時內嵌,該函式庫實現更快的啟動時間與效能。
適用對象
需要在不離開 Go 生態系統的情況下計算標記數量或為 OpenAI 模型準備文字的 Go 開發者。
主要特色
- 純 Go 實作:無外部 C 或 JavaScript 相依性。
- 支援多種編碼:支援
cl100k_base、o200k_base、r50k_base、p50k_base和p50k_edit編碼。 - 整合 CLI 工具:包含用於編碼、解碼和計算標記的命令列工具。
- 編譯時詞彙表:詞彙表以映射形式內嵌,提升效能與啟動速度。
相關
- 專案
- 專案
- 專案
- 專案
- 專案