TheoLeeCJ/SemIf
Semantic ifs from open models, on a 3090 at home. Independent; not affiliated with Jev or TypeSafe.
解決的問題
SemIf 為 AI 代理提供了一種更快、更高效的方法,用於做出小型、類型化的決策(例如請求路由或重試操作),而無需生成完整文字回應的開銷。與要求模型生成「是」或「否」並解析該文字不同,SemIf 直接從模型的內部狀態(logits)讀取特定選項的機率,從而消除了解碼迴圈或 JSON 修復的需要。
工作原理
SemIf 採用「決策原生」方法,將標準和選項一次性提供給模型。系統直接讀取原生選項 logits 來確定所提供選項的機率,而不是採樣 token。它還支援「共享狀態感知」,允許一次性預取一個長上下文(狀態),然後並行地在多個不同的決策標準之間分支,顯著提高吞吐量。
適用對象
需要基於非結構化狀態進行高速、結構化決策的 AI 代理開發者,以及希望在消費級硬體(如 RTX 3090)上使用開源模型(如 Qwen 或 MiniCPM)實現語義決策模式的開發者。
特點
- 直接讀取 logits: 完全跳過 token 生成,相比自回歸 JSON 生成,決策時間顯著加快。
- 共享狀態重用: 只需一次預取狀態,即可並行評估多個標準,大幅提高每秒決策數。
- 瀏覽器端執行: 包含 WebGPU 示範,允許使用者在瀏覽器中直接執行模型。
- 可審計的基準測試: 提供與 Jev 等封閉式服務在效能與準確性方面的全面對比結果。
相關
- 專案
- 專案
- 專案
- 專案