Ollama Minions: 本地與雲端 LLM 混合協作

來自 Stanford Hazy Research 的研究人員與其他專家合作,開發了一種將大部分 LLM 工作負載從雲端轉移到消費級設備的方法。透過讓小型裝置端模型(例如透過 Ollama 運行的 Llama 3.2)與較大的雲端模型(例如 GPT-4o)進行協作,該框架在對輸出品質影響極小的情況下,降低了遠端運作成本。

混合 LLM 協定:Minion 與 MinionS

該框架引入了兩種不同的協定配置,旨在優化成本降低與效能維持之間的平衡。

Minion 協定

Minion 協定允許雲端模型與一個具有數據存取權限的單一本地模型進行自由對話。這種迭代式通訊會持續進行,直到兩個模型達成解決方案。

  • 成本效率:實現了 30.4 倍的遠端成本降低。
  • 效能:維持了雲端模型原始效能的 87%。

MinionS 協定

在 MinionS 協定中,雲端模型會將複雜任務分解為細小的子任務。接著,這些子任務會由在上下文區塊上運行的輕量級 LLM 並行執行。

  • 成本效率:實現了 5.7 倍的遠端成本降低。
  • 效能:維持了雲端模型效能的 97.9%。

技術實作與設定

Minions 框架是一個開源專案。實作需要一個本地 LLM 執行器(Ollama)和一個雲端 LLM API(OpenAI)。

安裝

若要設定環境,使用者可以複製該儲存庫並安裝依賴項目:

git clone https://github.com/HazyResearch/minions.git 
cd minions
pip install -e .

本地與雲端需求

  • 本地模型:必須安裝 Ollama 並在本地拉取模型,例如 llama3.2 (ollama pull llama3.2)。
  • 雲端模型:需要 OpenAI API 金鑰以介接如 gpt-4o 等模型。

程式化使用

minions Python 套件允許以程式化方式執行這兩種協定。

對於 Minion 協定,會使用 OllamaClientOpenAIClient 來實例化 Minion 類別。該過程涉及將任務與上下文傳遞給 minion 物件,並指定最大通訊輪次。

對於 MinionS 協定,則使用 Minions 類別。此配置支援透過 Pydantic 模型進行結構化輸出(例如,定義 explanationcitationanswer 綱要),讓雲端模型能夠在本地模型上編排並行子任務。

Sources

相關

  • Dispatch
  • Dispatch
  • 專案
  • Dispatch
  • Dispatch