Gemma 4 E2B Hybrid:端裝置 LLMs 與信賴度基礎的雲端轉移
Gemma 4 E2B Hybrid:端裝置 LLMs 與信賴度基礎的雲端轉移
Cactus Compute 已推出 Gemma 4 E2B Hybrid,這是最小 Gemma 模型的後訓練版本,旨在發出其自身不確定性的訊號。透過在模型檢查點內部署內部探針,系統會將每個回應作為結構化資料分配一個介於 0 與 1 之間的信賴度分數,使開發者能夠將低信賴度的查詢路由至更大、更強大的雲端模型,同時在本地處理高信賴度的查詢。
混合路由效能
Gemma 4 E2B Hybrid 透過僅將一部分查詢路由至較大模型,即可在多個基準測試上匹配 Gemini 3.1 Flash-Lite 的效能。為匹配 Flash-Lite 效能所需的交換查詢百分比會隨著量化等級而變化:
| 基準測試 | 為匹配 Flash-Lite (FP16) 所需的交換 | 4-bit | 3-bit |
|---|---|---|---|
| ChartQA | 15–20% | 25–30% | 40–50% |
| MMBench | 30–35% | 40–45% | 50–55% |
| LibriSpeech | 25–30% | 35‐40% | 55–65% |
| GigaSpeech | 30–35% | 40–45% | 50–55% |
| MMAU | 30–35% | 35‐40% | 50–55% |
| MMLU-Pro | 45–55% | ~90% | n/a |
路由品質與模態獨立性
路由的準確度透過 AUROC(接收者操作特徵曲線下面積)來衡量,其中 1.0 表示正確與錯誤答案的完美分離。Gemma 4 E2B Hybrid 的平均 AUROC 為 0.814,顯著優於 token entropy(平均 0.549)。
值得注意的是,信賴度探針是在零音訊資料上進行訓練的,但在四個音訊基準測試上仍保持高 AUROC 分數(範圍從 0.789 到 0.876)。這表明該探針在模型的隱藏狀態中識別出與模態無關的正確性訊號,而非依賴訓練資料中的模式記憶。
| 保留集 | 模態 | Cactus Hybrid AUROC | Token Entropy AUROC |
|---|---|---|---|
| MMLU | 文字 MCQ | 0.770 | 0.697 |
| MMLU-Pro | 文字 MCQ | 0.771 | 0.692 |
| ARC-Easy | 文字 MCQ | 0.888 | 0.655 |
| ARC-Challenge | 文字 MCQ | 0.834 | 0.646 |
| GSM8K (3-shot) | 文字生成 | 0.782 | 0.731 |
| MMBench-EN-Dev | 視覺 MCQ | 0.840 | 0.435 |
| ChartQA | 視覺 QA | 0.779 | 0.615 |
| DocVQA | 視覺 QA | 0.781 | 0.512 |
| MMAU | 音訊 MCQ | 0.789 | 0.517 |
| GigaSpeech | 音訊 | 0.876 | 0.343 |
| Earnings-22 | 音訊 | 0.839 | 0.323 |
| LibriSpeech | 音訊 | 0.822 | 0.427 |
實作與整合
Cactus Hybrid 支援多種部署框架。對於 Transformers 使用者而言,一個關鍵的實作細節是使用顯式 .to(device) 呼叫載入模型,而不是使用 `device_map=