Gemma 4 E2B Hybrid:端裝置 LLMs 與信賴度基礎的雲端轉移

Gemma 4 E2B Hybrid:端裝置 LLMs 與信賴度基礎的雲端轉移

Cactus Compute 已推出 Gemma 4 E2B Hybrid,這是最小 Gemma 模型的後訓練版本,旨在發出其自身不確定性的訊號。透過在模型檢查點內部署內部探針,系統會將每個回應作為結構化資料分配一個介於 0 與 1 之間的信賴度分數,使開發者能夠將低信賴度的查詢路由至更大、更強大的雲端模型,同時在本地處理高信賴度的查詢。

混合路由效能

Gemma 4 E2B Hybrid 透過僅將一部分查詢路由至較大模型,即可在多個基準測試上匹配 Gemini 3.1 Flash-Lite 的效能。為匹配 Flash-Lite 效能所需的交換查詢百分比會隨著量化等級而變化:

基準測試 為匹配 Flash-Lite (FP16) 所需的交換 4-bit 3-bit
ChartQA 15–20% 25–30% 40–50%
MMBench 30–35% 40–45% 50–55%
LibriSpeech 25–30% 35‐40% 55–65%
GigaSpeech 30–35% 40–45% 50–55%
MMAU 30–35% 35‐40% 50–55%
MMLU-Pro 45–55% ~90% n/a

路由品質與模態獨立性

路由的準確度透過 AUROC(接收者操作特徵曲線下面積)來衡量,其中 1.0 表示正確與錯誤答案的完美分離。Gemma 4 E2B Hybrid 的平均 AUROC 為 0.814,顯著優於 token entropy(平均 0.549)。

值得注意的是,信賴度探針是在零音訊資料上進行訓練的,但在四個音訊基準測試上仍保持高 AUROC 分數(範圍從 0.789 到 0.876)。這表明該探針在模型的隱藏狀態中識別出與模態無關的正確性訊號,而非依賴訓練資料中的模式記憶。

保留集 模態 Cactus Hybrid AUROC Token Entropy AUROC
MMLU 文字 MCQ 0.770 0.697
MMLU-Pro 文字 MCQ 0.771 0.692
ARC-Easy 文字 MCQ 0.888 0.655
ARC-Challenge 文字 MCQ 0.834 0.646
GSM8K (3-shot) 文字生成 0.782 0.731
MMBench-EN-Dev 視覺 MCQ 0.840 0.435
ChartQA 視覺 QA 0.779 0.615
DocVQA 視覺 QA 0.781 0.512
MMAU 音訊 MCQ 0.789 0.517
GigaSpeech 音訊 0.876 0.343
Earnings-22 音訊 0.839 0.323
LibriSpeech 音訊 0.822 0.427

實作與整合

Cactus Hybrid 支援多種部署框架。對於 Transformers 使用者而言,一個關鍵的實作細節是使用顯式 .to(device) 呼叫載入模型,而不是使用 `device_map=

Sources