# Gemma 4 E2B Hybrid: 신뢰도 기반 클라우드 핸드오프를 갖춘 온-디바이스 LLM

Gemma 4 E2B Hybrid: 신뢰도 기반 클라우드 핸드오프를 갖춘 온-디바이스 LLM

Cactus Compute는 모든 답변에 신뢰도 점수를 제공하는 사후 훈련된 모델인 Gemma 4 E2B Hybrid를 출시하여, 온-디바이스 실행과 클라우드 기반의 더 큰 모델 간의 효율적인 라우팅을 가능하게 합니다.

하이브리드 라우팅 성능

Gemma 4 E2B Hybrid은 더 큰 모델로만 일부 쿼리를 라우팅하여 여러 벤치마크에서 Gemini 3.1 Flash-Lite의 성능과匹配할 수 있습니다. Flash-Lite 성능과匹配하기 위해 핸드오프가 필요한 쿼리의 비율은 양자화 수준에 따라 다릅니다:

Benchmark Handoff to match Flash-Lite (FP16) At 4-bit At 3-bit
ChartQA 15–20% 25–30% 40–50%
MMBench 30–35% 40–45% 50–55%
LibriSpeech 25–30% 35‐40% 55–65%
GigaSpeech 30–35% 40–45% 50–55%
MMAU 30–35% 35‐40% 50–55%
MMLU-Pro 45–55% ~90% n/a

라우팅 품질 및 모달리티 독립성

라우팅의 정확도는 AUROC(수신자 작동 특성 곡선 아래 영역)로 측정되며, 1.0은 정답과 오답의 완벽한 분리를 나타냅니다. Gemma 4 E2B Hybrid는 평균 AUROC 0.814를 달성하여 토큰 엔트로피(평균 0.549)를 znacz하게 능가합니다.

주목할 점은, 신뢰도 프로브가 오디오 데이터 없이 훈련되었음에도 불구하고 네 개의 오디오 벤치마크에서 높은 AUROC 점수(0.789에서 0.876 사이)를 유지했다는 것입니다. 이는 프로브가 훈련 데이터에서의 패턴 암기에 의존하는 것이 아니라 모델의 숨은 상태 내에 있는 모달리티에 독립적인 정확성 신호를 식별한다는 것을 나타냅니다.

Hold-out Modality Cactus Hybrid AUROC Token Entropy AUROC
MMLU 텍스트 다중 선택 0.770 0.697
MMLU-Pro 텍스트 다중 선택 0.771 0.692
ARC-Easy 텍스트 다중 선택 0.888 0.655
ARC-Challenge 텍스트 다중 선택 0.834 0.646
GSM8K (3-shot) 텍스트 생성 0.782 0.731
MMBench-EN-Dev 비전 다중 선택 0.840 0.435
ChartQA 비전 QA 0.779 0.615
DocVQA 비전 QA 0.781 0.512
MMAU 오디오 다중 선택 0.789 0.517
GigaSpeech 오디오 0.876 0.343
Earnings-22 오디오 0.839 0.323
LibriSpeech 오디오 0.822 0.427

구현 및 통합

Cactus Hybrid는 여러 배포 프레임워크를 지원합니다. Transformers 사용자를 위한 중요한 구현 세부 사항은 device_map="auto" 대신 명시적인 .to(device) 호출로 모델을 로드하는 것입니다.这是因为 probe가 표준 forward() 경로 외부에서 생성 점수를 읽기 때문입니다.

Cactus 바인딩

Using the cactus-compute library, developers can initialize the model and retrieve the confidence score directly from the result object:

from cactus.bindings.cactus import cactus_complete, cactus_init
from cactus.cli.download import download_bundle

lm = cactus_init(str(download_bundle("Cactus-Compute/gemma-4-E2B-it\nresult = cactus_complete(
    lm,
    [{"role": "user", "content": "What is the capital of France?"}],
    json.dumps({"max_tokens": 512, "auto_handoff": False}),
    None,
    lambda *_: None,
)
print(result["confidence

MLX

For MLX, the model is loaded with trust_remote_code=True. The confidence score is accessible via model.last_confidence:

model, tokenizer = load(
    "Cactus-Compute/gemma-4-e2b-it-hybrid-mlx",
    tokenizer_config={"trust_remote_code": True},
)
# ... generation logic ...
print(model.last_confidence)

llama.cpp

Integration with llama.cpp requires a custom patch to be compiled into the engine to enable the confidence field in the API response.

커뮤니티 토론

출시 주변의 기술적 토론은 LLM에서의 '자기 인식'의 성격에 초점을 맞췄습니다. 일부 사용자는 모델이 자신이 틀렸다고 '알지' 못하며 오히려 불확실성이나 일관성 부족을 신호로 보낸다고 주장하며 용어를 cuestion했습니다.

당신은 틀렸을 때를 알 수 없습니다. 당신은 확신하지 못하거나 일관되지 않을 때만 알 수 있습니다. 당신은 완전히 확신하고도 틀릴 수 있으며, 불확실하고도 맞을 수 있습니다.

다른 기여자들은 숨은 상태에서 코드 품질(예: 'clean' 대 'crufty')이나 기타 활성화 조향 개념과 같은 다른 신호를 추출할 수 있는 가능성을 탐구했습니다.

Sources