Cloudflare Clef 결정 모델: 오픈소스, 비전 기능 지원, RL로 미세조정 가능한 모델
TL;DR
Clef와 Clef-flash는 Cloudflare가 훈련한 오픈소스 결정 모델로, Typesafe의 Jev보다 Jev 결정 지수에서 우수한 성능을 보이며, 최대 10배 빠르게 작동하고 이미지 입력을 지원하며, 새로운 RL 기반 서비스를 통해 미세조정이 가능합니다.
결정 모델이란 무엇인가요?
결정 모델은 구조화된 입력(예: 고객 지원 티켓, URL)을 받아 관련 확률이 부여된 타입화된 분류 결과를 반환합니다. 이 출력은 코드에서 직접 사용되어 티켓 라우팅, 업그레이드 트리거, 또는 인간의 개입을 유도할 수 있습니다. 일반 목적의 LLM과 달리, 결정 모델은 결정적인 결과를 보이는 제한된 출력과 낮은 지연 시간을 위해 설계되었습니다.
"결정 모델은 특정 확률을 기반으로 에이전트가 어떻게 행동할지 결정하는 데 도움을 주는 분류를 수행합니다." – Cloudflare 블로그
Cloudflare에서의 예시 사용 사례
- 입력: Browser Run을 통해 가져온 웹사이트 도메인.
- 출력: 95% 패션, 85% 전자상거래, <1% 피싱과 같은 확률.
- 지연 시간: 동일한 워크플로우에서 가장 빠른 LLM(gpt-oss-120b)보다 2.2초 대비 4.7초.
Clef가 다른 결정 모델과 다른 점
| 기능 | Clef | Clef-flash | Jev (Typesafe) |
|---|---|---|---|
| 기본 모델 | Qwen-3.8-27B (고정) | Qwen-3.8-9B (고정) | 비공개 |
| 비전 인코더 | ✅ (이미지 분류) | ✅ | ❌ |
| 컨텍스트 창 크기 | 64k 토큰 | 64k 토큰 | 32k 토큰 |
| 지연 시간(중앙값) | 209ms | 38.8ms | 524ms |
| p95 지연 시간 | 238ms | 122ms | 536ms |
| 벤치마크 리더 | 43개 평가에서 Jev 결정 지수 최고 점수 | 속도 중심 작업에서 거의 최첨단 성능 | 경쟁력 있지만 일반적으로 낮음 |
Clef의 비전 인코더는 Jev가 부족한 시각 콘텐츠 분류 기능을 제공하는 최초의 비생성형 결정 모델입니다. 더 큰 컨텍스트 창은 사용자가 더 많은 상태 정보(예: 긴 로그)를 자르지 않고 제공할 수 있게 해줍니다.
벤치마크 성능
Clef는 공개된 Jev 결정 지수 리더보드에서 선두를 달리고 있습니다. 선택된 점수(높을수록 좋음):
- BFCL 케이스 정확도 – 98.47% (Clef) vs 95.75% (Jev)
- API-Bank 정확도 – 93.11% vs 88.19%
- BANKING77 마크로-F1 – 94.20% vs 79.74%
Typesafe 워크플로우 세트에서 Clef-flash는 송장 처리(64.7% vs 61.8%)와 에이전트 트레이스 관측성(71.6% vs 68.5%)에서 Jev를 능가합니다.
"이 모델들은 더 지능적이고 빠르며, 완전히 Jev-API 호환되기 때문에 이러한 호스팅 모델을 쉽게 실험할 수 있습니다." – Cloudflare 블로그
속도를 가능하게 하는 아키텍처
- 이단계 주의력 라우팅 – 모델은 먼저 Qwen의 프리필 전용 단계를 실행한 후, 각 스키마 선택을 병렬로 평가합니다. 자동 회귀 토큰 생성이 필요하지 않습니다.
- 옵션별 증거 추출 – 각 가능한 답변은 관련 컨텍스트를 추출하고, 다른 필드와 교차 주의를 수행한 후 최종적으로 확률 점수를 받습니다.
- 저랭크 어댑터 – 고정된 Qwen 가중치 위에 랭크-256 어댑터를 훈련하여, 전체 모델 미세조정 없이도 빠른 후처리 훈련이 가능합니다.
- 손실 함수 – 정확한 스키마 출력을 위한 레이블 스무딩 크로스엔트로피와 보정된 확률을 위한 브라이어 손실을 결합합니다.
- 보정된 결정을 위한 강화학습(RLCD) – 근접 실패에 대해 부분적인 점수를 부여하고, 분포 이동을 처벌하며 정확도와 보정도를 모두 향상시킵니다.
비자동 회귀 설계는 토큰 단위 생성의 병목 현상을 제거하여, 유사한 LLM 기반 분류기보다 최대 10배 낮은 지연 시간을 제공합니다.
Workers AI에서 호스팅
Clef 모델은 Workers AI를 통해 Cloudflare의 엣지 GPU에 배포되어 다음과 같은 이점을 제공합니다:
- 밀리초 미만의 네트워크 라운드트립 시간.
- 요청 처리의 핫 패스에 모델을 배치할 수 있습니다.
- Jev 스키마와 호환되는 간단한 HTTP API.
예시 curl 요청 (개요):
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": { ... }
}'
오픈소스 릴리스
- 저장소: https://huggingface.co/Cloudflare/clef (Apache 2.0)
- Clef와 Clef-flash 모두에 대한 가중치가 제공됩니다.
- 데이터와 훈련 파이프라인은 공개되지 않음; 오직 최종 모델 가중치만 허용되는 라이선스로 공개됩니다.
"오픈소스 가중치, 오픈소스는 아님. 가중치는 허용되는 라이선스로 제공되지만, 데이터와 훈련 파이프라인은 공개되지 않아 그 비공개 Qwen 기반에서 재현할 수 없습니다." – HN 댓글, buildbuildbuild
RL 서비스를 통한 미세조정
Cloudflare는 고객이 Clef를 도메인 특화 작업(예: 신뢰 및 안전성 트리지, 봇 분류)에 맞게 적응시킬 수 있도록 강화학습 기반 미세조정 플랫폼을 도입했습니다. 이 워크플로우는 기존 Cloudflare 기반 기능을 활용합니다:
- AI 게이트웨이 – 요청/응답 쌍을 수집하여 데이터셋을 구축합니다.
- Workers AI – 기본 Clef 모델에 대해 롤아웃을 생성합니다.
- 컨테이너 – 점수 매기기와 재생을 위한 RL 샌드박스를 제공합니다.
- 트레이너 – RLCD 목적을 사용하여 모델 가중치를 업데이트합니다.
- BYO 모델 배포 – 미세조정된 모델을 Workers AI에 다시 배포합니다.
이 서비스는 초기에 손수 파트너 제공 형태로 Forward-Deployed Engineer(FDE) 팀과 함께 제공되며, 나중에는 자가 서비스 플랫폼이 계획되어 있습니다.
Hacker News 커뮤니티 반응
| 댓글 주제 | 대표적 인용문 |
|---|---|
| 성능 대 비용 | "가격은 입력 토큰당 $0.24, Jev보다 약 6배 높습니다. Clef-flash는 $0.09/M로 더 경쟁력 있습니다." – ssiddharth |
| 오픈소스 우려 | "오픈 가중치, 오픈소스는 아님. 데이터와 훈련 파이프라인은 공개되지 않았습니다." – buildbuildbuild |
| 비전 기능 | "이미지 입력이 가능합니다. 멋지네요!" – swingboy |
| 속도 대 정확도 트레이드오프 | "Clef-flash는 더 빠르지만 때때로 과도하게 업그레이드합니다; Clef는 더 정확하지만 느립니다." – agrippanux |
| 실제 활용성 | "Clef가 도메인 분류를 2초 안에 결정할 수 있다면, 분류되지 않은 사이트에 대해 고객 지원 티켓을 제출할 필요가 없습니다." – johnbatch |
| 신선함에 대한 회의론 | "Jev 출시 후 며칠 안에 많은 팀이 결정 모델을 구축했죠. 개념이 이미 성숙했는가요?" – warkdarrior |
| 보정에 대한 의심 | "보정에 대한 언급이 없습니다. 그냥 또 다른 LLM 미세조정일 뿐인가요?" – zwaps |
전반적으로 오픈소스 릴리스와 속도 향상에 대해 긍정적인 반응이지만, 리뷰어들은 더 높은 가격, 재현 가능한 훈련 파이프라인 부족, 그리고 생산 수준의 정확도에 도달하기 위해 미세조정이 필요하다는 점을 지적합니다.
Clef와 전체 LLM 중 선택할 때
- Clef 사용은 다음의 경우에 적합합니다:
- 구조화되고 확률 기반의 결정이 필요할 때.
- 엣지 위치에서 200ms 미만의 낮은 지연 시간이 필요할 때.
- 비전 기능 지원 분류가 필요할 때.
- 하류 자동화를 위한 결정적인 결과가 필요할 때.
- 생성형 LLM 사용은 다음의 경우에 적합합니다:
- 자유 형식의 텍스트 생성, 추론, 도구 호출 오케스트레이션 필요할 때.
- 복잡한 다단계 대화가 필요할 때.
- 몇 밀리초의 오버헤드가 수용 가능한 상황일 때.
시작하기
- 호스팅 엔드포인트 사용해 보기 – 위의 API 예제를 따르세요.
- 가중치 다운로드하기 –
git clone https://huggingface.co/Cloudflare/clef. - 로컬에서 실행하기 – 표준
transformers또는vLLM파이프라인을 사용하세요 (모델은 Jev 호환 스키마를 기대합니다). - 실시간 벤치마크 데모 탐색하기 – https://clef-evals.workers-ai-mle.workers.dev/.
- 미세조정을 위해 Cloudflare에 문의하기 – 블로그 포스트에 링크된 관심 양식을 작성하세요.
미래 전망
Clef는 결정 중심 모델이 고품질이면서 동시에 엣지 대응 가능하다는 것을 보여주며, 무거운 LLM과 전통적인 분류기 사이에 새로운 위치를 차지하고 있습니다. 곧 출시될 자가 서비스 RL 미세조정 플랫폼은 기업이 자체 도메인에 맞게 모델을 맞춤화할 수 있도록 하여 Cloudflare 인프라를 벗어나지 않고도 채택을 가속화할 수 있을 것입니다.
만약 시각 입력이 포함된 빠르고 구조화된 결정이 필요한 에이전트 워크플로우를 구축하고 있다면, Clef와 Clef-flash는 Jev와 일반적인 LLM에 대한 매력적인 오픈소스 대안을 제공합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch