OpenClaw PR 트리아지를 위한 Hugging Face 로컬 모델
OpenClaw PR 트리아지를 위한 Hugging Face 로컬 모델
Hugging Face는 로컬 오픈-웨이트 모델을 사용해 OpenClaw 저장소에 실시간 알림 및 트리아지 시스템을 구현했습니다. Gemma 4와 Qwen 3.6 같은 모델을 에이전트 하네스에 배포함으로써, 비용이 많이 드는 폐쇄형 모델 API에 의존하지 않으면서도 배치 처리에 비해 실시간 응답성을 희생하지 않는 고처리량 이슈 및 풀 리퀘스트(PR) 분류를 달성했습니다.
에이전트 기반 분류 아키텍처
시스템은 "에이전트 기반 분류"를 활용합니다. 여기서는 모델이 단순히 프롬프트만 받는 것이 아니라, 구조화된 결과를 반환하기 전에 추가 컨텍스트를 적극적으로 탐색할 수 있습니다. 핵심 구성 요소는 다음과 같습니다:
- Agent Harness: 시스템은 Pi를 하네스로 사용하여 로컬 모델 엔드포인트를 호출합니다.
- Restricted Shell (reposhell): 악의적인 PR이나 이슈로부터 프롬프트 인젝션 공격을 방지하기 위해 에이전트는 전체 bash 접근 권한을 갖지 않습니다. 대신
reposhell을 사용하며, 이는 OpenClaw 저장소에 대해 읽기 전용 작업(ls,find,cat,grep등)만 허용하는 제한된 셸입니다. - Structured Output: 에이전트는 미리 정의된 카테고리 집합(예:
local_models,self_hosted_inference,agent_runtime)에 따라 최종 분류 라벨을 제출하기 위해final_json도구를 사용합니다.
오케스트레이션 파이프라인
GitHub 이벤트에서 Discord 알림까지의 워크플로는 속도와 자원 효율성을 극대화하기 위해 반-에이전트 경로를 따릅니다:
- Mirroring:
openclaw/gitcrawl은 저장소를 로컬에 미러링하고, 새로운 PR 및 이슈를 SQLite 데이터베이스로 정규화합니다. - Context Building: 워커는 제목, 본문, 라벨, diff 발췌를 포함하는 GitHub 컨텍스트 객체를 생성하여 모델이 직접 GitHub을 탐색할 필요성을 줄입니다.
- Inference:
localpager-agent가 프롬프트를 처리합니다. 에이전트는 최종 JSON 분류를 출력하기 전에 정확성을 높이기 위해reposhell을 사용해 코드베이스를 검사할 수 있습니다. - Notification: 결정론적 규칙에 따라 분류된 항목을 사용자 정의 알림 정책에 따라 Discord로 라우팅합니다.
모델 성능 및 벤치마크
테스트는 GPT-5.5와 Opus 4.8의 합의를 통해 라벨이 검증된 330행 평가 세트에서 수행되었습니다. 모델은 128GB 통합 메모리를 갖춘 NVIDIA GB10에서 실행되었습니다.
| 지표 | gemma-4-26b-a4b |
qwen3.6-35b-a3b |
DeepSeek-V4-Flash |
|---|---|---|---|
| 정밀도 | 0.716 ± 0.010 | 0.831 ± 0.007 | 0.938 |
| 재현율 | 0.905 ± 0.004 | 0.818 ± 0.006 | 0.714 |
| F1 | 0.800 ± 0.008 | 0.824 ± 0.002 | 0.811 |
| 정확히 일치 | 0.410 ± 0.014 | 0.540 ± 0.014 | 0.509 |
| 위양성 | 227.0 ± 10.5 | 105.7 ± 6.4 | 30 |
| 위음성 | 60.0 ± 2.6 | 115.3 ± 4.0 | 181 |
| 행당 실시간(초) | 1.41 ± 0.04 | 13.51 ± 0.79 | 144.14 |
| 출력 토큰/초 (총합) | 402.6 | 145.3 | 13 |
| 전체 파라미터 | 26B | 35B | 284B |
| 활성 파라미터 | 4B | 3B | 13B |
핵심 발견:
- Gemma 4 (26b-a4b): 가장 높은 재현율과 행당 가장 빠른 실시간을 보여주었습니다. vLLM과 NVFP4 양자화를 사용한 별도 테스트에서 초당 700개 이상의 총 출력 토큰을 달성했습니다.
- Qwen 3.6 (35b-a3b): Gemma보다 높은 정밀도와 더 적은 위양성을 제공했습니다.
- DeepSeek-V4-Flash: 가장 낮은 위양성 비율을 가지고 있지만, 크기와 낮은 처리량(초당 13 토큰) 때문에 지정된 하드웨어에서 실시간 로컬 실행에 비현실적이었습니다.
검증 및 실시간 감사
로컬 시스템을 검증하기 위해 Hugging Face는 OpenClaw를 통해 GPT-5.5를 사용하여 2시간마다 병렬 감사 루프를 실행합니다. 이 최신 모델은 로컬 모델이 생성한 위양성 및 위음성을 식별하는 판사 역할을 합니다. 이 감사 프로세스는 월 약 $9의 비용이 들며, 로컬 분류기가 신뢰성을 유지하도록 보정 메커니즘으로 작동합니다.
고처리량 트리아지에 대한 광범위한 시사점
이 구현은 중간 규모 로컬 모델이 충분한 정확도의 제로샷 분류를 수행하여 대량 필터링 작업에 대한 비용이 많이 드는 클라우드 API를 대체할 수 있음을 보여줍니다. 팀은 빠른 로컬 모델과 제한된 도구 접근을 결합한 이 “에이전트 기반 분류” 접근법을 뉴스 카테고리화, 고객 지원 티켓 트리아지, 콘텐츠 모더레이션 항소 등 다른 분야에도 적용할 수 있다고 제안합니다.