OpenClaw PR 트리아지를 위한 Hugging Face 로컬 모델

OpenClaw PR 트리아지를 위한 Hugging Face 로컬 모델

Hugging Face는 로컬 오픈-웨이트 모델을 사용해 OpenClaw 저장소에 실시간 알림 및 트리아지 시스템을 구현했습니다. Gemma 4와 Qwen 3.6 같은 모델을 에이전트 하네스에 배포함으로써, 비용이 많이 드는 폐쇄형 모델 API에 의존하지 않으면서도 배치 처리에 비해 실시간 응답성을 희생하지 않는 고처리량 이슈 및 풀 리퀘스트(PR) 분류를 달성했습니다.

에이전트 기반 분류 아키텍처

시스템은 "에이전트 기반 분류"를 활용합니다. 여기서는 모델이 단순히 프롬프트만 받는 것이 아니라, 구조화된 결과를 반환하기 전에 추가 컨텍스트를 적극적으로 탐색할 수 있습니다. 핵심 구성 요소는 다음과 같습니다:

  • Agent Harness: 시스템은 Pi를 하네스로 사용하여 로컬 모델 엔드포인트를 호출합니다.
  • Restricted Shell (reposhell): 악의적인 PR이나 이슈로부터 프롬프트 인젝션 공격을 방지하기 위해 에이전트는 전체 bash 접근 권한을 갖지 않습니다. 대신 reposhell을 사용하며, 이는 OpenClaw 저장소에 대해 읽기 전용 작업(ls, find, cat, grep 등)만 허용하는 제한된 셸입니다.
  • Structured Output: 에이전트는 미리 정의된 카테고리 집합(예: local_models, self_hosted_inference, agent_runtime)에 따라 최종 분류 라벨을 제출하기 위해 final_json 도구를 사용합니다.

오케스트레이션 파이프라인

GitHub 이벤트에서 Discord 알림까지의 워크플로는 속도와 자원 효율성을 극대화하기 위해 반-에이전트 경로를 따릅니다:

  1. Mirroring: openclaw/gitcrawl은 저장소를 로컬에 미러링하고, 새로운 PR 및 이슈를 SQLite 데이터베이스로 정규화합니다.
  2. Context Building: 워커는 제목, 본문, 라벨, diff 발췌를 포함하는 GitHub 컨텍스트 객체를 생성하여 모델이 직접 GitHub을 탐색할 필요성을 줄입니다.
  3. Inference: localpager-agent가 프롬프트를 처리합니다. 에이전트는 최종 JSON 분류를 출력하기 전에 정확성을 높이기 위해 reposhell을 사용해 코드베이스를 검사할 수 있습니다.
  4. Notification: 결정론적 규칙에 따라 분류된 항목을 사용자 정의 알림 정책에 따라 Discord로 라우팅합니다.

모델 성능 및 벤치마크

테스트는 GPT-5.5와 Opus 4.8의 합의를 통해 라벨이 검증된 330행 평가 세트에서 수행되었습니다. 모델은 128GB 통합 메모리를 갖춘 NVIDIA GB10에서 실행되었습니다.

지표 gemma-4-26b-a4b qwen3.6-35b-a3b DeepSeek-V4-Flash
정밀도 0.716 ± 0.010 0.831 ± 0.007 0.938
재현율 0.905 ± 0.004 0.818 ± 0.006 0.714
F1 0.800 ± 0.008 0.824 ± 0.002 0.811
정확히 일치 0.410 ± 0.014 0.540 ± 0.014 0.509
위양성 227.0 ± 10.5 105.7 ± 6.4 30
위음성 60.0 ± 2.6 115.3 ± 4.0 181
행당 실시간(초) 1.41 ± 0.04 13.51 ± 0.79 144.14
출력 토큰/초 (총합) 402.6 145.3 13
전체 파라미터 26B 35B 284B
활성 파라미터 4B 3B 13B

핵심 발견:

  • Gemma 4 (26b-a4b): 가장 높은 재현율과 행당 가장 빠른 실시간을 보여주었습니다. vLLM과 NVFP4 양자화를 사용한 별도 테스트에서 초당 700개 이상의 총 출력 토큰을 달성했습니다.
  • Qwen 3.6 (35b-a3b): Gemma보다 높은 정밀도와 더 적은 위양성을 제공했습니다.
  • DeepSeek-V4-Flash: 가장 낮은 위양성 비율을 가지고 있지만, 크기와 낮은 처리량(초당 13 토큰) 때문에 지정된 하드웨어에서 실시간 로컬 실행에 비현실적이었습니다.

검증 및 실시간 감사

로컬 시스템을 검증하기 위해 Hugging Face는 OpenClaw를 통해 GPT-5.5를 사용하여 2시간마다 병렬 감사 루프를 실행합니다. 이 최신 모델은 로컬 모델이 생성한 위양성 및 위음성을 식별하는 판사 역할을 합니다. 이 감사 프로세스는 월 약 $9의 비용이 들며, 로컬 분류기가 신뢰성을 유지하도록 보정 메커니즘으로 작동합니다.

고처리량 트리아지에 대한 광범위한 시사점

이 구현은 중간 규모 로컬 모델이 충분한 정확도의 제로샷 분류를 수행하여 대량 필터링 작업에 대한 비용이 많이 드는 클라우드 API를 대체할 수 있음을 보여줍니다. 팀은 빠른 로컬 모델과 제한된 도구 접근을 결합한 이 “에이전트 기반 분류” 접근법을 뉴스 카테고리화, 고객 지원 티켓 트리아지, 콘텐츠 모더레이션 항소 등 다른 분야에도 적용할 수 있다고 제안합니다.

Sources