Cerebras Inference: Qwen 3.8 27B Deployment and Performance

Cerebras는 모델 카탈로그를 Qwen 3.8 27B로 확장하여 초당 약 1,500 토큰의 추론 속도를 달성했습니다. 이 배포는 Cerebras의 특화된 하드웨어를 활용하여 모델의 unpruned 버전에 대한 고처리량 액세스를 제공하며, 에이전트 워크플로우나 콘텐츠 생성에 즉각적인 출력을 필요로 하는 사용자를 대상으로 합니다.

Model Specifications and Availability

Qwen 3.8 27B는 현재 Cerebras 공개 엔드포인트에서 무료 체험 및 종량제(pay-as-you-go) 티어로 이용 가능합니다. 플랫폼에서의 모델 기술 파라미터는 다음과 같습니다:

  • Model ID: qwen-3.8-27b
  • Parameters: 27 billion
  • Context Window: 무료 티어 사용자는 64k, 유료 사용자는 128k입니다.
  • Performance: 초당 약 1,500 토큰.

Cerebras는 또한 OpenAI GPT OSS (gpt-oss-120b)를 호스팅하며, 이는 최대 131k 토큰의 컨텍스트 윈도우와 함께 초당 약 3,000 토큰으로 작동합니다.

Hardware-Optimized Model Compression

Cerebras는 아키텍처의 무결성을 보장하기 위해 공개 엔드포인트에서 원본 unpruned 모델을 제공하는 정책을 유지합니다. 회사는 Router-weighted Expert Activation Pruning (REAP)에 대한 연구를 수행하고 있지만, 이러한 pruned 모델은 Hugging Face를 통해 연구 커뮤니티를 위해 예약되어 있으며 프로덕션 API를 통해서는 제공되지 않습니다.

품질을 희생하지 않으면서 저장 공간을 최적화하기 위해, Cerebras는 선택적 weight-only quantization을 사용합니다. 가중치는 레이어의 민감도에 따라 16-bit, 8-bit 또는 4-bit 형식으로 저장됩니다. 민감한 레이어는 전체 정밀도로 유지되며 실행 중에 dequantized됩니다. 모든 activation, attention mechanism, KV cache는 양자화되지 않고 전체 정밀도로 유지됩니다.

User Performance and Cost Analysis

원시(raw) 토큰/초(t/s) 속도는 높지만, 커뮤니티 피드백은 프로덕션 사용을 위한 몇 가지 실질적인 병목 현상과 비용 고려 사항을 강조합니다:

Rate Limits and Throughput

사용자들은 공개 엔드포인트의 속도 제한(예: 분당 150k에서 450k 토큰)이 코딩 작업 및 에이전트 워크플로우의 상당한 차단 요소가 될 수 있다고 보고했습니다. 캐시된 토큰도 이러한 제한에 포함되므로, 사용자는 긴 세션 동안 할당량을 빠르게 소진할 수 있습니다.

Cost vs. Speed Trade-off

비교 테스트 결과, Cerebras는 다른 제공업체보다 훨씬 빠르지만 더 비쌉니다. 한 사용자 보고에 따르면, Cerebras에서의 세션은 OpenRouter 평균보다 2.8배 빠르지만 5.6배 더 비쌌는데, 이는 주로 Cerebras가 현재 캐시된 토큰에 대한 가격 할인을 제공하지 않기 때문입니다.

Utility in Software Development

모델의 코딩 유용성에 대한 피드백은 엇갈립니다. 출력 속도가 "awesome"하다고 설명되지만, 일부 사용자는 도구 호출(tool calling)의 신뢰성, 쉘 명령 실행, 그리고 출력을 읽어야 하는 인간의 필요성 등 다른 병목 현상들이 원시 추론 속도를 상쇄하기 때문에 개발 속도의 순이익이 미미하다고 주장합니다.

"The net effect is that I spend about the same time waiting... at least for coding, it actually reconciles me with the 100-200t/sec you can get on DS4 or the like."

Comparison with Local Inference

일부 개발자들은 27B 파라미터 모델의 경우 로컬 추론이 실행 가능한 대안이 될 수 있다고 제안합니다. ninfer와 같은 도구를 사용하여, 사용자들은 RTX 5090과 같은 하드웨어에서 초당 200-400 토큰을 달성했다고 보고했습니다. 이는 API 속도 제한이나 반복적인 비용 없이 많은 사용 사례에 충분할 수 있습니다

Sources

관련