Fireworks AI Ember-1 출시

Ember-1은 추론 품질을 희생하지 않으면서 토큰 오버헤드를 줄입니다

Fireworks Research는 Kimi K3의 품질을 유지하면서 토큰 사용량을 35%에서 50%까지 줄이도록 설계된 특화 모델인 Ember-1을 출시했습니다. 이 모델은 특히 에이전트 워크로드와 자동화된 코딩에 최적화되어 있으며, 긴 추론 과정이 일반적으로 비용과 지연 시간을 증가시키는 다중 턴 상호작용에서 컨텍스트가 이차적으로 증가하는 문제를 해결합니다.

Ember-1은 추론 모델에서 발생하는 "과도한 생각(over-thinking)" 문제를 해결하기 위해 개발되었습니다. Kimi K3와 같은 모델은 생성된 토큰의 90% 이상을 내부 추론에 사용하는 경우가 많지만, Fireworks Research는 이러한 추론의 상당 부분이 중복된다는 사실을 발견했습니다. 모델이 더 효율적으로 작동하도록 학습시켜 중요한 자기 성찰과 오류 복구는 유지하면서 비생산적인 루프를 제거함으로써, Ember-1은 훨씬 적은 토큰으로도 비슷한 정확도를 달성합니다.

학습 방법론 및 인프라

Ember-1은 Fireworks Serverless Training을 사용하여 구축되었으며, 이를 통해 연구팀은 GPU 프로비저닝을 관리할 필요 없이 빠르게 반복 학습을 수행할 수 있었습니다. 개발 과정에는 50회 이상의 학습 실험과 200회의 평가가 포함되었습니다.

토큰 절감 효과가 다양한 워크로드 전반에 걸쳐 나타나도록 하기 위해, 모델은 다음과 같은 포괄적인 작업 모음으로 학습되었습니다:

  • 수학 및 코딩
  • 지시 사항 이행 및 대화
  • 검색 및 도구 사용
  • 소프트웨어 엔지니어링 (독립형 문제 및 확장된 상호작용 모두 포함)

학습은 작업 피드백에 의해 안내되는 온-폴리시(on-policy) 계획 및 학습에 중점을 두어, 모델이 과도한 추론으로 돌아가지 않고도 관찰 결과와 성과에 적응할 수 있도록 했습니다.

성능 벤치마크 및 파레토 프론티어

Fireworks는 Specialized Intelligence Index (SII) 및 여러 업계 벤치마크를 사용하여 Ember-1을 평가했습니다. 결과에 따르면 Ember-1은 여러 범주에서 비용과 성능 간의 최적 균형점인 새로운 파레토 프론티어를 확립했습니다:

Bedside Bench (임상 사례)

500개의 의사 검증 임상 사례로 구성된 Doximity의 Bedside Bench에서 Ember-1은 작업당 비용 측면에서 GPT-5.6 Sol, GPT-6 Astra, Claude Opus 5를 포함한 다른 모델들을 능가했습니다.

업계 코딩 벤치마크

Ember-1은 다양한 추론 노력 설정(낮음, 높음, 최대)에서 Kimi K3보다 우수한 성능을 보였습니다. 여러 사례에서 Ember-1은 비용을 절감하면서도 통과율을 향상시켰습니다:

벤치마크 K3 Max 통과율 Ember-1 통과율 K3 Max 대비 토큰/비용 절감
Terminal Bench 2.1 77.6% 80.9% -51.9% 토큰 / -$23.1 USD
SWE-bench Verified 86.0% 93.2% -15.5% 토큰 / -$68.1 USD
SWE-Interact 13.3% 21.3% -32.5% 토큰 / -$60.8 USD
DeepSWE 1.1 62.8% 66.4% -23.7% 토큰 / -$126.9 USD
τ-2 Bench Airline 64% 66% -5.9% 토큰 / -$0.3 USD

실제 검증 및 프로덕션 영향

고객 A/B 테스트

코딩 워크로드를 사용하는 두 고객과의 실제 프로덕션 테스트에서 Ember-1은 품질을 유지하면서 작업당 토큰 사용량을 약 35% 줄였습니다. 이는 작업 완료 및 성공률에 대한 다운스트림 지표를 개선하거나 안정적으로 유지하는 결과를 가져왔습니다.

내부 개발자 테스트

Fireworks는 자사 개발자들의 일상적인 코딩 작업에 Ember-1을 내부적으로 배포했습니다. 회사 측은 토큰 소비가 크게 줄었음에도 불구하고 개발자들이 품질 저하를 느끼지 못할 정도로 "눈에 띄지 않는" 롤아웃이었다고 보고했습니다.

커뮤니티 및 개발자 피드백

발표 이후 개발자 커뮤니티에서는 모델의 포지셔닝과 접근성에 대해 몇 가지 의견이 제기되었습니다:

  • 가격 우려: 일부 사용자는 모델이 더 적은 토큰을 사용하지만 토큰당 가격이 기본 Kimi K3 모델보다 높을 수 있어, 일부 사용자에게는 총 비용 절감 효과가 상쇄될 수 있다고 지적했습니다.
  • 가중치 접근성: Ember-1은 오픈 가중치를 기반으로 하지만 결과적으로 튜닝된 모델은 오픈 가중치로 공개되지 않기 때문에 모델의 "개방성"에 대한 논의가 있습니다.
  • Prefill vs. Decode: 일부 기술 비평가들은 에이전트 코딩에서 비용의 상당 부분이 디코드(출력)가 아닌 프리필(입력)에 있으며, Ember-1의 토큰 절감이 가장 효과적인 지점은 바로 그곳이라고 지적했습니다.

"K3를 실행하는 가장 비용 최적화된 방법은 더 적게 생각하게 만드는 것이 아니라, 효율적으로 생각하는 법을 배운 모델인 Ember-1을 실행하는 것입니다." — @handle

Ember-1은 현재 Fireworks Serverless에서 연구용 미리보기(Research Preview)로 제공됩니다.

Sources

관련