OpenAI, 자체 추론 칩 Jalapeño 및 풀스택 전략 발표

TL;DR

OpenAI는 첫 번째 자체 추론 칩인 Jalapeño를 발표했습니다. 이 칩은 InferenceX 벤치마크에서 경쟁 상용 시스템들보다 킬로와트당 더 높은 피크 처리량과 더 낮은 토큰 지연 시간을 달성했습니다. 또한 데이터 센터 하드웨어, 칩, 모델, 소프트웨어 및 제품을 긴밀하게 결합하여 성능, 효율성 및 경제적 가치를 극대화하는 전체적인 컴퓨팅 스택을 설명했습니다.

통합 컴퓨팅 스택

OpenAI의 컴퓨팅 전략은 데이터 센터 하드웨어, 자체 칩, 프론티어 모델, 개발자 플랫폼, 소비자 및 기업용 제품, AI 네이티브 기기에 이르는 단일 통합 시스템으로 제시됩니다. 각 계층은 서로를 강화하도록 설계되었습니다. 더 나은 소프트웨어는 하드웨어에서 더 많은 성능을 끌어내고, 특화된 하드웨어는 모델 추론을 가속화하며, 더 강력한 모델은 더 풍부한 제품을 가능하게 하여 추가적인 사용 신호를 생성하고, 이는 차례로 시스템 개선을 위한 지침이 됩니다.

Jalapeño 칩 성능

  • 벤치마크 결과: GPT‑OSS 120B를 사용한 공개 InferenceX 벤치마크에서 Jalapeño는 비교에 포함된 상용 시스템들보다 킬로와트당 더 높은 피크 처리량과 더 낮은 토큰 지연 시간을 제공했습니다.
  • 교차 모델 견고성: 이 칩은 DeepSeek R1 및 Kimi K2에서도 강력한 성능을 보였으며, 이는 효율성 향상이 단일 모델 계열에 국한되지 않음을 나타냅니다.
  • 전략적 영향: 실리콘을 직접 보유함으로써 OpenAI는 모델 실행 및 서빙 경제학에 대한 더 큰 통제권을 확보하여, 처리량, 지연 시간, 에너지 효율성 및 비용을 동시에 개선할 수 있습니다.

"Jalapeño는 우리 모델이 실행되는 방식과 이를 서빙하는 경제성에 대한 더 큰 통제권을 제공합니다." – OpenAI

폭 우선, 레버리지 우선 설계

OpenAI는 프론티어 훈련, 대용량 추론, 상시 실행 에이전트 등 다양한 워크로드 요구 사항을 해결할 수 있는 포트폴리오 구축을 강조합니다. 이러한 각 요구 사항은 칩, 소프트웨어, 네트워킹, 전력 및 지연 시간에서 서로 다른 트레이드오프를 요구합니다. 회사는 선택권을 유지하고 각 워크로드에 대해 가장 높은 가성비(성능 대비 비용) 옵션을 활용하기 위해 여러 하드웨어 및 클라우드 제공업체(Microsoft, NVIDIA, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy, SoftBank)와의 관계를 유지하고 있습니다.

  • 파레토 프론티어 중점: 기능, 속도, 안정성, 효율성 및 비용의 최적 조합을 지속적으로 추구합니다.
  • 하이브리드 접근 방식: 순수 기능이 가장 중요한 곳에는 프리미엄 시스템을 사용하고, 규모와 비용이 지배적인 곳에서는 효율성에 맞게 최적화합니다.
  • 공동 설계 이점: 하드웨어와 소프트웨어 통합에 대한 직접적인 통제는 기성품 구성 요소만으로는 달성할 수 없는 시스템 전반의 이득을 창출합니다.

데이터 센터 레버리지: 프로젝트 카멜리아

OpenAI는 조지아주의 프로젝트 카멜리아를 특정 고객 워크로드에 맞춰 데이터 센터 시설을 설계하면서 지역 사회에 혜택을 제공하는 사례로 강조했습니다:

  • 일자리 창출 및 지역 비즈니스 지원.
  • 인프라 및 에너지 비용 지원.
  • 폐쇄 회로 물 절약.
  • 약속에 대한 연례 독립적인 공개 감사.

효율성을 경제적 가치로 전환

OpenAI는 컴퓨팅 단위당 생산되는 유용한 지능의 양으로 스택의 가치를 측정합니다. 주요 메커니즘은 다음과 같습니다:

  • 모델 개선: 더 나은 모델은 더 적은 시도로 정답에 도달합니다.
  • 소프트웨어 최적화: 더 스마트한 라우팅 및 컨텍스트 관리로 불필요한 작업을 줄입니다.
  • 목적에 맞게 구축된 하드웨어: 속도와 에너지 효율성을 향상시킵니다.

Artificial Analysis Coding Agent Index에서 최대 추론 기능을 사용한 GPT‑5.6 Sol은 선도적인 경쟁사보다 54% 적은 출력 토큰을 사용하면서 새로운 최고치를 기록했으며, 이는 고객에게 더 빠른 결과, 더 높은 안정성, 더 긴 워크플로우 완료, 더 낮은 총비용으로 이어집니다.

OpenAI는 제번스 역설을 언급합니다. 효율성이 높아짐에 따라 더 많은 작업이 경제적으로 실행 가능해지며, AI 소비를 확장하고 새로운 경제 활동을 창출하게 됩니다.

복리식 이점

통합 스택은 피드백 루프를 생성합니다:

  1. 생산성 향상은 컴퓨팅 비용을 낮춥니다.
  2. 비용 절감은 더 광범위한 고객 채택을 가능하게 합니다.
  3. 수익 성장은 추가 연구, 인프라 및 안전 투자를 위한 자금을 제공합니다.
  4. 새로운 발전은 스택의 성능을 강화합니다.

OpenAI는 이 주기를 "복리식 이점"으로 규정하며, 각 기술적 개선이 다음 개선을 촉진하여 전체 생태계를 강화한다고 설명합니다.

시사점

  • 산업에 미치는 영향: 자체 추론 칩은 선도적인 AI 제공업체들 사이에서 하드웨어와 소프트웨어의 더 긴밀한 공동 설계로의 전환을 알리는 신호입니다.
  • 경쟁 역학: 자체 실리콘을 개발하면서도 다양한 하드웨어 포트폴리오를 유지함으로써 OpenAI는 워크로드 전반에 걸쳐 기능과 비용 모두에 맞게 최적화할 수 있는 유연성을 확보합니다.
  • 경제적 영향: 향상된 효율성은 기업이 고급 AI를 도입하는 데 있어 장벽을 낮출 수 있으며, 부문 전반에 걸쳐 AI 기반의 생산성 향상을 잠재적으로 가속화할 수 있습니다.
  • 안전 및 거버넌스: 발표에서 자세히 설명하지는 않았지만, 통합된 안전 연구에 대한 강조는 성능과 함께 책임감 있는 배포에 대한 지속적인 투자를 시사합니다.

전반적으로, OpenAI의 Jalapeño 및 풀스택 전략 발표는 전체 AI 컴퓨팅 스택을 통제하여 성능, 비용 및 경제적 영향에서 복리식 이득을 이끌어내려는 전략적 움직임을 강조합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch