GPT-4.1 API 릴리스 노트 / 새로운 소식

OpenAI는 새로운 API 모델 시리즈—GPT-4.1, GPT-4.1 mini, 그리고 GPT-4.1 nano—를 출시했으며, 이는 코딩, 지시 따름, 그리고 장기 컨텍스트 이해에서 GPT-4o 및 GPT-4o mini를 능가합니다. 이 모델들은 최대 100만 토큰의 확장된 컨텍스트 윈도우와 2024년 6월 기준 최신 지식 컷오프를 제공합니다.

향상된 코딩 기능

  • 소프트웨어 엔지니어링 성능: GPT-4.1은 SWE-bench Verified에서 54.6%를 기록했으며, GPT-4o 대비 21.4% 절대 향상, GPT-4.5 대비 26.6% 절대 향상을 보였습니다.
  • 코드 차이 신뢰성: 이 모델은 Aider의 polyglot diff 벤치마크에서 GPT-4o의 점수를 두 배 이상 초과하고 GPT-4.5보다 8% 절대적으로 높습니다. 이를 통해 개발자는 전체 파일을 다시 쓰는 대신 변경된 라인만 출력할 수 있어 비용과 지연 시간이 감소합니다.
  • 프론트엔드 개발: 직접 비교에서 인간 평가자는 GPT-4.1이 생성한 웹사이트를 GPT-4o보다 80%의 비율로 선호했습니다.
  • 노이즈 감소: 내부 평가에 따르면 코드에 대한 불필요한 편집이 GPT-4o에서는 9%였으나 GPT-4.1에서는 2%로 감소했습니다.

향상된 지시 따름 및 신뢰성

  • 벤치마크 향상: GPT-4.1은 Scale의 MultiChallenge 벤치마크에서 38.3%를 기록했으며(GPT-4o 대비 10.5% 절대 증가), IFEval에서는 87.4%를 기록했습니다(대조군 GPT-4o는 81.0%).
  • 다중 턴 일관성: 이 모델은 과거 메시지에서 정보를 더 잘 검색하도록 훈련되어 깊은 대화에서 일관성을 향상시킵니다.
  • 실제 적용: Blue J와 같은 초기 테스트 사용자들은 실제 복잡한 세금 시나리오에서 GPT-4o 대비 정확도가 53% 증가했다고 보고했습니다. Hex는 가장 어려운 SQL 평가 세트에서 거의 2배 향상을 보고했습니다.

장기 컨텍스트 이해 및 추론

  • 검색 정확도: "바늘 찾기" 평가에서 GPT-4.1, mini, nano는 100만 토큰까지 모든 위치에서 일관되게 정보를 정확히 검색했습니다.
  • 복합 추론: 다중 홉 추론을 평가하기 위해 OpenAI는 Graphwalks 데이터셋을 도입했습니다. GPT-4.1은 이 벤치마크에서 61.7% 정확도를 달성했으며, OpenAI o1과 일치하고 GPT-4o보다 뛰어났습니다.
  • 다중 라운드 코리퍼런스: OpenAI는 OpenAI-MRCR 평가를 오픈소스화했으며, 여기서 GPT-4.1은 128K까지의 컨텍스트 길이에서 GPT-4o보다 우수하고 100만 토큰까지도 강력한 성능을 유지합니다.
  • 기업 영향: Thomson Reuters는 CoCounsel의 다문서 검토 정확도가 17% 향상되었다고 보고했으며, Carlyle은 매우 크고 밀집된 문서에서 50% 더 나은 검색을 경험했습니다.

모델 패밀리 계층 및 성능

  • GPT-4.1: 가장 복잡한 작업을 위한 대표 모델로, 최고 수준의 지능과 가장 큰 컨텍스트 윈도우를 제공합니다.
  • GPT-4.1 mini: 고효율 모델로, 지능 평가에서 GPT-4o와 동등하거나 능가하면서 지연 시간을 거의 절반으로 줄이고 비용을 83% 절감합니다.
  • GPT-4.1 nano: 가장 빠르고 저렴한 모델로, MMLU에서 80.1%, GPQA에서 50.3%를 기록했습니다. 분류 및 자동완성 같은 저지연 작업에 최적화되었습니다.

비전 및 멀티모달 기능

GPT-4.1은 고급 이미지 이해를 제공하며, GPT-4.1 mini는 이미지 벤치마크에서 GPT-4o보다 자주 우수합니다. 또한 이 모델은 장기 비디오 이해에서 새로운 최첨단을 달성했으며, Video-MME(길고 자막 없음) 카테고리에서 72.0%를 기록해 GPT-4o 대비 6.7% 절대 향상을 보였습니다.

가격 및 가용성

GPT-4.1 모델은 API를 통해 제공됩니다. GPT-4.5 프리뷰는 2025년 7월 14일에 폐지될 예정입니다.

모델 입력 (1M당) 캐시된 입력 (1M당) 출력 (1M당) 혼합 가격
GPT-4.1 $2.00 $0.50 $8.00 $1.84
GPT-4.1 mini $0.40 $0.10 $1.60 $0.42
GPT-4.1 nano $0.10 $0.025 $0.40 $0.12

핵심 가격 업데이트:

  • 프롬프트 캐싱: 반복 컨텍스트에 대한 할인율이 75%로 증가했습니다(이전 50%).
  • 장기 컨텍스트: 1백만 토큰까지의 요청은 표준 토큰당 요금 외에 추가 비용 없이 제공됩니다.
  • 배치 API: 배치 API를 통해 사용할 경우 50% 할인이 제공됩니다.

Sources