Gemini 2.5 Flash-Lite 릴리스 노트

Google DeepMind은 Gemini 2.5 가족에서 가장 빠르고 비용 효율적인 모델인 Gemini 2.5 Flash-Lite의 안정 버전을 출시했습니다. 이 모델은 확장된 프로덕션 사용을 위해 설계되었으며, 달러당 높은 지능과 번역 및 분류와 같은 작업에서의 낮은 지연 시간을 우선시합니다.

기술 사양 및 가격

Gemini 2.5 Flash-Lite는 2.5 시리즈에서 가장 저렴한 모델로, 입력 토큰 1백만 개당 $0.10, 출력 토큰 1백만 개당 $0.40의 가격이 책정되었습니다. 또한, 오디오 입력 가격은 프리뷰 출시 대비 40% 감소했습니다.

주요 기술 기능은 다음과 같습니다:

  • 컨텍스트 윈도우: 1백만 토큰 컨텍스트 윈도우.
  • 추론: 요구 사항에 따라 선택적으로 켤 수 있는 네이티브 추론 기능으로, 제어 가능한 사고 예산을 통해 활성화할 수 있습니다.
  • 도구 통합: Code Execution, URL Context, Google Search 기반 Grounding과 같은 네이티브 도구 지원을 포함합니다.
  • 성능: 광범위한 프롬프트 샘플에서 2.0 Flash-Lite 및 2.0 Flash보다 낮은 지연 시간을 제공합니다.

성능 벤치마크 및 품질

Gemini 2.5 Flash-Lite는 다음과 같은 여러 분야에서 2.0 Flash-Lite보다 전반적인 품질이 높습니다:

  • 코딩
  • 수학
  • 과학
  • 추론
  • 멀티모달 이해

프로덕션 사용 사례

여러 조직이 특정 운영 워크플로우를 최적화하기 위해 Gemini 2.5 Flash-Lite를 이미 배포했습니다:

  • Satlyt: 분산형 우주 컴퓨팅 플랫폼에서 모델을 활용하여 궤도 내 원격 측정 요약 및 위성 간 통신 파싱을 처리합니다. 이로 인해 온보드 진단의 지연 시간이 45% 감소하고 전력 소비가 30% 줄었습니다.
  • HeyGen: 모델을 사용하여 비디오 계획을 자동화하고, 콘텐츠를 최적화하며, 비디오를 180개 이상의 언어로 번역합니다.
  • DocsHound: 모델을 사용하여 긴 비디오를 처리하고 수천 개의 스크린샷을 추출하여 AI 에이전트를 위한 문서 및 학습 데이터를 생성합니다.
  • Evertune: 모델의 속도를 활용하여 모델 출력 대량을 스캔하고 종합하여 AI 모델 전반에 걸친 브랜드 표현에 대한 동적 통찰을 제공합니다.

가용성 및 마이그레이션

Gemini 2.5 Flash-Lite는 Google AI Studio 및 Vertex AI를 통해 이용할 수 있습니다. 개발자는 코드에서 gemini-2.5-flash-lite를 지정하여 모델에 접근할 수 있습니다. 프리뷰 버전 사용자는 프리뷰 별칭이 8월 25일에 제거될 예정이므로 안정 별칭으로 마이그레이션해야 합니다.

Sources