OlmoEarth 플랫폼: 행성 규모에서의 지리 공간 추론

OlmoEarth 플랫폼: 행성 규모에서의 지리 공간 추론

OlmoEarth 플랫폼은 미세 조정 및 평가에서 대규모 추론으로 지리 공간 기초 모델을 전환하도록 설계된 인프라입니다. 이는 조직이 약 하루 만에 대륙 규모 지역의 수십 테라바이트 이미지를 처리할 수 있게 하며, 제곱 킬로미터당 페니의 분수 수준의 비용을 달성합니다.

위성 추론에서의 과제 극복

지리 공간 추론은 데이터의 massive 규모와 입력의 복잡성으로 인해 표준 ML 작업과 다릅니다. singolo fine-tuning job은 테라바이트 단위의 데이터를 포함하고 수시간 동안 실행될 수 있으며, 여러 스펙트럼 밴드, 센서 유형, 시간 단계를 활용합니다.

주요 기술적 과제는 다음과 같습니다:

  • 데이터 이질성: 이미지는 다양한 제공자로부터 오며, 서로 다른 투영, 해상도, 구름 가림 수준을 갖습니다.
  • 정렬 요구 사항: 출력이 지도이므로, 모든 예측은 주변 지역의 좌표 격자와 정확히 정렬되어야 합니다.
  • I/O 병목 현상: 예측 작업은 모델 실행보다 이미지 다운로드 및 준비에 더 많은 시간을 소비하는 경우가 많아, altamente 효율적인 데이터 파이프라인이 필요합니다.

최적화된 하드웨어 할당

비용이 많이 드는 GPU가 데이터 준비에 낭비되지 않도록 하기 위해, OlmoEarth 플랫폼은 각 추론 작업을 세 가지 distinct 단계로 나누며, 각 단계는 가장 비용 효율적인 하드웨어에 매핑됩니다:

  1. 데이터 획득 및 전처리 (CPU, High I/O): 이 단계는 이미지를 가져오고, 재투영하고, 정렬하고, 정규화한 후 빠른 로딩에 최적화된 형식으로 저장합니다.
  2. 추론 (GPU): 플랫폼은 모델의 순전파를 실행하고, 최소한으로 처리된 출력을 직접 저장소에 기록합니다.
  3. 후처리 (CPU): 창당 출력을 함께 이어붙이고, 마스크 또는 재스케일링을 적용한 후, GeoJSON, GeoTIFF, Zarr 등의 형식으로 결과를 내보냅니다.

OlmoEarth Run을 통한 확장 가능한 실행

OlmoEarth Run, 플랫폼의 실행 계층은 지리적 영역을 개별 컴퓨팅 인스턴스(작업자)에 맞는 크기의 파티션으로 나누어 대규모 작업을 관리합니다. 이러한 파티션은 모델 처리를 위해 더 작은 창으로 다시 세분화됩니다. 각 창이 독립적이므로, 플랫폼은 수천 개의 순전파를 병렬로 실행할 수 있습니다.

최근 북미 산불 위험 지도 생성에서, 플랫폼은 다음과 같은 규모를 보여주었습니다:

  • 병렬성: 피크 시 약 19,600개의 CPU와 994개의 GPU를 사용했습니다.
  • 처리량: 네트워크 처리량이 168 GB/s를 초과했습니다.
  • 효율성: 추정된 4,737시간의 직렬 컴퓨팅을 30.5시간의 벽시계 시간으로 줄여, 155× 속도 향상을 달성했습니다.

지능형 데이터 색인 및 검색

수천 개의 동시 쿼리로 외부 STAC API(예: ESA 또는 Microsoft Planetary Computer의 API)를 과부하시키지 않기 위해, OlmoEarth 플랫폼은 자체 내부 메타데이터 색인을 유지합니다.

메타데이터 관리

  • 업데이트 메커니즘: 색인은 AWS Open Data에 대한 SNS 알림을 통해 업데이트되거나, 다른 제공자에 대해서는 상류 색인을 몇 분마다 폴링하여 업데이트됩니다.
  • 효율적인 검색: 색인은 장면 메타데이터와 픽셀에 대한 포인터를 저장합니다. 런타임 시, 플랫폼은 클라우드 최적화 형식(COG 또는 Zarr)에 대해 창 단위 읽기를 수행하여, 전체 장면을 다운로드하는 대신 파티션에 필요한 바이트만 검색합니다.

데이터 제공자를 위한 모범 사례

플랫폼 개발을 바탕으로, 팀은 지구 관측 데이터 출판을 위한 세 가지 모범 사례를 권장합니다: 새로운 이미지에 대한 큐 기반 알림, 맞춤형 rate limit이 없는 주요 클라우드 플랫폼에서의 저장소, 범위 읽기를 지원하는 클라우드 최적화 형식의 사용.

장애 허용 및 복구

이 플랫폼은 분산 컴퓨팅의 일상적인 오류로부터 자동 복구를 위해 설계되었습니다. 각 작업은 동적으로 프로비저닝된 runner Docker 컨테이너 내에서 실행됩니다.

모든 작업이 재진입 가능하고 멱등적이기 때문에, 플랫폼은 작업 추적, 자동 재시도, 대체 제공자로의 폴백을 통해 제공자 불가용, 누락된 이미지 밴드, 컨테이너 충돌 등의 간헐적인 오류를 처리합니다. 별도의 모니터링 프로세스가 정지된 runner를 식별하고 해당 작업을 다시 시작합니다.

미래 로드맵

Ai2는 OlmoEarth 플랫폼을 확장하여 여러 새로운 기능을 포함하고 있습니다:

  • 자동화된 워크플로: 새로운 이미지 등록에 기반하여 추론 작업을 스케줄링하거나 트리거합니다.
  • 경보 시스템: 홍수나 산림 벌채와 같은 사건에 대해 사용자에게 알림을 보내기 위해 변화 탐지를 구현합니다.
  • 에이전트 인터페이스: 데이터 큐레이션 및 피처 엔지니어링에 대한 기술적 장벽을 낮추는 도구를 개발합니다.
  • 효율성 향상: 더 빠른 모델 아키텍처를 연구하고, 많은 작업에 대해 전체 순전파를 대체하는 전용 임베딩 모델을 개발합니다.
  • 확장된 모달리티: 날씨 데이터(ERA-5)와 추가 위성 센서를 포함합니다.
  • 클라우드에 구애받지 않는 배포: 현재 Google Cloud에 있지만, 아키텍처는 여러 클라우드를 지원하고 파트너의 자체 컴퓨팅 환경 내에 배포하도록 설계되었습니다.

Sources