Fetch 사례 연구: Amazon SageMaker와 Hugging Face를 사용하여 ML 처리 지연 시간을 50% 줄이기

Fetch는 가장 느린 영수증 스캔의 처리 지연 시간을 50% 줄이고, Amazon SageMaker와 Hugging Face로 머신러닝(ML) 파이프라인을 마이그레이션하여 문서 이해 모델의 정확도를 200% 높였습니다. 이 최적화로 회사는 주당 8천만 장 이상의 영수증을 처리할 수 있게 되었으며, 피크 트래픽 시 초당 수백 건의 스캔을 더 높은 정확도와 속도로 수행할 수 있습니다.

Amazon SageMaker를 통한 기술적 구현

Fetch는 12개월 이내에 Amazon SageMaker에 5개 이상의 ML 모델을 배포하여 ML 파이프라인을 최적화했습니다. 아키텍처는 영수증 스캔 작업의 규모를 처리하기 위해 여러 관리형 서비스를 활용합니다:

  • Model Training and Processing: Fetch는 Amazon SageMaker Model Training을 사용하여 규모에 따른 모델 튜닝과 관련된 비용과 시간을 줄이고, 관리형 데이터 처리 워크로드를 위한 Amazon SageMaker Processing과 함께 사용합니다.
  • Compute Infrastructure: 회사는 Amazon SageMaker에서 멀티 GPU 인스턴스를 사용하여 맞춤형 ML 모델의 빠른 성능을 보장하고 추론 및 런타임에 대한 원활한 확장성을 확보합니다.
  • Deployment Automation: 개발에서 생산으로의 전환을 가속화하기 위해 Fetch는 Amazon SageMaker Inference Recommender를 사용하여 부하 테스트와 모델 튜닝을 자동화합니다.
  • Validation: Fetch는 사용자 정의 셰도 테스트 파이프라인을 Amazon SageMaker 셰도 테스트로 대체하여, 회사가 프로덕션 트래픽에 대해 새로운 모델을 검증하여 장애를 방지할 수 있도록 했습니다.

Hugging Face와의 통합

Fetch는 Hugging Face와 AWS 간의 파트너십을 활용하여 딥러닝 환경 배포를 간소화합니다. 구현은 구체적으로 다음에 의존합니다:

  • Hugging Face AWS Deep Learning Containers (DLCs): 이러한 사전 패키징된 컨테이너 이미지는 Fetch가 훈련 및 추론을 위한 최적화된 환경을 빠르게 배포할 수 있게 합니다.
  • Amazon SageMaker Hugging Face Inference Toolkit: 이 오픈소스 라이브러리는 트랜스포머 모델을 효율적으로 제공하는 데 사용됩니다.

Fetch의 머신러닝 엔지니어인 Sam Corzine에 따르면, "Hugging Face AWS Deep Learning Container의 유연성을 활용하여 모델 품질을 향상시킬 수 있었고, Hugging Face와 AWS의 파트너십 덕분에 이러한 모델을 배포하는 것이 간단했습니다."

비즈니스 결과 및 확장성

기술적 마이그레이션으로 사용자 성장과 파트너 가치 측면에서 측정 가능한 개선이 이루어졌습니다:

  • User Growth: 업데이트된 ML 파이프라인 출시 이후 Fetch의 월간 활성 사용자 수가 1천만 명에서 1천8백만 명으로 증가했습니다.
  • Partner Value: 모델 정확도가 향상됨에 따라 Fetch는 영수증에서 더 다양한 데이터 유형을 추출할 수 있게 되었고, 이를 통해 브랜드 파트너는 보다 정확한 소비자 인사이트를 기반으로 새로운 유형의 제안을 만들 수 있습니다.
  • 개발자 생산성: 표준화된 배포로 수작업 오버헤드가 줄어들어 새로운 팀 멤버는 직무 첫 며칠 내에 모델을 배포할 수 있게 되었습니다.

Fetch는 운영을 계속 확장함에 따라 사기 방지와 같은 기타 ML 사용 사례에서도 Amazon SageMaker의 사용을 확대할 계획입니다.

Sources