Lewis Tunstall 인터뷰 – Hugging Face 머신 러닝 전문가
TL;DR
Hugging Face는 Transformers 라이브러리에 기여하고 NLP with Transformers 책을 공동 저술했으며, Hugging Face Course와 대규모 모델 평가 도구 구축을 돕는 머신 러닝 엔지니어 Lewis Tunstall와의 인터뷰를 공개했습니다.
Lewis Tunstall는 누구인가?
Lewis Tunstall는 Hugging Face의 머신 러닝 엔지니어입니다. 그는 이전에 스타트업과 기업을 위해 NLP, 위상 데이터 분석, 시계열 프로젝트에 참여했습니다. 머신 러닝에 들어오기 전에는 이론 물리학자였으며, 업무 외 시간에는 기타 연주, 트레일 러닝, 오픈 소스 기여를 즐깁니다.
그가 Hugging Face에 합류한 과정
- 2018년에 그는 스위스 스타트업에서 질문‑응답 프로토타입을 위해 초기
pytorch-pretrained-bert라이브러리를 사용했습니다. - 접근 가능한 자료가 부족한 점에 매료되어, 그는 동료 Leandro von Werra와 함께 Hugging Face 공동 설립자 Thomas Wolf에게 차가운 이메일을 보냈고, 긍정적인 답변을 받은 뒤 Transformers에 관한 책을 쓰기 시작했습니다.
- NLP with Transformers 책은 1.5년간의 협업 후 출간되었으며, 두 저자를 모두 Hugging Face에 합류하게 했고, 현재 Lewis는 약 9개월째 근무하고 있습니다.
NLP with Transformers 책
- Luca Perrozi (Accenture)가 “복잡함을 단순하게 만든… 앞으로 수년간 분야의 표준을 정의할 운명”이라고 평가했습니다.
- 즉시 사용 가능한 사전 학습 모델과 처음부터 학습하는 방법, 성능 튜닝, 누락된 라벨 처리까지 모두 다룹니다.
- 표지에는 앵무새가 그려져 있는데, 이는 커뮤니티의 “stochastic parrots” 논의를 떠올리게 하며, 저자들이 언어 모델의 은유라고 생각하는 장난스러운 일러스트입니다.
Transformers 라이브러리에 대한 기여
- ONNX 포맷을 통한 프로덕션 수준 모델 내보내기에 집중하여, PyTorch에서 TensorFlow로 변환하고 특수 하드웨어에서 실행할 수 있게 했습니다.
- 내보내기 과정을 한 줄의 코드로 단순화하여, 챗봇과 같은 실시간 애플리케이션의 지연 시간을 줄이고 처리량을 높였습니다.
- 라이브러리의 철학인 보일러플레이트를 추상화하여 사용자가 핵심 작업에 집중할 수 있게 하는 것을 강조합니다.
Hugging Face 코스
- 핵심 유지관리자 Sylvain Gugger와 Lysandre Jik와 공동 개발하여 소프트웨어 엔지니어와 최신 NLP 사이의 격차를 메웠습니다.
- 무료 다파트 코스로, 다양한 작업에 대한 엔드‑투‑엔드 모델 훈련을 가르치며, 다가오는 세 번째 파트에서는 오디오와 컴퓨터 비전 모달리티까지 확장될 예정입니다.
- 커뮤니티 주도 이벤트를 통해 실용적인 프로젝트가 만들어졌으며, 예를 들어 Big Science 팀 인턴십을 얻는 데 도움이 된 커버 레터 생성기가 있습니다.
대규모 모델 평가
- 사용자가 Hugging Face Hub에서 직접 모델과 데이터셋을 평가할 수 있는 인프라를 구축하고 있으며, 수동 벤치마크 없이 특정 작업에 대한 최고 성능 모델을 찾아내는 것을 목표로 합니다.
- 연구자들이 평가 스위트를 제출하고 유지 관리하기 위한 장벽을 낮추는 호스팅 벤치마크를 탐색하고 있으며, 현재 임시 스크립트와 논문별 테스트에 의존하는 문제를 해결합니다.
- 벤치마크 과적합 위험을 강조합니다: 모델이 실제 작업 성능을 반영하지 않는 지름길을 이용해 높은 점수를 얻을 수 있습니다.
ML 엔지니어를 위한 실용적인 조언
- 베이스라인부터 시작하세요. 간단한 정규식이나 로지스틱 회귀가 최첨단 트랜스포머로 넘어가기 전에 견고한 기준을 제공하는 경우가 많습니다.
- 과도한 엔지니어링을 피하세요. 프로덕션 제약과 통합되는 엔드‑투‑엔드 파이프라인을 구축하세요; 배포할 수 없는 고성능 모델은 무용지물입니다.
- 오픈 소스에 일찍 기여하세요. 커뮤니티 프로젝트에 초기에 참여하면 학습이 가속화되고 커리어 기회가 열릴 수 있습니다.
미래 적용에 대한 비전
- 자연 과학. 딥러닝과 도메인 지식을 결합하면 발견을 가속화할 수 있으며, AlphaFold의 단백질 구조 예측이 그 예시입니다.
- 신약 개발 및 로보틱스. 머신 러닝 기반 화학 파이프라인과 가정용 로봇(예: 세탁물 접기)의 장기 목표는 개인적인 관심 분야입니다.
- 책임 있는 AI. 악용 가능성(예: 무기화, 금융 시장 조작)을 인정하면서도, Tunstall는 당면한 위험이 “Terminator” 시나리오가 아니라 시스템적 취약점이라고 강조합니다.
좋아하는 논문 및 영감
- Leo Breiman의 2001년 Random Forests 논문 – 명료함과 구현 가능성으로 찬사를 받았습니다.
- 최근 DeepMind 논문으로, 머신 러닝을 사용해 대수적 위상수학에서 정리를 증명한 사례 – 예측 작업을 넘어 근본적인 과학적 통찰을 돕는 ML의 가능성을 보여줍니다.
개인 관심사 및 활동
- Hannah Fry가 진행하는 DeepMind 팟캐스트를 정기적으로 청취하며, 딥러닝과 강화학습에 대한 명확한 설명을 추천합니다.
- 트위터(@_lewtun)에서 활발히 활동하고 Hugging Face 포럼 및 Discord 커뮤니티에도 참여합니다.
주요 시사점
- Lewis Tunstall의 작업은 오픈 소스 기여, 실용적인 도구(ONNX 내보내기), 교육 자료(Hugging Face 코스)가 결합되어 프로덕션에서 Transformers를 적용하는 장벽을 낮추는 방식을 보여줍니다.
- 이번 인터뷰는 지속 가능한 ML 개발을 위해 베이스라인 모델, 엔드‑투‑엔드 시스템 사고, 책임 있는 평가 관행의 중요성을 강조합니다.