M1 Max와 로컬 ML 모델을 사용하여 669 GB의 GoPro 푸티지 인덱싱하기
대규모 비디오 라이브러리를 위한 로컬 ML 인덱싱
개발자 iliashad는 M1 Max 컴퓨터와 로컬 오픈 소스 머신러닝 모델을 사용하여 628개의 비디오(총 15시간 13분)에 걸친 668.68 GB의 GoPro 푸티지를 인덱싱했습니다. 이 접근 방식은 클라우드 서비스에 의존하지 않고 방대한 양의 원본 푸티지 내에서 특정 순간을 효율적으로 찾아낼 수 있게 해주며, 개인정보 보호를를 보장하고 높은 업로드 비용을 피할 수 있게 합니다.
기술적 구현 및 워크플로우
이 프로젝트의 주요 목표는 편집을 위한 "관심 있는 순간"을 식별하기 위해 GoPro 비디오 라이브러리의 검색 가능한 인덱스를 생성하는 것입니다. 워크플로우는 비디오 파일을 분석하기 위해 로컬 ML 모델을 통합하고, 동일한 인덱스를 사용하여 선택된 클립을 DaVinci Resolve 타임라인으로 직접 전송합니다.
하드웨어 및 규모
- 하드웨어: Apple M1 Max
- 데이터 볼륨: 668.68 GB의 원본 비디오
- 628개의 비디오 인덱싱됨
- 총 재생 시간: 15시간 13분 18초
편집 소프트웨어와의 통합
푸티지를 로컬에서 인덱싱함으로써 사용자는 특정 시각적 또는 주제적 요소를 검색할 수 있으며, 그런 다음 최고의 클립을 DaVinci Resolve로 직접 보내 편집 과정에서 원본 데이터 분석에서 최종 비디오 제작으로의 전환을 간소화할 수 있습니다.
커뮤니티 토론 및 기술적 고려 사항
이 프로젝트는 Apple Silicon에서 로컬 ML의 능력을 보여주지만, Hacker News의 커뮤니티 구성원들은 하드웨어 및 아키텍처와 관련된 몇 가지 기술적 뉘앙스를 논의했습니다.
컨테이너에서의 GPU 가속
한 기여자 @fl0id는 특정 도구를 사용하여 컨테이너 내에서 Apple GPU 가속을 달성할 수 있다고 언급했습니다:
it is possible to use apple gpu with containers. either with podman + runkit + recent mesa or with recent vllm-metal from docker
하드웨어 성능 비교
또한 M1 Max의 아키텍처에 관한 논의도 있었으며, 사용자들이 ARM 기반 SoC (System on a Chip) 성능을 11th gen Intel i9와 같은 전통적인 x86 아키텍처와 비교하여 Windows ARM 성능이 유사한 ML 워크로드에서 어떻게 비교될 수 있는지 이해하고자 했습니다.
결론
이 프로젝트는 M1 Max와 같은 소비자용 하드웨어에서 로컬 ML 모델을 활용하여 대규모 비디오 데이터셋을 로컬에서 처리하는 실용적인 사례로, 전문적인 비디오 편집을 위해 수 시간의 푸티지를 수동으로 검토하는 데 필요한 시간을 크게 단축할 수 있습니다.