Rescript: An Open-Source, Browser-Based Alternative to Descript

Rescript: 오픈소스, 브라우저 기반 Descript 대체제

Rescript는 오픈소스, 트랜스크립트 기반 비디오 편집기로, 사용자가 텍스트 문서처럼 비디오 파일을 편집할 수 있게 해줍니다. 생성된 트랜스크립트에서 단어를 삭제하면 해당 세그먼트가 비디오에서 자동으로 잘려나가며, 이는 브라우저 내에서 완전히 온디바이스에서 작동하는 간소화된 워크플로를 제공합니다.

로컬 처리 및 개인정보 보호

Rescript는 기본적으로 개인 정보를 보호하도록 설계되어, 미디어와 트랜스크립트가 사용자의 기기를 절대 떠나지 않습니다. 서버 측 처리, 인증, 파일 업로드가 필요하지 않습니다.

AI 모델(약 90 MB)은 첫 번째 트랜스크립션 중에 Hugging Face Hub에서 다운로드되어 브라우저 스토리지에 캐시되며, 이후 모든 작업—트랜스크립션, 편집, 내보내기—는 인터넷 연결 없이 작동합니다. 애플리케이션이 하는 유일한 외부 요청은 오프라인 상태일 때 silenziosamente 실패하는 Google Analytics를 통한 익명 페이지 분석입니다.

주요 기술적 기능

Rescript는 텍스트 기반 비디오 조작 및 자동 정리를 위한 도구 세트를 제공합니다:

  • 단어 수준 편집: 사용자는 특정 단어를 선택하고 백스페이스를 눌러 해당 클립을 비디오에서 제거할 수 있습니다.
  • 필러 단어 제거: 한 번의 클릭 기능으로 'um'과 'uh'와 같은 일반적인 필러 단어를 식별하고 제거합니다.
  • Verbatim 모드: 이 모드는 트랜스크립션 엔진에 트랜스크립트에서 필러 단어를 유지하도록 촉구하여 수동 편집을 가능하게 합니다.
  • 화자 분리: 트랜스크립트가 화자별로 자동으로 그룹화되어 대화를 정리합니다.
  • 실시간 미리보기: 재생 엔진이 실시간으로 잘린 영역을 건너뛰어 편집 내용을 즉시 검토할 수 있게 합니다.
  • 브라우저 내 내보내기: 애플리케이션은 ffmpeg.wasm을 사용하여 로컬에서 프레임 정확한 MP4 렌더링을 수행합니다.

기술 스택

구성 요소 기술
프레임워크 Next.js, React, TypeScript, Tailwind
전사 transformers.js running whisper-base_timestamped (WebGPU with WASM fallback) in a Web Worker
화자 라벨 pyannote-segmentation-3.0 (ONNX)
미디어 처리 Multi-threaded ffmpeg.wasm for audio extraction and export
상태 관리 zustand

편집 워크플로 작동 방식

애플리케이션은 비디오를 네 단계 파이프라인을 통해 처리합니다:

  1. 추출: ffmpeg.wasm이 오디오 트랙을 모노 16 kHz PCM으로 디코딩합니다.
  2. 전사: Whisper가 Web Worker에서 `return_timestamps:

Sources