Rescript: An Open-Source, Browser-Based Alternative to Descript
Rescript: 오픈소스, 브라우저 기반 Descript 대체제
Rescript는 오픈소스, 트랜스크립트 기반 비디오 편집기로, 사용자가 텍스트 문서처럼 비디오 파일을 편집할 수 있게 해줍니다. 생성된 트랜스크립트에서 단어를 삭제하면 해당 세그먼트가 비디오에서 자동으로 잘려나가며, 이는 브라우저 내에서 완전히 온디바이스에서 작동하는 간소화된 워크플로를 제공합니다.
로컬 처리 및 개인정보 보호
Rescript는 기본적으로 개인 정보를 보호하도록 설계되어, 미디어와 트랜스크립트가 사용자의 기기를 절대 떠나지 않습니다. 서버 측 처리, 인증, 파일 업로드가 필요하지 않습니다.
AI 모델(약 90 MB)은 첫 번째 트랜스크립션 중에 Hugging Face Hub에서 다운로드되어 브라우저 스토리지에 캐시되며, 이후 모든 작업—트랜스크립션, 편집, 내보내기—는 인터넷 연결 없이 작동합니다. 애플리케이션이 하는 유일한 외부 요청은 오프라인 상태일 때 silenziosamente 실패하는 Google Analytics를 통한 익명 페이지 분석입니다.
주요 기술적 기능
Rescript는 텍스트 기반 비디오 조작 및 자동 정리를 위한 도구 세트를 제공합니다:
- 단어 수준 편집: 사용자는 특정 단어를 선택하고 백스페이스를 눌러 해당 클립을 비디오에서 제거할 수 있습니다.
- 필러 단어 제거: 한 번의 클릭 기능으로 'um'과 'uh'와 같은 일반적인 필러 단어를 식별하고 제거합니다.
- Verbatim 모드: 이 모드는 트랜스크립션 엔진에 트랜스크립트에서 필러 단어를 유지하도록 촉구하여 수동 편집을 가능하게 합니다.
- 화자 분리: 트랜스크립트가 화자별로 자동으로 그룹화되어 대화를 정리합니다.
- 실시간 미리보기: 재생 엔진이 실시간으로 잘린 영역을 건너뛰어 편집 내용을 즉시 검토할 수 있게 합니다.
- 브라우저 내 내보내기: 애플리케이션은
ffmpeg.wasm을 사용하여 로컬에서 프레임 정확한 MP4 렌더링을 수행합니다.
기술 스택
| 구성 요소 | 기술 |
|---|---|
| 프레임워크 | Next.js, React, TypeScript, Tailwind |
| 전사 | transformers.js running whisper-base_timestamped (WebGPU with WASM fallback) in a Web Worker |
| 화자 라벨 | pyannote-segmentation-3.0 (ONNX) |
| 미디어 처리 | Multi-threaded ffmpeg.wasm for audio extraction and export |
| 상태 관리 | zustand |
편집 워크플로 작동 방식
애플리케이션은 비디오를 네 단계 파이프라인을 통해 처리합니다:
- 추출:
ffmpeg.wasm이 오디오 트랙을 모노 16 kHz PCM으로 디코딩합니다. - 전사: Whisper가 Web Worker에서 `return_timestamps: