wendy7756/AI-Video-Transcriber
Transcribe and summarize videos and podcasts using AI. Open-source, multi-platform, and supports multiple languages.
해결하는 문제
AI Video Transcriber는 YouTube, TikTok, Bilibili 등 30개 이상의 플랫폼이나 로컬 파일에서 비디오 및 오디오 콘텐츠를 구조화된 텍스트로 변환하는 통합적인 방법을 제공합니다. 수동으로 오디오를 문자로 옮기거나 자막을 찾는 수고를 덜고, AI 기반 요약 및 번역 기능을 통해 긴 형식의 콘텐츠를 더 쉽게 소화할 수 있습니다.
작동 방식
이 도구는 미디어 처리를 위한 다단계 파이프라인을 사용합니다.
- 추출: 먼저 플랫폼에서 네이티브 자막을 추출하려고 시도합니다. 자막이 없을 경우 Faster-Whisper를 사용해 로컬에서 오디오를 문자로 옮깁니다.
- 처리: 로컬 업로드의 경우, FFmpeg를 사용해 오디오를 Whisper에 적합한 표준 형식으로 정규화합니다.
- AI 강화: 생성된 자막을 OpenAI 호환 LLM에 전송하여 오타 수정, 문장 완성, 단락 구조화를 수행합니다.
- 최종 처리: 시스템은 11개 지원 언어 중 하나로 요약을 생성하고, 요약 언어가 원본 언어와 다를 경우 자막을 번역합니다.
대상 사용자
웹 또는 로컬 저장소에서 비디오 및 오디오 콘텐츠를 아카이브, 요약, 번역해야 하는 콘텐츠 크리에이터, 연구자, 학생들.
주요 기능
- 자막 우선 아키텍처: 네이티브 자막을 우선적으로 사용해 거의 즉시 결과를 제공하며, Whisper는 백업으로만 사용됩니다.
- 광범위한 플랫폼 지원:
yt-dlp가 지원하는 모든 사이트(YouTube, TikTok, Bilibili 등)와 호환됩니다. - 유연한 AI 통합: OpenAI 호환 API 엔드포인트를 모두 지원하여 OpenAI, OpenRouter, 또는 로컬 LLM을 사용할 수 있습니다.
- 에이전트 준비: 헤드리스 CLI, Codex 플러그인, MCP 서버를 포함하여 Claude Code와 같은 AI 에이전트와의 통합이 가능합니다.
- 로컬 파일 지원: .mp3, .mp4, .wav 등 다양한 미디어 형식과 일반 텍스트 파일을 처리합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트