zrt-ai-lab/ViNote
ViNote(视记AI)|DeepSeek Harness SDK 驱动的开源视频知识 Agent。以工具编排、SQLite 会话恢复和流式交互,串联 YouTube / Bilibili 检索、下载、转写与笔记生成,支持视频问答、知识卡片和思维导图。FastAPI + React,支持 OpenAI 兼容接口模型。
해결하는 문제
ViNote는 YouTube, Bilibili 등의 다양한 플랫폼이나 로컬 파일에서 비디오를 구조화된 지식 자산으로 변환합니다. 긴 비디오를 시청하여 정보를 추출하는 수작업을 제거하고, 음성 인식, 요약, 정리 과정을 자동화합니다.
작동 방식
이 시스템은 yt-dlp를 통해 비디오를 다운로드하고, Faster-Whisper를 사용해 오디오를 인식하는 파이프라인을 사용합니다. 이후 대규모 언어 모델(LLMs)을 활용해 인식된 텍스트를 구조화된 노트, 요약, 마인드맵으로 처리합니다. 또한 사용자가 자연어 대화를 통해 검색, 음성 인식, 요약 등의 작업을 수행할 수 있는 대화형 에이전트인 ViNoter도 제공합니다. 효율성을 높이기 위해, 플랫폼의 기존 자막이 존재할 경우 시간이 오래 걸리는 ASR 프로세스를 건너뛰는 '자막 우선' 전략을 채택했습니다.
대상 사용자
- 학생 및 연구자: 교육용 비디오나 튜토리얼에서 핵심 포인트를 신속하게 추출하기 위해.
- 콘텐츠 제작자: 비디오 콘텐츠를 텍스트 형식이나 지식 카드로 정리하기 위해.
- 지식 종사자: 비디오 기반 학습 자료에서 개인 지식 기반을 구축하기 위해.
주요 기능
- ViNoter 에이전트: 검색 → 음성 인식 → 노트 작성 → 번역까지의 엔드투엔드 비디오 처리를 가능하게 하는 대화형 인터페이스.
- 다양한 형식 출력: Markdown 노트, 인터랙티브 마인드맵(Markmap 기반), 전용 지식 카드 생성.
- 지능형 비디오 QA: 특정 비디오 콘텐츠 또는 기존 노트 모음 기반으로 질문에 답변하는 AI 기반 QA 시스템.
- 광범위한 호환성: YouTube, Bilibili, 로컬 비디오 파일(MP4, AVI, MOV, MKV 등)을 지원.
- 지식 관리: 태그 시스템, 17개의 사전 설정 카테고리, SQLite 영구 저장을 통해 대량의 노트를 체계적으로 정리.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트