lycohana/BiliSum
为 Bilibili、YouTube 及本地视频提供 AI 视频摘要和知识库.AI video summarizer and knowledge base for Bilibili, YouTube and local videos.
What it solves
BiliSum은 긴 영상 콘텐츠에서 지식을 추출하고 정리하는 데 따르는 어려움을 해결합니다. Bilibili, YouTube 또는 로컬 파일을 구조화된 텍스트, 시각적 노트, 검색 가능한 지식 베이스로 변환하는 프로세스를 자동화하여, 수동으로 전사(transcription)하거나 노트를 작성할 필요를 없애줍니다.
How it works
이 도구는 다음과 같은 파이프라인을 따릅니다: 영상 콘텐츠를 가져오고, ASR(Automatic Speech Recognition)을 사용하여 전사를 수행한 다음, LLM과 VLM(Vision Language Models)을 활용하여 요약, 구조화된 노트, 마인드맵을 생성합니다. 또한 주요 프레임을 추출하여 시각적 문맥에 따라 이미지가 텍스트와 통합되는 "VLM-이해형" 시각적 노트를 생성할 수 있습니다. 장기 보관을 위해, 임베딩(embeddings)을 사용하여 여러 영상에 걸쳐 의미론적 검색 및 질의응답이 가능한 로컬 RAG(Retrieval-Augmented Generation) 시스템을 구축합니다.
Who it’s for
교육적 또는 정보성 영상 콘텐츠를 소비하며, 해당 콘텐츠를 영구적이고 검색 가능한 개인 지식 베이스로 변환하고자 하는 학생, 연구자, 그리고 평생 학습자를 위해 설계되었습니다.
Highlights
- Multimodal Note-taking: 전사 내용과 AI가 선택한 영상 스크린샷을 결합하여 시각적 노트를 생성합니다.
- Local-First Privacy: 데이터, 인덱스, 설정은 로컬에 저장되며, 로컬 LLM 및 임베딩을 지원합니다.
- Flexible Input: Bilibili, YouTube 및 로컬 영상 형식(mp4, mkv, mov, webm)을 지원합니다.
- Agent Integration: CLI와 특정 "skill"을 제공하여 Claude나 Cursor와 같은 AI 에이전트가 요약 및 전사를 트리거할 수 있도록 합니다.
- Knowledge Management: 영상 간 의미론적 검색 및 마인드맵 생성을 위한 RAG 기반 지식 베이스 기능을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트