pyannote/pyannote-audio
사전 학습된 PyTorch 모델을 사용하여 음성 녹음에서 누가 언제 말했는지 식별하는 오픈소스 Python 툴킷입니다.
livecontext-ai/livecontext-ce
LiveContext CE는 단일 채팅 프롬프트로 전체 워크플로우, 범위가 지정된 LLM 에이전트, 데이터 테이블 및 작은 웹 앱을 생성하는 오픈 소스 셀프 호스팅 AI 자동화 플랫폼입니다. 시각적 워크플로우 엔진, 에이전트별 예산이 책정된 AI 에이전트, 700개 이상의 내장 통합 기능, 그리고 선택적인 브라우저 렌더링 추가 기능이 포함되어 있으며, 모두 단일 Docker-Compose 스택으로 배포할 수 있습니다.
edison7009/EchoBird
EchoBird는 Tauri + Rust로 구축된 크로스플랫폼 데스크톱 앱으로, 하나의 UI에서 다양한 AI 코딩 어시스턴트, 챗 에이전트, 로컬 LLM 런타임의 설치, 실행, 관리를 가능하게 합니다. 핵심 기능인 **Model Nexus**는 제공자 인증 정보를 한 번만 저장하고 각 도구의 네이티브 설정을 자동으로 재작성하여, 한 번의 클릭으로 어디서든 모델을 전환할 수 있습니다.
liustack/modsearch
ModSearch는 LLM 채팅 앱(특히 DeepSeek Harness)에 무료 실시간 웹 및 X(Twitter) 검색을 추가하는 플러그인입니다. 기본적으로 Firecrawl의 키리스 티어(월 1,000 무료 크레딧)를 사용하며 Antigravity CLI, Tavily, Exa, Grok 또는 로컬 페처로 폴백할 수 있고 자동 키 순환 및 할당량 처리를 지원합니다. 단일 `npx` 명령으로 설치하고 모델에게 검색이나 페이지 가져오기를 요청하기만 하면 됩니다. 스킬은 소스와 불확실성 플래그가 포함된 구조화된 JSON 응답을 반환합니다.
OpenLAIR/dr-claw
오픈소스, 모델에 의존하지 않는 AI 연구 보조자. 웹 UI, CLI, 데스크톱 앱을 통해 서베이 → 코드 → 분석 → 드래프트 → 슬라이드까지 논문 작성 파이프라인을 관리. Claude Code, Gemini, Codex 또는 OpenRouter 모델 사용 가능. 100개 이상의 내장 "연구 기술", 뉴스 피드, Git 통합, 한 번의 클릭으로 자동 연구 모드 제공.
hehehai/voxt
모든 애플리케이션에서 실시간 번역, AI 번역, 음성 프롬프트 기반 텍스트 재작성 기능을 제공하는 macOS 음성 입력 및 번역 앱입니다.
Blaizzy/mlx-audio
Apple Silicon을 위한 오디오 처리 라이브러리로, 텍스트에서 음성으로, 음성에서 텍스트로, 음성에서 음성으로, 음악 생성 모델에 대한 빠르고 효율적인 추론을 제공합니다.
langchain-ai/langchainjs
LangChain.js는 대규모 언어 모델을 사용하는 애플리케이션을 구축하기 위한 TypeScript 프레임워크입니다. 모듈형 컴포넌트(에이전트, 모델, 리트리버 등), 다양한 통합 기능 및 신속한 프로토타이핑과 프로덕션 모니터링을 위한 도구를 제공하며, Node, 브라우저, 에지 런타임 등을 지원합니다.
erupts/erupt
Erupt는 JPA 엔티티에서 어노테이션 기반으로 완전한 CRUD UI를 자동 생성하는 Java 관리 프레임워크입니다. 내장된 AI 모듈(`erupt-ai` 및 `erupt-ai-claw`)을 통해 다수의 LLM 제공업체 연동, 역할 기반 도구 보안, 채팅 기록, 자연어로 서버 제어가 가능합니다. 빠른 시작, 풍부한 UI 컴포넌트, RBAC, 다중 DB 지원, 선택적 상용 확장 기능을 갖추고 있어 Spring Boot 기반으로 AI 강화된 관리 패널을 즉시 구축할 수 있는 완성형 솔루션입니다.
peteonrails/voxtype
Voxtype는 오픈소스이며 MIT 라이선스를 따르는 리눅스 애플리케이션으로, 로컬에서 실시간 음성-텍스트 변환을 제공합니다. 빠른 CPU 모델(Cohere Transcribe 9~11배 실시간)을 사용하며 GPU/Intel NPU 가속을 지원하고, 아홉 가지 교환 가능한 인식 엔진, 다국어 지원, 회의 모드 인식, 그리고 깊이 있는 데스크톱 통합(Wayland/X11, 핫키 바인딩, 미디어 자동 일시정지, 파형 OSD)을 제공합니다. 모든 처리는 사용자가 원하지 않는 한 기계 내부에서 이루어집니다.
denizsafak/abogen
Kokoro-82M 모델을 사용하여 ePub, PDF, 텍스트 파일을 고품질 오디오와 동기화된 자막으로 변환하는 텍스트 음성 변환 도구입니다.
AbdoKnbGit/tau
Tau는 Claude, OpenCode, Mistral 등 28개의 LLM 제공자를 하나의 인터페이스로 통합하는 CLI 기반 코딩 어시스턴트입니다. 네이티브 API 어댑터, 파일 편집, LSP 진단, 스냅샷 기반 되돌리기, 브라우저 자동화, WhatsApp 또는 Cloudflare 터널을 통한 원격 제어, 서브에이전트, GitHub 통합, 자가 학습 규칙 시스템을 제공합니다. 단일 `npx` 명령어로 설치하고, 로그인, 모델 선택, 자연어 작업 명령을 내리기만 하면 사용 가능합니다. MIT 라이선스이지만 최신 Node, Git, Bash, GitHub CLI, 그리고 선택적으로 Go가 필요합니다.
NeptuneHub/AudioMuse-AI
AudioMuse‑AI는 사용자의 음악 컬렉션의 실제 오디오를 분석하여 사운드 기반 지문을 생성하는 오픈소스이자 자체 호스팅 가능한 애플리케이션입니다. 이 지문을 사용해 유사한 트랙을 클러스터링하고, 즉시 감정 기반 플레이리스트를 생성하며, 라이브러리를 2차원 시각 캔버스에 매핑하고 자연어 질의에 응답할 수 있습니다. Navidrome, Jellyfin, LMS, Lyrion, Emby, Plex와 호환되며, Docker-Compose, Helm 차트 또는 macOS/Windows/Linux의 네이티브 패키지를 통해 실행할 수 있습니다.
mkiol/dsnote
Linux 및 Sailfish OS용 개인 정보 중심의 오프라인 메모 앱으로, 음성 인식, 텍스트 음성 변환 및 기계 번역 기능을 제공합니다.
HaujetZhao/CapsWriter-Offline
Windows용 완전히 오프라인이고 저지연의 음성-텍스트 입력 도구로, 로컬 ASR 모델을 사용하여 푸시 투 톡 타이핑과 파일 전사 기능을 제공합니다.
TheDeathDragon/LiveTranslate
Windows용 실시간 오디오 번역 도구로, 시스템 오디오와 마이크 입력을 캡처하여 LLM 기반 오버레이를 통해 실시간 번역 자막을 제공합니다.
langchain-ai/open-swe
Open SWE는 코드 변경 사항을 계획, 작성, 테스트, 리뷰 및 배포할 수 있는 자율형 AI 에이전트를 실행하는 LangChain 기반 프레임워크입니다. GitHub, Slack, Linear 및 웹 대시보드와 통합되며, 격리된 샌드박스(LangSmith, Modal 등)를 사용하며, 완전히 커스텀할 수 있고 셀프 호스팅이 가능합니다.
davebcn87/pi-autoresearch
pi-autoresearch는 AI 코딩 어시스턴트가 측정 가능한 모든 목표에 대해 자율 최적화 루프(편집-커밋-벤치마크-유지/복구)를 실행할 수 있게 해주는 pi-agent 확장 기능입니다. 상태는 .auto/ 폴더에 영구 저장되며, 라이브 위젯/대시보드, 신뢰도 점수, 선택적 검사 및 후크, 그리고 검토 가능한 git 브랜치를 생성하는 마무리 단계를 제공합니다.
QwenAudio/SenseVoice
다국어 음성 인식, 감정 감지 및 오디오 이벤트 식별을 제공하는 고정밀, 저지연 음성 파운데이션 모델.
KittenML/KittenTTS
25MB 크기의 모델로 CPU에서 고품질 음성 합성을 제공하는 가벼운 ONNX 기반 텍스트 음성 변환 라이브러리입니다.
mezmo/aura
AURA는 자체 인프라 내에서 AI 기반 SRE 에이전트를 실행할 수 있는 오픈소스 플랫폼입니다. 구성 가능한 다중 에이전트 런타임을 제공하며, 도구 호출, 관측성 시스템 쿼리, 안전한 작업 실행이 가능합니다. 데이터 및 모델 사용은 모두 귀하의 통제 하에 있습니다.
Anionex/banana-slides
Banana Slides는 아이디어, 개요, 업로드된 문서를 완전히 편집 가능한 PowerPoint 데크로 변환하는 오픈소스 AI 기반 앱입니다. LLM(Gemini, OpenAI, Claude 등)과 이미지 생성 모델을 사용하여 텍스트 및 그래픽을 생성하며, 자연어 기반의 "바이브" 편집, 사용자 정의 템플릿, 다중 포맷 임포트, PPTX/PDF 내보내기, 선택적 나레이션 동영상 출력을 지원합니다. Docker, 원클릭 클라우드 템플릿 또는 데스크톱 바이너리로 배포 가능하며, 빠르고 고품질의 슬라이드 제작을 원하는 누구나 사용할 수 있습니다.
razzant/claudexor
Claudexor는 여러 AI 코딩 서비스(Codex, Claude Code, Cursor 등)를 단일 타입 지정 인터페이스로 통합하는 로컬 우선 Node.js 제어 플레인입니다. 읽기 전용 쿼리, 패치 생성 쓰기 턴, 모델 간 Best-of-N 레이스 및 크로스 모델 리뷰, 실시간 할당량 추적 기능이 있는 자격 증명 프로필, 보호 파일용 결정론적 게이트, macOS 데스크톱 앱을 제공합니다. 모든 상태는 귀하의 머신에 저장되며, 테레메트리가 전혀 전송되지 않으며, SSH를 통해 원격에서도 실행 가능합니다. 프로젝트는 현재도 적극적으로 유지 관리 중이며(v3.10.2), 감사 가능하고 비용을 통제할 수 있는 AI 지원 개발이 필요한 개발자나 에이전트를 위한 것입니다.
nazdridoy/kokoro-tts
Kokoro 모델을 사용하는 CLI 텍스트 음성 변환 도구로, 텍스트, PDF, EPUB를 자연스러운 음성으로 변환하며 음성 블렌딩과 스트리밍을 지원합니다.
ilyhalight/voice-over-translation
다양한 웹사이트의 동영상에 실시간 음성 번역과 AI 자막을 추가하는 브라우저 확장 프로그램으로, 사용자가 자신의 모국어로 외국어 콘텐츠를 시청할 수 있도록 합니다.
dyoshikawa/rulesync
Rulesync 는 Node.js CLI로 AI 어시스턴트 설정을 중앙화합니다. `.rulesync/` 규칙 파일을 하나 작성하면, Claude, Copilot, Cursor 등 수십 가지 AI 코딩 도구의 네이티브 구성 파일을 생성, 가져오기, 내보내기, 또는 변환할 수 있습니다. npm, Homebrew, 또는 싱글 바이너리 스크립트로 설치 가능합니다. 선택적 생성, 광범위한 도구 지원, 비추천 기능 처리, 프로그래밍 API 등의 기능을 갖추고 있습니다. MIT 라이선스.
espeak-ng/espeak-ng
포르망 합성 기술을 사용하여 100개 이상의 언어를 지원하고 매우 작은 메모리 사용량을 자랑하는 컴팩트한 오픈소스 텍스트 음성 합성기입니다.
qufei1993/skills-hub
Skills Hub는 Tauri 기반 데스크톱 앱으로, AI 코딩 "스킬"(프롬프트/에이전트 번들)을 중앙 집중화하고 심볼릭 링크 또는 복사를 통해 Cursor, Claude Code, Codex 등 다양한 AI 코딩 도구의 글로벌 또는 프로젝트 레벨 스킬 폴더에 동기화합니다. 탐색-설치, 태그 지정, 일괄 작업, 휴지통, Git 기반 자동 기기 동기화 및 예약 업데이트를 제공하며, 모두 다국어 UI를 통해 설정할 수 있습니다.
VocaHQ/vocalinux
Whisper 및 VOSK와 같은 엔진을 사용하여 기기 내에서 로컬로 음성을 타이핑된 텍스트로 변환하는, 개인정보 보호에 중점을 둔 Linux용 음성 받아쓰기 앱.
openai/openai-python
OpenAI API용 공식 Python SDK로, 동기/비동기 클라이언트, 채팅, 완성, 비전, 실시간 오디오, 스트리밍, 페이지네이션, 파일 업로드, 웹훅 검증, 그리고 현대적인 워크로드 아이덴티티 인증(K8s, Azure, GCP, X.509)을 완전히 타입 체크된 방식으로 제공.
SamurAIGPT/llm-wiki-agent
LLM Wiki Agent는 서버나 데이터베이스 없이 로컬에서 PDF, DOCX, 마크다운 등을 인제스트하고, 엔티티와 개념을 추출하여 성장하는 상호 연결된 마크다운 위키를 구축하며, 모순을 탐지하고 시각적 지식 그래프를 생성하는 에이전트 기반 시스템입니다.
awslabs/mcp
오픈소스 MCP(Model Context Protocol) 서버로, LLM 기반 도구가 실시간 AWS 문서, IaC 가이드라인, 안전한 AWS API를 가져올 수 있게 합니다. 문서, IaC, EKS 등에 대한 마ネ지드 원격 서버와 로컬 바이너리 모두 제공되며, stdio 기반 프로토콜로 접근 가능합니다.
AVIDS2/memorix
Memorix는 어떤 AI 코드 보조 도구에도 로컬 우선, 검색 가능한 메모리 저장소를 추가하는 Node.js 라이브러리입니다. 사실, 설계 근거, Git에서 유도된 통찰을 SQLite 데이터베이스에 영구 저장하고, MCP, CLI, 그리고 선택적 웹 UI를 통해 노출합니다. 단일 `memorix setup --agent <name>` 명령어를 설치함으로써, 수십 개의 에이전트(Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI 등)가 동일한 프로젝트 범위의 메모리를 공유할 수 있어, 원활한 인수인계, 더 나은 컨텍스트 유지, 다중 에이전트 오케스트레이션을 가능하게 합니다.
rampstackco/claude-skills
브랜드, 디자인, 콘텐츠, SEO, 제품 관리, 성장 및 운영을 다루는 103개의 Claude Skills로 구성된 진정한 오픈소스 라이브러리입니다. Skills는 재사용 가능한 프롬프트+메타데이터 번들로, Claude가 온디맨드로 로드할 수 있어 웹사이트 구축, 출시, 최적화를 위한 엔드투엔드 AI 기반 워크플로우를 가능하게 합니다.
remsky/Kokoro-FastAPI
고품질의 다국어 음성 생성을 위한 OpenAI 호환 API를 제공하는 Docker화된 FastAPI 래퍼로, Kokoro-82M TTS 모델을 래핑합니다.
TeamWiseFlow/xiaobei
xiaobei(小贝)는 중국 셀프미디어 운영자를 위한 AI 기반 개인 비서입니다. 오픈 소스 **openclaw** 프레임워크를 기반으로 구축되어 사용자는 간단한 WeChat 채팅을 통해 기사, 이미지, 짧은 동영상을 여러 플랫폼(WeChat, 샤오홍슈, Douyin, Twitter 등)에서 생성, 포맷, 게시할 수 있습니다. 또한 트렌드 분석, 성과 모니터링, 24/7 AI 고객 서비스, 시장 조사 검색, 비즈니스 문서 생성도 제공합니다. 설치는 사전 빌드 tarball을 다운로드하는 원라이너 스크립트이며, QR 코드를 스캔하면 봇이 준비됩니다. 시스템은 Ubuntu/macOS/Windows에서 실행되며, Alibaba Bailei 대규모 모델 API(또는 대안)를 사용하고, 안정적인 자동화를 위한 사용자 정의 안티 디텍트 브라우저 스택(camoufox)을 포함합니다. 선택적 유료 'VIP Club'은 프리미엄 지원 및 서비스를 추가합니다.
homelab-00/TranscriptionSuite
다양한 AI 모델을 사용해 컴퓨터에서 음성을 텍스트로 변환하는 무료로 오픈소스의 전사 앱으로, 개인 정보 보호와 속도를 위해 로컬에서 작동합니다.
NoFxAiOS/nofx
NOFX는 대규모 언어 모델이 암호화폐 무기한 선물 거래를 생성할 수 있도록 하는 오픈 소스 셀프 호스팅 거래 터미널입니다. Go 런타임이 엄격한 리스크 제한을 적용하고, 모델이 생성한 모든 추론을 저장하며, 9개의 거래소를 지원합니다. 사용자는 온체인 AI 수수료 지갑에 자금을 충전하고 Autopilot을 시작하여 모델이 자동으로 거래하게 할 수 있으며, 공개 리더보드에서 여러 트레이더를 비교할 수 있습니다. 설치는 한 줄 스크립트, Docker, Railway 또는 수동 빌드를 통해 가능합니다.
coddingtonbear/obsidian-local-rest-api
로컬 HTTPS REST API와 Model-Context-Protocol 서버를 실행하는 Obsidian 플러그인으로, 스크립트, 브라우저 확장 프로그램, AI 에이전트가 보관소에 대해 완전한 CRUD, 타겟 마크다운 패치, 검색, 명령 실행 등을 수행할 수 있게 합니다. 인증은 베어러 토큰과 자체 서명된 인증서를 사용하며, Claude 및 Cursor용 준비된 MCP 구성도 제공됩니다.
matthartman/ghost-pepper
데이터가 기기를 벗어나지 않도록 로컬 AI 모델을 사용하는 macOS용 프라이버시 중심 온디바이스 음성-텍스트 변환 및 회의 녹취 앱입니다.
crosswk/SayIt
Windows용 오픈소스 음성 입력 도구로, 음성을 인식하고 AI로 정리하여 정교한 텍스트를 어떤 애플리케이션에도 직접 삽입합니다.
aiworkskills/wechat-article-skills
각 단계에서 사용자 확인을 기다리는 방식으로, 기사 작성, 검토, 포맷팅, 일러스트 생성 및 WeChat 공식 계정 게시까지 엔드투엔드 워크플로우를 자동화하는 오픈소스 AI 에이전트 스킬 세트입니다.
tanweai/pua
pua는 기업 스타일의 '성과 향상 계획'(PUA/PIP) 표현과 7단계 디버깅 체크리스트를 AI 코딩 어시스턴트(Claude Code, OpenAI Codex, Cursor, Kiro 등)에 주입하는 다중 플랫폼 스킬입니다. 모델이 게으른 패턴(재시도, 사용자 비난, 수동 대기)을 보이거나 `/pua` 명령어로 수동으로 호출되면 자동으로 작동합니다. 이 스킬은 모델이 해결책을 끝까지 고려하고 결과를 검증하며 능동적으로 행동하도록 강제하며, 중국어, 영어, 일본어의 언어별 팩을 제공합니다. 소수의 버그에 대한 벤치마크 결과는 수정 수와 검증 단계 수가 증가했지만, 속도 향상은 제한적입니다. 설치는 각 도구의 플러그인/스킬 시스템을 통해 수행됩니다(예: `npx skills add tanweai/pua --skill pua-en`으로 Claude Code에 설치)
owainlewis/machinist
Machinist는 Go 기반 CLI로, 이름이 지정된 AI 코딩 명령어(예: 이슈에서 PR 생성)를 정의하고, 어떤 LLM 호환 실행 파일로든 로컬에서 실행할 수 있습니다. 리포지토리, 자격 증명, 모델 설정은 워커에 유지되며, 전체 로그 스트리밍, 타임아웃 강제, 인간 검토를 위한 항상 풀 리퀘스트를 반환합니다. 반복 가능하고 감사 가능한 AI 지원 코딩 워크플로우에 이상적입니다.
pipeshub-ai/pipeshub-ai
PipesHub는 Slack, Google Drive, GitHub 등 기업 데이터에 LLM을 연결할 수 있는 오픈소스이며 자체 호스팅 가능한 플랫폼입니다. 권한 인식 지식 그래프를 구축하고, 인용문이 포함된 설명 가능한 답변을 제공하며, LangChain을 통해 어떤 LLM도 지원합니다. 50개 이상의 연결자, 멀티모달 문서 처리, 노코드 에이전트 빌더, Python, TypeScript, Go용 SDK를 제공하며, 단일 Docker Compose 설치자로 배포 가능합니다.
IAHispano/Applio
단순함과 성능에 초점을 맞춘 고품질 음성 변환 도구로, 음성 변환을 위한 유연한 플랫폼을 제공합니다.
dark-hxx/CLI-Manager
CLI-Manager는 Tauri 기반 데스크톱 앱으로, 로컬 및 SSH 터미널을을까합니다. 로컬 터미널, 원크릭 클릭 한 번으로ary, Codex, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, ClaudeCode, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, la, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude Code, Claude================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================================0.00000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000-0.000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000000합니다. 로컬 터미널, 원격 서버, 그리고 모바일 메신저를 하나의 통합된 분석 중심 환경으로 연결합니다.
kizuna-ai-lab/sokuji
Sokuji는 회의용 실시간 양방향 음성 번역을 제공하는 크로스 플랫폼 데스크톱 앱 및 브라우저 확장 프로그램입니다. WASM + WebGPU를 사용한 온디바이스 ASR, 번역 및 TTS 모델을 사용하여 완전히 오프라인으로 실행하거나 OpenAI, Gemini, Soniox와 같은 클라우드 제공업체에 연결할 수 있습니다. 인식은 99개 언어 이상, 번역은 55개 언어 이상, TTS는 53개 언어를 지원하며, Windows/macOS/Linux 및 Chrome/Edge에서 작동하고 프라이버시 우선 로컬 추론을 제공합니다.