ogulcancelik/pi-extensions

Pi라는 터미널 기반 코딩 어시스턴트를 UI 푸터, 세션 검색, 자동 권한, 서브에이전트, 워크트리 처리 및 기타 유틸리티로 확장하는 npm 기반 플러그인 모음입니다.

asklokesh/loki-mode

Loki Mode는 제품 사양을 완전히 구축, 테스트, 검증된 코드베이스로 전환하는 오픈소스 CLI/SDK입니다. 자율적인 LLM 기반 워크플로우(Reason-Act-Reflect-Verify)를 실행하며 8개의 품질 게이트 체크를 수행하고, 누구나 재검증 가능한 암호적으로 결합된 '증거 수령서'를 생성합니다. bun/npm/Homebrew/Docker로 설치 가능하며, 새 앱은 `loki quickstart`, 기존 리포지토리 개선은 `loki modernize heal`로 사용합니다. Anthropic API 키(또는 호환 모델)가 필요하며, 감사 가능하고 프로덕션 수준의 코드 생성에 중점을 둡니다.

kaixxx/noScribe

연구자와 기자들이 데이터 프라이버시를 보장할 수 있도록 설계된, 로컬에서 작동하는 무료이고 오픈소스의 음성 텍스트 변환 및 발화자 식별 앱

knowsuchagency/mcp2cli

mcp2cli는 MCP 서버, OpenAPI 명세, 또는 GraphQL 엔드포인트를 즉시 사용 가능한 명령줄 도구로 변환하는 런타임 CLI 생성기입니다. OAuth, secret‑safe 플래그, baked configurations, usage‑aware ranking, 그리고 machine‑readable JSON 출력을 지원하여, LLM 에이전트와 개발자가 최소한의 토큰 오버헤드로 API를 호출할 수 있게 합니다.

ken107/read-aloud

Chrome 및 Firefox용 브라우저 확장 프로그램으로, 텍스트 음성 변환 기술을 사용하여 웹 페이지 텍스트를 오디오로 변환함으로써 접근성을 향상시키고 멀티태스킹을 지원합니다.

plasma-umass/scalene

Scalene는 CPU, GPU (NVIDIA) 및 메모리 사용량을 측정하는 빠른 행 단위 Python 프로파일러입니다. Python과 네이티브 코드를 분리하고, 통합된 스택을 시각화하며, UI에서 직접 LLM(OpenAI, Azure, Bedrock, Ollama 등)에 최적화 제안을 요청할 수 있습니다.

ZaxbyHub/opencode-swarm

OpenCode Swarm는 단일 AI 코딩 프롬프트를 리뷰, 테스트, 보안 스캔, 문서화를 강제하는 게이트형 프로덕션 준비 완료 워크플로우로 전환하는 OpenCode 플러그인입니다. 13개 언어를 지원하며, 재개 가능한 세션, PR 모니터링, 여러 안전/속도 모드를 제공합니다. `bunx opencode‑swarm install`로 설치; `~/.config/opencode/opencode‑swarm.json`로 설정; `/swarm agents`, `/swarm status`, `/swarm auto‑proceed`와 같은 슬래시 명령어로 프로세스를 제어합니다.

librosa/librosa

음악 정보 검색 시스템 구축을 위한 기초 도구를 제공하는 오디오 및 음악 신호 처리용 Python 라이브러리입니다.

SamadhiFire/xinqingnian-maoxuan-skill

Claude/Codex용 스킬로, 막힌 프로젝트, 팀 갈등, 삶의 결정에 대해 4단계 '모스타일' 분석을 수행하고 간결한 텍스트 요약 및 선택적 단일 파일 HTML 리포트를 출력합니다.

TaoLiveAIGC/TaoMate

TaoMate는 연구용 실시간 음성·영상 디지털 인간 생성 시스템입니다. 리포지토리는 추론 코드, 멀티 GPU 실행 스크립트, 4GPU 인터랙티브 브라우저 데모를 제공합니다. 22B LTX-2.3 트랜스포머, Gemma-3 텍스트 인코더, 선택적 Gemma-4 대화 모델을 통합하며, 고메모리 NVIDIA GPU와 Hugging Face에서 별도로 다운로드한 모델 체크포인트가 필요합니다.

diodiogod/TTS-Audio-Suite

TTS Audio Suite는 F5‑TTS, DramaBox, Higgs Audio, Qwen3‑TTS, RVC 등 19개의 텍스트-음성, 음성 변환 및 오디오 편집 엔진을 통합하는 ComfyUI 확장입니다. 자막 인식 생성, 세그먼트별 태그, 시각적 파형 분석, 사이렌트 스피치 타이밍, 내장된 RVC 모델 학습 기능을 제공하며, 각 엔진의 런타임 격리로 의존성 충돌을 방지합니다.

pytorch/audio

기계 학습을 위한 음성 데이터 처리 도구를 제공하는 PyTorch 기반의 음성 라이브러리로, GPU 가속과 전용 음성 변환 기능을 갖추고 있습니다.

estebanstifli/LocalText2Voice

로컬 또는 클라우드 AI 텍스트 음성 변환 엔진을 사용하여 장편 오디오북과 팟캐스트를 만드는 데스크톱 앱으로, 내장된 품질 검증 및 오디오 믹싱 기능을 제공합니다.

sdatkinson/NeuralAmpModelerPlugin

Neural Amp Modeler 엔진을 DAW에 통합하는 VST3/AudioUnit 플러그인으로, AI 기반 기타 앰프 모델링을 제공합니다.

genomoncology/biomcp

BioMCP는 사용자와 AI 에이전트가 약 30개의 생물의학 데이터베이스(PubMed, ClinVar, ClinicalTrials.gov, OncoKB 등)를 간단한 명령 문법으로 쿼리하고, 엔티티 간 피벗, 로컬 연구 분석 및 유전자 세트 농축 분석을 수행할 수 있게 해주는 통합 CLI/MCP 서버입니다. 스크립트, uv/pip, Homebrew, Docker 또는 소스를 통해 설치할 수 있으며, 출처가 명확한 JSON 또는 터미널 출력을 제공하고 Claude Code, Codex 및 Claude Desktop과 직접 통합됩니다.

vllm-project/vime

Vime는 대규모 언어 모델(LLM)을 위한 오픈 소스 RL 사후 학습 프레임워크입니다. slime/Megatron 분산 학습 스택과 vLLM 추론(vllm-router를 통해)을 결합하여 높은 처리량의 rollout을 제공하고 유연한 데이터 생성 파이프라인을 제공합니다. 지원되는 모델은 Qwen, DeepSeek V3, LLaMA 3가 있습니다. 사용자는 Megatron, vLLM, 및 router 인자를 설정하여 agentic RL, coding-agent RL 또는 커스텀 RL 알고리즘을 실행할 수 있습니다. 이 저장소는 빠른 시작 가이드, 여러 준비된 예제, 그리고 개발자를 위한 명확한 코드 읽기 경로를 제공합니다.

tile-ai/tilelang-ascend

TileLang‑Ascend는 Huawei Ascend NPU에서 고성능 AI 커널을 작성하기 위해 TVM 위에 구축된 Python 스타일의 DSL입니다. Ascend 전용 코드를 내보내는 컴파일러를 제공하며, 자동 벡터화, 메모리 계획 및 동기화를 지원하고, pip로 설치 가능한 wheel 형태로 제공되어 많은 기성 예제(GEMM, Flash‑Attention 등)와 함께 제공됩니다.

matrixorigin/memoria

Memoria는 MatrixOne 데이터베이스 위에 구축된 AI 에이전트 기억의 Git 스타일 버전 관리 계층입니다. 모든 기억 변경에 대해 스냅샷, 브랜치, 머지, 롤백을 제공하며, 하이브리드 벡터/전체 텍스트 검색, 자동 모순 탐지, 개인정보 우선 배포 모델(클라우드 또는 자체 호스팅)을 갖춥니다. 에이전트는 MCP 명령어 또는 REST API를 통해 상호작용하여 기억을 안전하게 변경하고, 감사 가능하며 세션 간 재사용이 가능하게 합니다.

SUC-DriverOld/MSST-WebUI

다양한 AI 모델을 사용하여 음악 트랙에서 보컬과 악기를 분리할 수 있는 웹 기반 인터페이스로, Music-Source-Separation-Training을 위한 도구입니다.

bolna-ai/bolna

Bol na는 음성-텍스트, LLM, 텍스트-음성 서비스를 조율하여 전화 통화를 발신 및 수신할 수 있는 음성 중심의 어시스턴트를 구축할 수 있는 오픈소스 프레임워크입니다. 핵심 서버, 통화 웹훅(Twilio/Plivo), Redis, ngrok용 Docker-Compose 컨테이너를 제공하며, 스트리밍 파이프라인을 구축하기 위한 Python SDK(`Assistant`)를 제공합니다. 제공업체 독립적(Deepgram, Azure, OpenAI, ElevenLabs, AWS Polly 등 지원)이며, 새로운 통화 또는 오디오 서비스로 확장 가능합니다.

royshil/obs-localvocal

OpenAI의 Whisper를 사용하여 프라이버시를 보장하고 클라우드 비용 없이 실시간 로컬 음성-텍스트 변환 및 번역을 제공하는 OBS 플러그인입니다.

DeadWaveWave/opencove

OpenCove는 AI 코딩 에이전트(Claude Code, Codex 등)를 실행하는 터미널, 메모, 작업, 이미지를 배치할 수 있는 무한 2D 캔버스를 제공하는 크로스 플랫폼 Electron 앱입니다. 레이아웃, 터미널 출력 및 에이전트 상태는 재시작 후에도 유지되며, 캔버스 스냅샷을 저장하여 나중에 다시 사용할 수 있습니다. 이 앱은 AI 어시스턴트 워크플로우를 탭이나 긴 채팅 로그 속에 숨기지 않고 공간적으로 구성하는 것을 목표로 합니다.

elevenlabs/elevenlabs-python

ElevenLabs의 공식 Python SDK로, 현실적인 AI 텍스트 음성 변환, 음성 클론, 실시간 대화형 AI 에이전트를 애플리케이션에 통합할 수 있습니다.

prathoshap/vagdhenu

단순한 낭독이 아닌 전통적인 선율의 영창을 생성하는 프로덕션급 산스크리트어 영창 텍스트 음성 변환(TTS) 시스템입니다.

spotify/pedalboard

오디오 파일과 라이브 스트림에 스튜디오 수준의 오디오 효과와 제3자 VST3/Audio Unit 플러그인을 읽고 쓰며 적용할 수 있는 고성능 Python 라이브러리입니다.

LearnPrompt/humanize-ppt

Humanize PPT는 마크다운을 청중 상태 전이(ASD) 슬라이드 계획으로 변환하고, 각 슬라이드의 미디어를 결정하며, 하류 HTML 또는 PPTX 렌더링 기술에 렌더링을 위임하고, 자동 프레젠테이션 검사를 통해 "예쁘지만 말할 수 없는" 슬라이드를 탐지하며, 가벼운 프레젠테이션 쉘을 생성하는 오픈소스 파이썬 오케스트레이션 도구입니다. AI 에이전트(Claude‑Code, Codex, Hermes)와 간단한 스킬 설치로 통합 가능하며, `guizang-ppt-skill`, `frontend-slides`, `ppt‑master`, `baoyu-image-gen`, Remotion과 같은 하류 렌더러와 호환됩니다. MIT 라이선스.

flybirdxx/ComfyUI-Qwen-TTS

Qwen3-TTS 모델 기반의 고품질 음성 합성, 제로샷 음성 클론, 자연어 기반 음성 설계를 지원하는 ComfyUI 커스텀 노드.

mbailey/voicemode

클라우드 또는 로컬 음성 서비스를 사용하여 Claude Code 및 기타 MCP 호환 에이전트와 자연스럽고 손을 떼고 대화할 수 있는 음성 인터페이스입니다.

Dicklesworthstone/coding_agent_session_search

수십 개의 AI 코딩 어시스턴트의 대화 로그를 수집, 정규화, 인덱싱하여 로컬 SQLite 아카이브에 저장하는 Rust 기반 터미널 UI 및 CLI 도구. 60ms 미만의 어휘 검색과 선택적 디바이스 내 MiniLM 세마틱 검색을 제공하며, 자동화 및 진단용 안정적인 JSON 로봇 모드 API를 제공.

KoljaB/RealtimeSTT

음성 활동 감지 및 웨이크 워드 지원이 통합된 빠르고 실시간 전사를 제공하는 Python 음성-텍스트 변환 라이브러리입니다.

di-sukharev/opencommit

OpenCommit은 스테이징된 변경 사항에서 LLM(OpenAI, Anthropic, Ollama 등)을 사용하여 전통적이고 이모지가 포함된 Git 커밋 메시지를 자동 생성하는 Node.js CLI입니다. 전역 및 리포지토리별 설정, 여러 제공자, 로컬 모델 서버, Git 훅, GitHub Action을 지원하여 커밋 메시지의 자동 개선이 가능합니다.

richardr1126/openreader

EPUB, PDF, TXT, MD, DOCX 파일을 지원하는 오픈소스이자 자체 호스팅 가능한 텍스트 음성 변환 문서 리더로, 단어 단위 동기화 하이라이트 기능을 제공합니다.

OpenMOSS/MOSS-Audio

MOSS-Audio는 음성, 환경 음, 음악 분석을 통합하고 강력한 시간 인식 및 추론 능력을 갖춘 오픈소스 음성 이해 모델입니다.

kigner/audio.cpp-webui

ggml 기반의 고성능 C++ 오디오 추론 프레임워크로, 다양한 하드웨어 백엔드에서 TTS, ASR 및 음성 복제 모델의 빠르고 휴대 가능한 로컬 실행을 가능하게 합니다.

riba2534/happyclaw

HappyClaw는 Anthropic의 Claude Code 에이전트를 장기간 실행되는 다중 사용자 서비스로 자체 호스팅할 수 있는 플랫폼입니다. Claude Agent SDK (TypeScript)와 Claude Code CLI를 래핑하여 웹 기반 인터페이스와 8개의 인스턴트 메시징 채널 인터페이스를 제공하며, 격리된 워크스페이스(호스트 또는 Docker), 전체 Claude Code 기능(파일 접근, 쉘, 브라우저, 플러그인), 스케줄링, 사용량 추적, 기업용 RBAC 및 백업을 지원합니다.

hkjarral/AVA-AI-Voice-Agent-for-Asterisk

Asterisk 및 FreePBX용 오픈소스 AI 음성 에이전트로, STT, LLM, TTS 제공업체의 모듈식 파이프라인을 제공하여 프로덕션 준비 완료된 음성 봇을 구축할 수 있습니다.

magenta/magenta-realtime

Apple Silicon의 오디오 스트리밍에 최적화된 실시간 음악 생성을 위한 오픈 웨이트 모델 및 추론 엔진.

Eddycrack864/UVR5-UI

다양한 AI 모델을 사용하여 오디오 및 비디오 파일에서 보컬과 악기를 분리할 수 있는, `python-audio-separator` (UVR5의 파이썬 버전)용 사용자 친화적인 그래픽 인터페이스입니다.

f-is-h/Usage4Claude

Usage4Claude는 Anthropic Claude (및 선택적 OpenAI Codex) 구독 할당량을 실시간으로 모니터링하는 네이티브 macOS 메뉴 바 앱입니다. 모든 Claude 제품, 멀티 계정, 적응형 새로고침, 색상별 사용량 링, 알림, 그리고 macOS Keychain에 자격 증명을 안전하게 저장합니다. Pre-built DMG를 통해 설치하거나 Swift/SwiftUI로 소스 코드를 빌드할 수 있습니다.

andimarafioti/faster-qwen3-tts

CUDA 그래프 캡처를 사용하여 실시간, 저지연 보이스 클로닝 및 음성 생성을 가능하게 하는 Qwen3-TTS용 고성능 추론 엔진입니다.

FireRedTeam/FireRedASR2S

음성 인식, 음성 활동 감지, 언어 식별, 문장 부호 예측을 결합하고 중국어 방언에 특화된 지원을 제공하는 산업용 등급의 올인원 ASR 시스템입니다.

JordyZomer/lemmalog

Lemmalog은 LLM에서 추출한 삼항식을 검증 가능하고 단계적으로 업데이트 가능한 메모리 저장소로 변환하는 Rust 기반 Datalog 엔진입니다. 신뢰도 가중치 사항, 시간적 유효성, 엔티티 표준화, 증명 트리 생성, 하이브리드 BM25 + 엔티티 검색 레이어를 지원합니다. CLI, REPL 또는 JSON-RPC MCP 서버를 통해 통합되어 Claude Code/Kimi 에이전트를 구동하며, MemEval 스타일 벤치마크에서 경쟁력 있는 성능을 달성하면서도 전체 컨텍스트 기반선보다 훨씬 적은 토큰을 사용합니다.

sdatkinson/NeuralAmpModelerCore

오디오 플러그인에서 뉴럴 앰프 모델을 실행하기 위해 필요한 신경망 로직을 제공하는 핵심 C++ DSP 라이브러리.

langchain-ai/social-media-agent

URL을 스크레이핑하여 Twitter/LinkedIn 게시물 초안을 작성하고, 인간의 검토를 거쳐 Arcade 또는 네이티브 OAuth를 통해 게시하는 LLM 기반 에이전트. LangGraph를 기반으로 구축되었으며 Slack, Supabase, GitHub, YouTube 통합 옵션을 지원하고 프롬프트 파일로 설정 가능합니다.

speechbrain/speechbrain

음성 인식 및 합성을 포함하여 음성 및 텍스트 처리를 위한 레시피와 도구를 제공하는 대화형 AI용 오픈 소스 PyTorch 툴킷입니다.

Kieirra/murmure

Murmure는 NVIDIA의 Parakeet TDT 0.6B v3 모델을 사용하는 오픈소스 데스크톱 앱으로, 온라인 없이 개인정보를 우선시하는 음성-텍스트 변환을 제공합니다. Windows, macOS, Linux에서 로컬 실행 가능하며, 25개 유럽 언어를 지원하고, 텔레메트리 없이 간단한 푸시투톡 UI를 제공합니다.

stemrollerapp/stemroller

StemRoller는 통합된 YouTube 검색을 통해 찾은 노래에서 Demucs 알고리즘을 사용해 보컬과 악기 스템을 분리하는 무료 애플리케이션입니다.

azuwis/pianotrans

ByteDance의 피아노 음역 추정 시스템을 위한 GUI 및 패키징 도구로, 피아노 오디오 및 비디오 녹음을 페달 정보를 포함한 MIDI 파일로 변환합니다.