PowerBeef/Vocello
macOS 및 iOS용 로컬 우선 음성 스튜디오로, MLX와 Swift를 사용하여 클라우드 의존 없이 고품질 음성 생성을 가능하게 하며, 음성 클로닝과 커스텀 음성 설계 기능을 제공합니다.
nateshmbhat/pyttsx3
인터넷 연결 없이 음성 출력을 생성하기 위한 Python 라이브러리로, 네이티브 시스템 엔진을 사용하여 오프라인 텍스트 음성 변환을 수행합니다.
readbeyond/aeneas
음성 내레이션과 해당 텍스트 조각을 자동으로 동기화하는 Python/C 라이브러리 및 도구 세트입니다.
ashbuilds/payload-ai
콘텐츠 필드에 AI 기반 텍스트, 이미지, 음성 생성 기능을 추가하는 Payload CMS 플러그인. 여러 모델 제공업체를 지원하며, 세밀한 구성과 접근 제어를 제공합니다.
SponsioLabs/Sponsio
Sponsio는 LLM 기반 에이전트에 결정론적이고 마이크로초 단위의 가드레일을 추가하는 오픈소스 라이브러리입니다. 형식 메서드 기반의 계약(YAML 규칙북)을 작성하여 모든 도구 호출 시 강제 적용할 수 있으며, 모델을 호출하지 않고도 작업을 차단, 경고 또는 허용할 수 있습니다. 이 라이브러리는 Python 또는 TypeScript의 LangChain, Claude, OpenAI, CrewAI 및 기타 에이전트 프레임워크와 통합되며, 22개의 기성 계약 번들이 포함되어 있고 감사 및 검토를 위한 호스팅 콘솔을 제공합니다. 벤치마크에 따르면 잘못된 동작이 95% 이상 감소하고 호출당 지연 시간이 0.2ms 미만으로, 프로덕션 AI 에이전트를 위한 빠르고 신뢰할 수 있는 안전 계층을 제공합니다.
av/harbor
Harbor는 CLI 기반의 Docker-Compose 조율기로, 단일 `harbor up` 명령어로 모델 백엔드(Ollama, llama.cpp, vLLM, MLX 등), 채팅 프론트엔드(Open WebUI, LibreChat, AnythingLLM 등), 웹 검색, 음성, 이미지 생성, Boost 기반 에이전트 워크플로우를 포함한 완전한 로컬 LLM 스택을 빠르게 구축할 수 있게 해줍니다.
marcusquinn/aidevops
aidevops는 MIT 라이선스의 AI-DevOps 프레임워크로, 코드, 인프라, 제품, 마케팅 등 다양한 분야에서 AI 에이전트를 오케스트레이션하는 CLI와 OpenCode 플러그인을 제공합니다. 작업을 14개의 주요 에이전트와 수천 개의 하위 에이전트로 나누고, 펄스 감시자가 작업을 라우팅하고, 토큰 예산을 관리하며, 시크릿을 안전하게 보관하고 Git 위생을 유지합니다. npm 또는 Homebrew로 설치한 후, `aidevops init`, `aidevops pulse`, 또는 도메인 전용 슬래시 명령어를 실행하여 빌드, 배포, 보고서, 비즈니스 프로세스를 자동화하면서 감사 가능성을 유지할 수 있습니다.
norse/norse
Norse는 PyTorch 기반 라이브러리로, 스파이킹 신경망 프리미티브(LIF, LSNN 등)를 추가하여 이벤트 기반 모델을 구축·학습·평가할 수 있게 합니다. pip/conda/Docker 설치를 지원하고, MNIST, CIFAR‑10, cart‑pole 등 준비된 예제 작업을 제공하며, PyTorch‑Lightning과 통합해 확장 가능한 학습을 가능하게 합니다.
MigoXLab/dingo
Dingo는 AI 데이터, 모델 출력물, RAG 시스템 평가를 위한 오픈소스 Python 라이브러리(및 SaaS 제품)입니다. 규칙 기반, LLM 기반, 에이전트 기반 검사를 지원하며, 파일, 데이터베이스, S3, Hugging Face에서 데이터를 스트리밍으로 읽어들여 JSON 보고서와 선택적 시각화 대시보드를 제공합니다. `pip install dingo-python` (옵션 확장 기능 포함)로 설치하고 CLI(`dingo eval …`) 또는 Python SDK로 실행 가능하며, 사용자 정의 규칙, LLM 프롬프트, 에이전트로 확장할 수 있습니다.
nikdanilov/whisper-obsidian-plugin
Whisper를 사용하여 오디오 녹음이나 업로드된 파일을 텍스트로 변환하는 Obsidian 플러그인이며, 옵션으로 LLM을 통한 문법 및 서식 후처리가 가능합니다.
iver56/audiomentations
오디오 딥러닝 모델을 실제 환경에서 더 견고하게 만들기 위해 다양한 변환 기능을 제공하는 오디오 데이터 증강용 Python 라이브러리입니다.
datachain-ai/datachain
DataChain은 S3/GCS/Azure(또는 로컬)의 파일을 경량 SQLite 데이터베이스에 저장된 버전 관리형 타입 데이터셋으로 변환하는 Python 라이브러리입니다. 원본 파일을 이동하지 않고도 수백만 개의 레코드에 대해 빠른 서브초 단위의 필터링, 조인, 집계 및 벡터 유사도 검색을 제공합니다. 파이프라인은 일반 Python 함수로 작성되며, 엔진이 병렬 실행, 체크포인트 및 증분 업데이트를 처리합니다. 선택적 기능으로는 인간/LLM을 위한 자동 생성 Markdown 지식 베이스와 Claude, Cursor, Codex, Copilot 또는 Pi와 같은 도구에서 데이터 계층을 인식할 수 있게 하는 스킬이 있습니다. 호스팅되는 "Studio" 서비스는 공유 데이터셋 레지스트리, 분산 컴퓨팅 및 대규모 미디어용 UI를 추가합니다. `pip install datachain`으로 설치하고, 필요에 따라 `datachain skill install --target claude`를 실행하세요.
AgentEra/Agently
Agently는 신뢰할 수 있는 AI 서비스를 구축하기 위한 Python 프레임워크입니다. 구조화된 요청/응답 계약, 부분 결과의 즉각적인 스트리밍, 관찰 가능한 작업(도구 호출), 버전 관리되는 스킬, 그리고 신호 기반 워크플로우 엔진(TriggerFlow)을 제공합니다. 이 라이브러리는 모델 공급자를 추상화하고, 모델 풀을 지원하며, Python, shell, 웹 브라우징, SQLite 등을 위한 내장 작업을 포함합니다. 디버깅 가능성, 재시작에 안전한 워크플로우, 엄격한 출력 검증이 필요한 프로덕션급 어시스턴트, 내부 코파일럿 및 AI 기반 API를 위해 설계되었습니다.
tolimarchuk/goalbuddy
GoalBuddy는 npm 기반 CLI로, 리포지토리 내에 파일 기반의 "보드"를 생성하여 Codex 및 Claude Code와 같은 LLM 에이전트를 사용해 장기적인 코딩 작업을 오케스트레이션합니다. 목표를 안전하고 검증 가능한 조각으로 나누고, 선택한 하드웨어에 디스패치하며, YAML 수령증을 캡처하고 테스트, 데모 등 오라클을 통해 작업을 검증합니다. 보드는 도구 간에 지속되며, 에이전트 간의 원활한 인수인계, 감사 기록, 병렬 하위 목표를 가능하게 하며, 매우 작은 실행 시간 피트프린트를 갖습니다.
psyray/oasis
OASIS는 Ollama 또는 OpenAI 호환 서버(vLLM, LM Studio, LocalAI 등)를 통해 로컬에서 실행되는 LLM을 사용하여 소스 코드의 보안 취약점을 스캔하는 Python CLI 도구입니다. 빠른 스캔 모델을 실행한 후 심층 분석 모델을 실행하고, 검출 결과를 결정론적으로 검증하며, 캐시를 활용하여 표준 JSON과 함께 HTML/PDF/Markdown 보고서를 출력합니다. 비밀번호 보호된 웹 대시보드를 통해 사용자는 검출 결과를 탐색하고, 어시스턴트에게 재조사 요청이 가능합니다. 다중 모델 실행, 억제 레지스트리, 베이스라인과의 차이 비교, CI 종료 코드 게이트를 지원합니다.
skyzh/vector-db-from-scratch
Arrow 테이블, DataFusion 통합, 여러 ANN 인덱스(IVFFlat, NSW, HNSW, IVF-PQ)를 다루는 Rust 기반 단계별 강의. SQL 지원 및 벤치마크 도구 포함.
gemelo-ai/vocos
스펙트럼 계수와 역 푸리에 변환을 사용하여 음향 특징에서 고품질 음성 파형을 합성하는 빠른 신경 보코더입니다.
linto-ai/whisper-timestamped
openai-whisper의 확장으로, 다국어 자동 음성 인식에서 정확한 단어 수준 타임스탬프와 신뢰도 점수를 제공합니다.
paul-buerkner/brms
brms는 Stan을 사용하여 베이즈 일반화(비선형) 계층 모델을 적합하기 위한 고수준의 lme4 스타일 인터페이스를 제공하는 R 패키지입니다. 다양한 반응 분포, 유연한 사전 분포, 그리고 피팅 후 진단 및 시각화 도구를 지원하여, 직접 Stan 코드를 작성하지 않고도 고급 베이즈 회귀를 수행할 수 있습니다.
OpenVoiceOS/ovos-installer
Open Voice OS를 위한 간소화된 설치 프로그램으로, 사용자가 Raspberry Pi, Linux 또는 Mac 하드웨어에서 프라이버시 중심의 오픈소스 음성 비서를 배포할 수 있도록 합니다.
yibie/skills-manager
Skills Manager는 Claude Code, Cursor, Gemini CLI, OpenHands 등 수십 가지 LLM 기반 개발자용 에이전트를 위한 코드 에이전트 '스킬'(프롬프트 확장)의 탐색, 설치, 테스트 및 조직을 통합하는 macOS 네이티브 앱(및 보조 터미널 UI)입니다. 원본 스킬 패키지는 로컬 Library에 저장되며, 재사용 가능한 Collections로 그룹화되고, 에이전트에 심볼릭 링크로 마운트됩니다. 충돌 감지, 번역, 오프라인 우선 작동을 제공합니다.
CUNY-CL/wikipron
Wiktionary에서 다국어 발음 데이터를 채굴하여 그래프음-음소(G2P) 데이터셋을 생성하기 위한 명령줄 도구 및 Python API입니다.
uxlfoundation/oneDNN
oneDNN (oneAPI Deep Neural Network Library)는 딥러닝 연산자용으로 고도로 최적화된 CPU 및 GPU 커널을 제공하는 오픈소스이며 크로스플랫폼 성능 라이브러리입니다. oneAPI 사양을 구현하고 Intel, AMD, Arm, 그리고 실험적인 Power/IBM z/RISC‑V 하드웨어를 지원하며, PyTorch, TensorFlow, ONNX Runtime, llama.cpp 등의 주요 프레임워크에서 사용되고 있습니다.
tensorflow/quantum
TensorFlow Quantum는 Cirq 양자 회로를 TensorFlow/Keras와 통합하여 고성능 하이브리드 양자-고전 기계학습 모델, 자동 미분, 그리고 qsim을 통한 확장 가능한 시뮬레이션을 제공하는 Python 라이브러리입니다.
lucasjinreal/Kokoros
CLI, Rust 크레이트 및 OpenAI 호환 API 서버를 통해 빠른 텍스트 음성 변환 합성을 제공하는 Kokoro TTS 모델의 고성능 Rust 구현체.
fishaudio/audio-preprocess
AI 훈련을 위한 데이터셋 준비를 위해 보컬 분리, 음량 일치, 음성 인식 등의 작업을 수행하는 음성 처리 스크립트 모음입니다.
Ammaar-Alam/minebench
MineBench는 “a medieval castle”과 같은 프롬프트에 대해 복셀 좌표를 출력하게 함으로써 LLM의 3D 공간 추론 능력을 평가하는 웹 기반 벤치마크입니다. 생성된 결과물을 시각화하고, 사람이 직접 일대일로 비교하며, Bradley-Terry 시스템을 통해 모델의 순위를 매깁니다. 플랫폼에는 쌍별 투표를 위한 Arena, 커스텀 결과물을 위한 Sandbox, 커뮤니티 프롬프트 Gallery, 그리고 내보보기 옵션(GLB, STL, .vox, .schem)이 포함됩니다. 주요 LLM 제공업체를 지원하며 Node.js, pnpm, 그리고 Docker를 통해 로컬에서 실행할 수 있습니다.
justrach/kuri
AI 에이전트를 위한 경량 브라우저 자동화 도구로, Node.js 의존성 없이 단일 Zig 바이너리로 구현되었습니다.
0xranx/golembot
GolemBot은 기존 코딩 에이전트(Cursor, Claude Code, OpenCode, Codex)에 챗봇 "본체"를 제공하는 Node.js 런타임입니다. 단일 `golembot gateway` 명령으로 Slack, Telegram, Discord, Feishu, DingTalk, WeCom, WeChat 또는 커스텀 HTTP API에서 에이전트를 노출하고, 작은 YAML 설정으로 LLM 제공자(OpenRouter, MiniMax, DeepSeek 등)를 교체할 수 있습니다. ClawHub 마켓플레이스(13k+ 커뮤니티 스킬)와 통합되어 에이전트가 즉시 새로운 기능을 얻을 수 있습니다. 기능에는 내장 대시보드, cron 스케줄러, 플릿 관리, 그리고 최소한의 JavaScript SDK(`createAssistant`)가 포함됩니다. `npm i -g golembot`로 설치하고, `golembot onboard`로 구성한 후, `golembot gateway`로 실행합니다. MIT 라이선스입니다.
Cranot/roam-code
roam‑code 는 원격 API 호출 없이 AI 코드 에이전트가 정의, 호출자, 테스트 영향, 위험(폭발 반경)을 질의할 수 있는 로컬 정적 분석 CLI(및 선택적 MCP 서버)입니다. 사전 검사, 헬스 요약, 검증 게이트, Claude 전용 훅을 제공하며, 모두 오픈소스이자 프라이버시를 보호합니다.
mrpulor-gh/nuphus-mcp
이 리포지토리는 AI 데스크톱 및 브라우저 자동화에 관한 진정한 소프트웨어 프로젝트로, JSON-RPC를 표준 입력/출력을 통해 사용하는 Rust 기반의 MCP 서버를 제공하여 AI 에이전트가 로컬 컴퓨터를 제어할 수 있게 합니다. 로컬 OCR 및 선택적 비전 모델 통합도 지원합니다.
NaomiProject/Naomi
Naomi는 오픈소스이며 항상 음성 입력을 수신하는 음성 어시스턴트 플랫폼(파이썬, 리눅스/Raspberry Pi)으로, 가정용 기기 제어, 정보 질의, 간단한 파이썬 모듈을 통한 사용자 정의 '스킬' 추가가 가능합니다.
xianyu110/clawbot
Clawdbot은 Claude, GPT, Gemini 등 다양한 LLM에 구성 가능한 API 프록시 엔드포인트를 통해 연결하는 오픈소스이며, 로컬에서 실행 가능한 AI 어시스턴트입니다. 웹 및 터미널 UI, Telegram/Discord/WhatsApp 봇을 제공하며, 모든 데이터는 호스트에 저장됩니다. README에는 설치 방법(노드 22+, npm 또는 스크립트), 모델 및 채널 설정을 위한 온보딩 워즈드, 다중 모델 프록시를 위한 상세한 JSON 설정, 노드 버전 문제, 환경 변수 오용, 필수 필드 누락과 같은 일반적인 실수, 게이트웨이, 로그, 진단을 관리하는 데 사용하는 CLI 명령어의 완전한 세트가 포함되어 있습니다.
Spr-Aachen/Easy-Voice-Toolkit
Easy Voice Toolkit은 오픈소스 음성 모델(Whisper, GPT-SoVITS)을 GUI/Colab 워크플로우에 통합하여 오디오 정리, 전사, 음성 변환 데이터셋 구축, 맞춤 음성 모델 학습, 변환 음성 생성을 수행합니다. 즉시 실행 가능한 Windows 휴대용 패키지와 Colab 노트북을 제공하며, 개발자 친화적인 설치 가이드를 포함합니다. 이 프로젝트는 학술용으로만 사용되며 향후 LLM 챗봇 통합 및 Linux 지원을 계획하고 있습니다.
google/jax-cfd
JAX‑CFD는 미분 가능한 CFD를 위한 JAX 기반 연구용 라이브러리입니다. 유한체적법 및 유사 스펙트럼법 솔버, 선택 사항인 ML 증강 모델, 데이터 유틸리티를 제공하여 난류 시뮬레이션에 대한 경사도 기반 실험을를 가능하게 합니다. pip를 통해 설치할 수 있으며, Colab 데모가 포함되어 있으며, 현재는 유지보수가 중단되었습니다. 최신 대체재를 권장합니다.
Kabanosk/whisper-website
OpenAI의 Whisper를 사용하여 로컬에서 오디오를 텍스트 또는 다양한 형식의 자막으로 변환하는 자체 호스팅 웹 애플리케이션입니다.
teticio/audio-diffusion
멜 스펙트로그램에 확산 모델을 적용하여 음악과 오디오 루프를 합성하는 프레임워크로, 잠재 확산(latent diffusion) 및 조건부 생성을 지원합니다.
Xueyang-Song/paper-pilot
Paper Pilot는 8개 이상의 학술 데이터베이스를 크롤링하고, PDF를 다운로드하며, SQLite + FTS5 + 벡터 검색으로 인덱싱한 후, 로컬 또는 호스팅된 LLM에 근거 기반 답변을 요청할 수 있는 데스크톱(Electron + React) 연구 보조 도구입니다. 모든 데이터는 당신의 기계에 머물며, 앱은 감사 가능한 인용 트레이스와 문헌 리뷰를 위한 재현 가능한 워크플로우를 제공합니다.
Deep-ai-inc/ch.at
ch.at은 HTTP, SSH, DNS 또는 API를 통해 LLM(기본값 GPT-4o)과 대화할 수 있는 단일 바이너리 Go 서버입니다. JavaScript나 계정이 필요 없으며 모든 상태는 RAM에 유지됩니다. 개인정보 보호에 중점을 두고 있으며 자체 호스팅이 쉽고, 동일한 경량 프로토콜을 사용하여 메시지를 게시할 수 있는 공개 게시판이 포함되어 있습니다.
EasyJailbreak/EasyJailbreak
EasyJailbreak은 LLM의 jailbreak 공격을 모듈화한 오픈소스 Python 프레임워크입니다. ReNeLLM, GPTFuzz, AutoDAN 등 사전에 준비된 레시피를 제공하며, 사용자가 커스텀 선택기, 변형기, 제약, 평가자를 추가해 타겟 언어 모델에 대한 악성 프롬프트를 생성, 실행, 점수화할 수 있습니다. `pip install easyjailbreak` 또는 소스에서 설치 후, `PAIR` 레시피와 같은 고수준 API를 사용하거나, 자체 공격 파이프라인을 구축할 수 있습니다. 프로젝트에는 문서, 논문, 데이터셋, 실험 결과 다운로드가 포함되어 있습니다.
ankane/torch.rb
Torch.rb는 PyTorch C++ 라이브러리(LibTorch)를 래핑한 Ruby gem으로, Ruby 개발자에게 기능이 풍부한 딥러닝 API를 제공합니다. 텐서, autograd, 신경망 모듈, 옵티마이저, 그리고 GPU(CUDA/MPS) 가속을 지원하며, PyTorch Python API를 Ruby 스타일의 메서드 이름으로 반영합니다. 설치를 위해서는 적합한 LibTorch 빌드가 필요하며, 설치 후에는 Ruby에서 직접 모델(예: CNN, GANs)을 작성하고 실행할 수 있습니다.
FlashLabs-AI-Corp/FlashLabs-Chroma
실시간 음성 대화를 위한 엔드투엔드 다중 모달 모델로, 직접 음성 이해 및 개인화된 음성 클론을 지원합니다.
Firepal/stammer
다른 오디오 또는 비디오 소스에서 가장 스펙트럼적으로 유사한 프레임을 사용하여 하나의 오디오 소스를 재구성하는 파이썬 유틸리티입니다.
jacbz/Lofi
특징 벡터를 사용하여 음악 트랙을 표현하고 생성하는 VAE 모델을 활용한 기계학습 지원 lo-fi 음악 생성기.
jjazzboss/JJazzLab
JJazzLab는 코드 기호와 선택된 음악 스타일을 기반으로 드럼, 베이스, 기타, 피아노를 포함한 현실적이고 동적인 백트랙을 생성하는 오픈소스 애플리케이션입니다.
ronibandini/reggaetonBeGone
Raspberry Pi 3 기반의 엣지AI 기기로, 로컬에서 Edge Impulse 음성 분류 모델을 실행하여 레게톤을 감지합니다. 신뢰도가 95%를 초과하면 설정된 스피커를 블루투스로 비활성화하는 루틴을 트리거합니다. OLED 피드백, 시작 버튼, 로깅, 하드웨어-소프트웨어 전체 지침을 포함합니다.
kristianvast/hermes-claude-auth
hermes‑claude‑auth는 Anthropic이 2026‑04‑04에 OAuth 검증을 도입한 후 hermes‑agent가 Claude Code 구독(Max/Pro)을 계속 사용할 수 있도록 해주는 Python 런타임 패치입니다. .pth 쉴드를 설치하여 요청 빌더를 모니키 패치하고, 필요한 요금 청구 헤더를 추가하며, 프롬프트 레이아웃을 수정하고, 구독 윈도우 기반 레이트 제한에 대한 자동 대기를 구현합니다. 설치 프로그램은 Linux/macOS 및 Windows에서 작동하며, 제거 스크립트를 제공하고, git 훅 + cron 복구를 통해 hermes 업데이트 후에도 지속됩니다.
JeremyCCHsu/Python-Wrapper-for-World-Vocoder
오디오를 피치, 스펙트럼 포락선 및 비주기성으로 분해하여 고품질 음성 분석 및 재합성을 가능하게 하는 WORLD Vocoder용 Python 래퍼입니다.