TorchDSP/torchsig

PyTorch 기반의 오픈소스 신호 처리 기계학습 툴킷으로, 기계학습 연구를 위한 RF 신호의 생성, 증강, 변환을 간소화합니다.

ludo-technologies/pyscn

pyscn은 Go 기반의 빠른 Python 정적 분석 도구로, 코드 상태 점수 산정, 데드/중복 코드 탐지, 복잡도 측정 및 아키텍처 검사를 수행합니다. 설치 가능한 Skills와 선택적 MCP 서버를 통해 AI 코딩 에이전트와 통합되어, IDE나 채팅 인터페이스에서 직접 품질 검사를 실행하고 리팩토링을 제안받을 수 있습니다.

OpenClaudia/openclaudia-skills

OpenClaudia는 MIT 라이선스의 무료 77개 마크다운 기반 "스킬" 모음으로, AI 코딩 에이전트(Claude Code, Codex 등)가 간단한 슬래시 명령을 호출하여 SEO 감사, 블로그 작성, 광고 카피, 이메일 시퀀스, 소셜 미디어 게시, 분석 등 엔드투엔드 마케팅 작업을 수행할 수 있게 합니다. `npx openclaudia install --all`로 설치하고 필요한 API 키를 구성하면 에이전트가 마케팅 자산을 로컬에서 생성, 게시, 전송할 수 있어 유료 AI 마케팅 SaaS에 대한 완전히 사용자 지정 가능한 대안을 제공합니다.

taracodlabs/aiden

Aiden은 오픈소스 자율형 AI 엔진(노드/타입스크립트)으로, 자연어 목표를 파일, 터미널, 브라우저, API, Git을 아우르는 검증 가능한 다단계 워크플로우로 전환합니다. SQLite에 모든 작업을 기록하고, 위험 수준 기반 승인을 지원하며, OpenAI, Anthropic, Gemini, Ollama 등 다양한 LLM 제공자를 지원하며, CLI, 웹 워크벤치, 백그라운드 데몬으로 실행 가능합니다. `npm i -g aiden-runtime`로 설치하고 `aiden`으로 시작하세요.

Sylinko/Everywhere

Everywhere는 .NET 10과 Avalonia를 사용해 개발된 크로스플랫폼 데스크톱 AI 어시스턴트(Windows/macOS)입니다. 접근성 API를 통해 화면 내 컨텍스트를 캡처하고, 글로벌 핫키로 LLM(OpenAI, Anthropic, Gemini 등)에 질의하여 마크다운을 포함한 풍부한 답변을 반환합니다. 브라우저/파일/터미널 에이전트, 풍부한 UI, 다국어 UI, 로컬 Ollama 모델 지원 기능을 갖추고 있으며, LICENSE에 따라 오픈소스로 제공되며 설치 프로그램, 포터블 zip, 완전한 빌드 지침을 제공합니다.

zhimaAi/chatwiki

ChatWiki는 Docker 기반의 오픈소스 플랫폼으로, WeChat 공식 계정을 AI 어시스턴트로 전환합니다. 시각적 워크플로우 편집, 자동 응답(텍스트, 음성, 이미지, 미니프로그램 카드), 스크래핑 또는 업로드된 문서로부터 지식 기반 생성, 하이브리드 벡터-그래프 검색, 인간 인계 기능을 제공합니다. 백엔드는 Go와 Python, 프론트엔드는 Vue.js, PostgreSQL 16과 pgvector를 사용한 임베딩 처리를 합니다. 20개 이상의 LLM 제공업체(예: OpenAI, Claude, DeepSeek)를 지원하며, 웹 앱, 데스크톱 클라이언트, 또는 다른 서비스에 통합 가능합니다. 개인 사용은 무료이며, 상용 사용자는 유료 라이선스가 필요합니다.

RHVoice/RHVoice

RHVoice는 통계적 파라미터 합성 방식을 사용하여 다양한 언어와 플랫폼에서 가볍고 명확한 텍text-to-speech를 제공하는 오픈 소스 음성 합성 엔진입니다.

any4ai/AnyCrawl

AnyCrawl는 빠르고 확장 가능한 웹 및 SERP 크롤링을 위한 오픈소스 Node.js/TypeScript 툴킷입니다. 멀티프로세스 워커, 세 가지 스크래핑 엔진(cheerio, Playwright, Puppeteer), 배치 작업, Redis 기반 큐, 캐시, 프록시 지원, 그리고 선택적 LLM 기반 JSON 추출 기능을 제공합니다. Docker를 통한 자체 호스팅 또는 공개 API를 사용할 수 있으며, API 키 생성과 단일 페이지 크롤링, 전체 사이트 크롤링, SERP 검색, 배치 스크래핑을 위한 엔드포인트 호출이 가능합니다. AI 에이전트, 데이터 수집 파이프라인, SEO 자동화에 적합합니다. MIT 라이선스.

Rvosy/Sakura

Sakura Desktop Pet은 화면을 감시하고 상호작용을 기억하며 스스로 대화를 시작할 수 있는 오픈소스 AI 기반 데스크톱 동반자입니다. 사용자는 캐릭터 팩(포트레이트, 롤카드, 선택적 음성)을 로드하고 LLM API를 설정합니다. 이후 에이전트는 스크린샷, 도구 호출(웹 검색, 리마인더, 메모) 및 장기 기억을 사용해 능동적인 가상 펫처럼 행동합니다.

espnet/espnet

PyTorch 기반의 엔드투엔드 음성 처리 툴킷으로, ASR, TTS, 음성 번역 및 향상을 위한 통합되고 재현 가능한 레시피를 제공합니다.

MahmoudAshraf97/whisper-diarization

OpenAI Whisper를 사용한 음성 인식과 NVIDIA NeMo를 사용한 발화자 식별을 결합하여 음성 파일에서 누가 어떤 단어를 말했는지 식별하는 발화자 분류 파이프라인입니다.

jasoncheng7115/jt-live-whisper

jt‑live‑whisper는 시스템 오디오를 캡처하여 Whisper 기반 음성 인식, 로컬 번역, 화자 분리, LLM 기반 회의 요약을 모두 사용자 PC에서 실행하는 크로스 플랫폼 데스크톱 도구입니다. macOS, Windows, Linux를 지원하며 실시간 자막(영-중 또는 일-중 양방향 지원), 오디오 파일 일괄 처리, 플로팅 자막, 키워드 알림, 채팅 앱으로의 자막 전송 기능을 제공합니다. 설치는 원클릭 스크립트로 Python, 필수 라이브러리 및 AI 모델을 설정하며, 대화형 메뉴, 경량 웹 UI 또는 CLI 플래그를 통해 앱을 실행할 수 있습니다.

ahmetoner/whisper-asr-webservice

Whisper 모델을 REST API로 래핑하여 쉬운 배포와 통합을 지원하는 범용 음성 인식 툴킷입니다.

k2-fsa/sherpa

PyTorch를 사용한 오픈소스 음성‑텍스트 변환 추론 프레임워크로, 사전 학습된 transducer 및 CTC 기반 모델을 배포할 수 있습니다.

SchroederNathan/clarity

iOS 및 Android용 발음 연습 앱으로, 발음, 속도, 유창성을 향상시키는 데 도움이 되는 실시간 피드백과 AI 코칭을 제공합니다.

getsentry/warden

Warden은 재사용 가능한 "스킬"을 사용하여 AI 기반 코드 리뷰를 실행하는 오픈소스 Sentry 프로젝트입니다. 로컬 CLI에서 호출하거나 GitHub Action을 통해 각 PR에 자동으로 실행할 수 있으며, 발견 내용을 인라인 주석과 Checks로 게시합니다. OpenAI 및 Anthropic 모델을 지원하며, 간단한 수정을 자동으로 적용할 수 있습니다.

beehive-lab/TornadoVM

TornadoVM은 오픈소스 Java 런타임으로, Java 바이트코드를 GPU 커널(CUDA, OpenCL, Metal)로 JIT 컴파일하고 NVIDIA 라이브러리(cuBLAS, cuFFT, cuDNN) 및 Tensor-Core 인트린식을 통합한다. 순수 Java로 커널을 작성하고, 작업 그래프를 구성하여 NVIDIA, AMD, Intel, Apple-Silicon GPU 또는 CPU에서 실행할 수 있다. LLM 추론(GPULlama3.java), 레이트레이싱, 과학적 파이프라인에 사용되며, SDKMAN!을 통해 설치 가능하고 Maven Central에서 Apache 2.0(API) 및 GPLv2 + Classpath Exception(런타임) 라이선스로 제공된다.

woheller69/whisperIME

Whisper 엔진을 기반으로 한 Android용 오프라인 음성 인식 입력기입니다. 개인정보 보호에 중점을 둔 음성-텍스트 변환 및 번역 기능을 제공합니다.

rapidaai/voice-ai

에이전시 및 기업이 벤더 종속 없이 확장 가능하고 실시간 음성 에이전트를 구축하고 배포할 수 있는 오픈소스 음성 AI 오케스트레이션 플랫폼입니다.

jonwiggins/optio

Optio는 Kubernetes 또는 로컬 머신에서 AI 에이전트(Claude Code, OpenAI Codex, Gemini 등)를 지속 가능한 세션으로 오케스트레이션하는 오픈 소스 셀프 호스팅 플랫폼입니다. 단일 양식을 통해 '언제, 어디서, 누가, 무엇을, 그 다음은'을 캡처하여 PR 자동화 파이프라인, 예약된 작업, 대화형 터미널 또는 장기 실행 에이전트 스웜을 생성합니다. 통합 UI/피드, Kubernetes 스타일의 조정 메커니즘, 다중 공급업체 모델 지원, 세밀한 연결(Slack, Notion, GitHub 등), 비용 추적 및 엔터프라이즈급 보안을 제공하며, 모든 기능이 귀하의 인프라 내에서 실행됩니다.

GoPlusSecurity/agentguard

AgentGuard는 Claude Code, OpenClaw, Hermes 등 AI 코드 에이전트를 위한 npm으로 배포되는 보안 계층입니다. 한 번 설치하고 에이전트 런타임에 훅을 걸면 파괴적인 명령어를 차단하고, 시크릿 파일을 보호하며, 각 작업을 트리거한 스킬을 로그로 기록합니다. 또한 새로운 스킬에 대한 정적 분석 스캔, 매일 '패트롤' 건강 점검(8가지 내장 점검), 선택적 클라우드 연결 위협 인텔리전스도 제공합니다. 설치는 `npm i -g @goplus/agentguard && agentguard init`; 사용법에는 `agentguard scan`, `agentguard protect`, `agentguard patrol`, `agentguard checkup`이 있습니다.

madderscientist/noteDigger

noteDigger는 오디오에서 MIDI로의 변환을 수행하는 순수 JavaScript 웹 앱입니다. 사용자는 오디오/비디오를 업로드하고, 스펙트로그램(STFT/CQT, GPU 가속)을 시각화하며, 브라우저 내에서 신경망 모델을 사용해 피치 및 악기 분리 변환을 실행하고, 키보드 단축키를 활용한 풍부한 수동 편집 도구를 제공합니다. 정량화된 MIDI 파일을 내보내거나, 나중에 작업할 수 있는 프로젝트를 저장할 수 있으며, 외부 라이브러리나 서버 측 처리가 필요하지 않습니다.

ntd4996/agentpet

AgentPet은 AI 코드 에이전트의 실시간 상태를 모니터링하고, 토큰 사용량과 완료된 세션에 따라 레벨업하는 타마고치 스타일의 펫을 통해 경험을 게임화하는 크로스플랫폼 데스크톱 앱입니다. 오프라인 작동을 지원하며, 다양한 에이전트를 지원하고, 프로젝트별 대시보드를 제공하며, 선택적 웹 동기화와 랭킹 기능도 제공합니다.

vndee/llm-sandbox

LLM Sandbox는 대규모 언어 모델이 생성한 코드를 격리된 컨테이너(Docker, Kubernetes 또는 Podman)에서 실행하는 Python 패키지입니다. 여러 언어를 지원하고, 보안 정책을 적용하며, 출력 플롯을 캡처하고, 인터랙티브 노트북 스타일 세션을 제공하며, 빠르고 동시 실행을 가능하게 하는 컨테이너 풀링 시스템을 갖추고 있습니다.

moss-site/moss-trade-bot-skills

Moss는 평이한 언어로 표현된 암호화 자산 거래 아이디어를 백테스트 가능하고 자가 진화하는 정량적 에이전트로 전환하는 오픈소스 Python 프레임워크입니다. 자연어 설명을 분석하고 기술적 지표를 구성하며, 로컬에서 Hyperliquid의 과거 데이터로 백테스트를 실행하고, 매주 파라미터를 자동으로 최적화하면서 안전 가드레일을 유지합니다. 선택적 통합을 통해 결과를 Moss 플랫폼에 업로드하고 Hyperliquid에서 라이브 로봇을 실행할 수 있습니다. 프로젝트는 MIT-0 라이선스 하에 있으며 연구/교육용으로 설계되었습니다.

SonyResearch/Woosh

소니 AI에서 제공하는 생성 모델 모음으로, 텍스트에서 오디오 및 비디오에서 오디오 생성을 통해 고품질 사운드 이펙트를 생성할 수 있습니다.

fossasia/voxbento

실시간 이벤트를 위한 실시간 해석 플랫폼으로, 해석사들이 브라우저 기반의 낮은 지연 시간 스트림을 통해 청중에게 번역된 오디오를 방송할 수 있습니다.

xiaods/k8e

K8E는 임의의 Linux 호스트에서 신뢰할 수 없는 코드를 안전하게 실행할 수 있는 오픈소스 단일 바이너리 사전 격리 플랫폼입니다. gVisor, Kata, Firecracker 격리 지원, 세션별 eBPF 네트워크 정책, 500ms 미만 시작 시간의 워밍풀 포드, `k8e-sandbox-cli` 도구를 통한 E2B 호환 API를 제공합니다.

Saganaki22/ComfyUI-OmniVoice-TTS

OmniVoice를 위한 ComfyUI 노드로, 600개 이상의 언어에 대해 보이스 클로닝, 보이스 디자인 및 멀티 스피커 대화 지원을 포함한 제로샷 다국어 텍스트 음성 변환(TTS)을 제공합니다.

tornikegomareli/Talkify

macOS용 프라이빗 온디바이스 음성 받아쓰기 및 전사 도구로, 로컬 Apple 프레임워크와 LLM을 사용하여 음성-텍스트 변환, 번역, 텍스트 다듬기를 제공합니다.

toby-bridges/api-relay-audit

API 리레이 감사는 제로 종속성의 Python 스크립트로, 어떤 제3자 AI-API 리레이 또는 LLM 프록시의 숨겨진 프롬프트 인젝션, 컨텍스트 자르기, 모델 교체, 도구 호출 재작성, Web3 지갑 안전성을 로컬에서 테스트할 수 있습니다. 14단계 감사를 수행하고 LOW/MEDIUM/HIGH 위험 등급을 포함한 Markdown 보고서를 출력하며, 독립 실행형 스크립트 또는 DeepSeek Harness 플러그인으로 사용 가능합니다.

EXXETA/exxperts

exxperts는 옵트인 및 감사 가능한 메모리를 갖춘 크로스플랫폼 데스크톱/CLI 앱입니다. 룸은 지속 가능한 작업 공간으로 작동하며, 대화 후 에이전트가 기억할 사실을 제안하고, 승인이 필요합니다. 모든 데이터는 당신의 기계에 유지되며, OpenAI 호환 모델을 지원하고, 내장된 DuckDuckGo 검색 기능을 제공하며, Apache 2.0 라이선스로 배포됩니다.

nWave-ai/nWave

nWave는 7단계 '웨이브' 워크플로우(Discover → Deliver)를 통해 AI 에이전트를 조율하는 Claude Code 플러그인 세트입니다. 각 웨이브는 검토된 아티팩트를 생성하며, DES 레이어가 TDD, 페어 리뷰, 구성 가능한 엄격성 프로파일을 강제합니다. Python 3.10+, uv 또는 pipx로 1줄 스크립트로 설치 가능하며, `/nw-design` 또는 `/nw-buddy`와 같은 슬래시 명령어로 프로세스를 제어할 수 있습니다. 개발자와 팀이 AI 지원 코딩을 활용하면서도 모든 단계에서 인간의 감시를 유지할 수 있도록 설계되었습니다.

microsoft/muzic

Microsoft Research Asia의 연구 프로젝트로, 음악 이해, 생성 및 AI 기반 음악 처리용 딥러닝 모델 제품군을 제공합니다.

KoljaB/RealtimeTTS

문자열, 제너레이터, LLM 토큰 스트림에서 저지연 오디오 생성을 위한 Python 텍스트-투-스피치 라이브러리로, 다양한 로컬 및 클라우드 TTS 엔진을 지원합니다.

Picovoice/porcupine

IoT, 모바일 및 웹 플랫폼 전반에서 항상 대기 중인 음성 지원 애플리케이션을 구축하기 위한 가볍고 정확도가 높은 웨이크 워드 엔진.

sayksii/Aria

다양한 음성 인식 엔진과 로컬 오프라인 모델을 사용하여 시스템 오디오를 실시간 자막 및 번역으로 변환하는 Windows 데스크톱 앱입니다.

Stability-AI/stable-audio-tools

오디오 생성 모델의 훈련 및 추론을 위한 툴킷으로, 확산 모델(diffusion)과 오토인코더(autoencoders)를 포함한 다양한 모델 유형을 지원합니다.

es617/claude-replay

claude‑replay는 Claude Code, Cursor, Codex CLI, Gemini CLI, OpenCode, Kimi Code, Hermes Agent의 트랜스크립트 로그를 하나의 자체 포함형 HTML 리플레이로 변환하는 제로 의존성 도구입니다. 리플레이는 인터랙티브(재생/일시정지, 속도 조절, 추론/도구 블록 토글), 테마 설정 가능하며 내장 웹 에디터로 편집할 수 있습니다. 라이브 감시 모드, 시크릿 마스킹, 간편한 임베딩을 지원해 블로그, 문서, 데모, 버그 리포트, 교육용으로 AI 코딩 세션을 공유할 수 있게 합니다.

Alex2Yang97/yahoo-finance-mcp

Claude와 같은 LLM을 위한 타입 지정 도구로 Yahoo Finance 데이터(가격, 재무제표, 옵션, 뉴스, 보유자, 분석가 평가)를 노출하는 파이썬 MCP 서버로, AI 기반 주식 및 시장 연구를 가능하게 합니다.

HangYu8123/HarnessFlow

HarnessFlow는 Claude Code, Codex CLI, 또는 GitHub Copilot을 다단계로 자가 검토 가능한 코딩 어시스턴트로 바꾸는 포터블 Markdown 지침 파일 세트입니다. 리퀘스트 템플릿, 병렬 분석 에이전트, 악마의 변호사 도전, QA 검증, 지속적인 리포지토리 메모리를 제공합니다. 리포지토리의 `.github/HarnessFlow/`에 팩을 복사하고 제공된 `setup.sh` 또는 `cli_setup.sh`를 실행하여 설치할 수 있습니다. 리퀘스트 템플릿(코드, 리팩터링, 디버깅 등)을 선택하고 채운 후 어시스턴트에 붙여넣습니다. 이 팩은 `general`, `fast`, `skill` 세 가지 워크플로우 모드를 지원하며, 벤치마크 결과로 생성 코드 줄 수가 최대 76% 감소하면서도 100% 정확성을 유지했습니다.

Vasco0x4/AIDA

AIDA는 어떤 LLM(Claude, Gemini, OpenAI 등)도 Docker 기반 보안 테스트 환경을 제어할 수 있는 오픈소스 자율 펜테스트 플랫폼입니다. 에이전트는 리콘나이선스, 스캔, 사용자 정의 Python 공격 코드, 원시 HTTP 조작을 수행하며, 모든 명령어와 출력을 지속 가능한 노트북에 기록합니다. 발견 내용은 CVSS 4.0로 자동 평가되며 PDF 보고서로 내보낼 수 있습니다. 프로젝트에는 웹 대시보드, JWT 인증, 알림 훅이 포함되어 있으며, 내장된 `aida-pentest` 컨테이너를 더 큰 Exegol 이미지로 교체할 수 있습니다. AIDA가 발견한 실제 CVE 목록이 있으며, 실용적 영향을 보여줍니다. AGPL-v3 라이선스로 제공됩니다.

volcengine/mcp-server

100개 이상의 Model Context Protocol (MCP) 서버를 포함하는 모노레포로, 클라우드 서비스, 데이터베이스, 개발 도구 등을 자연어 기반 API로 노출하여 LLM이 사용할 수 있도록 합니다. 컴퓨팅, 스토리지, 보안, 검색 등 즉시 사용 가능한 서버를 제공하며, 로컬/원격 배포, Python/TS SDK, MIT 라이선스를 지원합니다.

pretyflaco/millet

Millet은 어떤 회의 앱에서든 이중 채널 오디오를 기록하고, WhisperX(또는 MLX Whisper)로 음성 인식, pyannote‑audio로 화자 분리, AI 요약 및 전문적인 PDF를 생성하는 오프라인 우선 Python 도구입니다. 고품질(클라우드), 기밀(TEE 보호 GLM‑5.3), 대체(Kimi) 세 가지 요약 프리셋을 제공하며, 다국어 전사, 음성 특징 화자 인식, 구조화된 마크다운/YAML 프론트마터, 선택적 Git 동기화를 지원합니다. 오디오 캡처에는 Linux가 필요하며, macOS는 녹음 후 단계만 실행 가능합니다.

microsoft/generative-ai-with-javascript

Microsoft가 유지보수하는 MIT 라이선스의 튜토리얼 시리즈로, JavaScript 개발자가 생성형 AI 앱을 만드는 방법을 배웁니다. LLM 기초, 프롬프트 엔지니어링, 구조화된 출력, RAG, 도구 호출, Model Context Protocol를 다루며, 코드 샘플, 퀴즈, 영상, 동반 챗봇 앱이 제공됩니다. GitHub Codespace에서 즉시 시작하거나 로컬에서 코드를 실행할 수 있습니다.

meta-pytorch/attention-gym

Attention Gym은 PyTorch 기반 라이브러리로, FlexAttention API를 위한 재사용 가능한 마스크/스코어 수정 함수, 희소(sparse) 어텐션 패턴, 선형(linear) 어텐션 커널을 제공하며, 커스텀 어텐션 메커니즘을 구축하고 벤치마킹하기 위한 예시 스크립트와 유틸리티를 제공합니다.

misyaguziya/VRCT

VRCT는 실시간 오디오-텍스트 변환 및 채팅 통합을 통해 VRChat 사용자가 서로 다른 언어로 소통할 수 있도록 설계된 번역 및 전사 도구입니다.

theJayTea/WritingTools

Writing Tools는 Windows, Linux, macOS용 무료 오픈소스 데스크톱 앱으로, 키보드 단축키로 컴퓨터 어디서든 LLM을 호출할 수 있습니다. 문법 검토, 재작성, 톤 변경, 번역, 웹 페이지 또는 유튜브 자막 요약, 모델과의 대화가 가능합니다. Gemini, OpenAI, Anthropic 등 클라우드 API 또는 Ollama, llama.cpp, Apple-silicon MLX를 통해 로컬 모델을 실행할 수 있습니다. 텔레메트리 없이 API 키는 로컬에 저장되는 개인정보 중심 설계이며, GPL-v3 라이선스로 제공됩니다.