kyutai-labs/hibiki

Hibiki는 사용자가 말하는 동안 자연스러운 타겟 음성과 텍스트를 실시간으로 생성하는 스트리밍 음성-음성 번역 모델입니다.

woheller69/whisperIMEplus

Whisper 엔진을 사용하여 개인 정보 보호 및 오프라인으로 음성 인식과 번역을 제공하는 Android 입력 메서드 에디터(IME).

deeeed/audiolab

iOS, Android, 웹에서 작동하는 React Native 및 Expo용 오디오 처리 모노레포. 온디바이스 음성 인식(STT), 음성 합성(TTS), 오디오 분석을 제공합니다.

yaojingang/yao-open-skills

Yao Open Skills는 의사결정 분석, 보안 감사, 튜토리얼 생성, 독서 보고서 시각화 등의 작업을 위한 재사용 가능한 AI '스킬'(구조화된 프롬프트+코드 워크플로우)의 오픈소스 카탈로그입니다. 각 스킬은 자체 폴더에 스크립트, 문서, 다중 형식 내보내기(Markdown, HTML, PDF 등)를 포함합니다. 리포지토리는 레지스트리, 공개 규칙, 보조 스크립트를 제공하여 컬렉션을 깨끗하고 버전 관리되며 공개적으로 탐색 가능한 상태로 유지합니다.

brummer10/guitarix

Guitarix는 리눅스 전용 모듈식 가상 기타 앰프로, 클래식한 DSP 효과와 AI 기반 앰프 모델(Neural Amp Modeler 및 RTNeural)을 결합합니다. 독립 실행형 앱, VST3, LV2 플러그인으로 작동 가능하며 MIDI로 제어할 수 있고, Raspberry Pi와 같은 장치에서 GUI 없이 작동하는 헤드리스 모드도 지원합니다. README에는 빌드 단계, 종속성, 문서 링크, 최적화된 배포를 위한 Docker 기반 컨테이너에 대한 정보가 포함되어 있습니다.

Wangnov/codex-threadripper

Rust 기반 CLI(Homebrew, npm, 바이너리로도 패키징됨)로 Codex의 SQLite 상태 DB와 롤아웃 JSONL 로그를 재작성하여, `model_provider`를 변경해도 채팅 스레드가 보이도록 합니다. 한 번만 동기화, 지속적인 감시 모드, macOS, Linux, Windows용 선택적 백그라운드 서비스 설치를 지원합니다.

getsentry/vitest-evals

vitest‑evals 는 Vitest 에 AI 인식 평가 기능을 추가하는 모노레포입니다. 다양한 모델 SDK 용 핸서스 어댑터, 재사용 가능한 재판(예: 사실성), 세부 JSON 보고서, 로컬 React UI, 그리고 통과율 또는 점수 기반으로 PR 병합을 차단할 수 있는 GitHub Action 을 제공합니다.

linkerlin/PUAX

PUAX는 LLM 에이전트에 마인드셋 레이어를 추가하는 프로덕션 준비 런타임입니다. 아레나/게이트/드림 프리미티브, 씬 프롬프트 압축, 제로 의존성 Python SDK, 하이브리드 트리거 감지, 59개의 내장(및 사용자 정의) 역할, 결과 기반 검증, 인간 대상 조작 감지를 위한 카본 실드, 재현 가능한 멀티 모델 벤치마크 스위트를 제공합니다. 시스템은 MCP 서버(`npx puax-mcp-server`)를 통해 접근되며 인기 IDE에 네이티브 훅을 주입하고, 원라인 AMP 미들웨어를 통해 LangChain/AutoGen에 직접 임베드할 수 있습니다. MIT 라이선스이며 프로덕션 준비로 표시되어 있습니다.

harry0703/AudioNotes

녹음된 오디오 및 비디오를 구조화된 Markdown 노트로 변환하고 콘텐츠에 대해 AI 기반 Q&A를 가능하게 하는 로컬 우선의 오디오 및 비디오 전사 도구입니다.

descriptinc/descript-audio-codec

44.1 kHz 음성을 8 kbps에서 이산 코드로 압축하는 고정밀 신경 음성 코덱으로, 대화, 음악, 환경음에 대해 약 90배의 압축을 제공합니다.

espressif/esp-sr

Espressif 칩을 위한 음성 인식 프레임워크로, 오프라인 웨이크워드 감지, 음성 명령 인식 및 오디오 전처리를 가능하게 합니다.

anthropics/anthropic-sdk-go

Anthropic의 Claude API에 얇고 자연스러운 래퍼를 제공하는 Go SDK로, Go 개발자가 Claude 모델(예: Claude Opus 4.6)을 애플리케이션에서 직접 호출할 수 있게 합니다. `go get`으로 설치하고, API 키로 클라이언트를 생성한 후 `Messages.New` 메서드를 사용해 프롬프트를 전송하고 응답을 받습니다.

wevm/incur

incur는 LLM 에이전트가 쉽게 발견하고 사용할 수 있는 명령줄 도구를 구축할 수 있는 TypeScript 라이브러리입니다. Zod를 통한 타입 안전한 명령어 정의, 토큰 효율적인 TOON 출력, 내장된 MCP 및 스킬 파일 생성 기능을 제공하며, HTTP API를 CLI 명령어로 래핑하거나 노출할 수 있습니다.

NVIDIA/NeMo-text-processing

음성 처리 시스템을 위한 텍스트 준비에 사용되는 텍스트 정규화 및 역텍스트 정규화용 Python 패키지입니다.

tony1223/better-agent-terminal

Better Agent Terminal (BAT)는 Tauri 2와 React로 구축된 크로스플랫폼 데스크톱 앱(Windows/macOS/Linux)입니다. 여러 프로젝트 작업공간을 관리할 수 있으며, 각 작업공간에는 스플릿 패널 터미널, 파일 브라우저, Git 뷰어, 스크립트 매니저, 그리고 내장된 AI 코딩 어시스턴트(Claude Code 또는 OpenAI Codex)가 포함되어 있습니다. AI는 앱 내부에서 실행되어 스트리밍 출력, 권한 모드, 세션 재개/포크, 상세한 사용 통계를 제공합니다. 선택적 `cx` CLI 통합을 통해 가벼운 의미적 코드 탐색이 가능합니다. Homebrew, AppImage 또는 1줄 스크립트로 설치 가능하며, Rust와 Node로 소스에서 빌드할 수도 있습니다. LLM과 안전하고 효율적으로 상호작용할 수 있는 단일 창을 원하는 개발자에게 이상적입니다.

Optima-CityU/LLM4AD_Next

LLM4AD Next는 자연어로 된 문제 설명을 완전하고 실행 가능한 진화 알고리즘 기반 탐색 프로젝트로 전환할 수 있는 Python 툴킷입니다. 대화형 LLM 컨설턴트가 코드 스켈레톤, 구성 파일, 평가기를 생성한 후, 내장된 진화 방법(IslandGA, Diverse Island GA, EoH 등)이 생성된 알고리즘을 자동으로 진화시킵니다. 또한 진화에 적합한 코드 블록을 제안하는 어드바이저, 장기 기억 지원, Docker 이미지, 온라인 데모 기능을 제공합니다.

specula-org/Specula

Specula는 LLM 코딩 에이전트(Claude Code, Codex 등)를 사용하여 병렬 또는 분산 코드의 TLA⁺ 사양을 자동 생성하고, 모델 검증을 수행하며, 발견된 버그를 소스 레벨 패치로 재현하는 오픈소스 도구입니다. 자동, CI 통합, 인터랙티브 모드를 지원하며, Python 3.10+, Java 21+, 그리고 강력한 LLM이 필요하며, Apache 2.0 라이선스로 배포됩니다.

shanggqm/codexU

codexU는 로컬 OpenAI Codex(및 선택적 Claude Code) 데이터를 읽어 할당량 비율, 토큰 사용 추세, 프로젝트/스킬 순위, 로컬 계산 AI 리더십 점수, 예상 API 비용("양모 진행")을 표시하는 네이티브 macOS 메뉴 바(및 Windows Tauri) 앱입니다. 모든 처리는 사용자 머신에서 이루어지며 사용 데이터는 업로드되지 않습니다.

clawdotnet/openclaw.net

OpenClaw.NET은 .NET 네이티브 AI 에이전트 런타임 및 게이트웨이입니다. NativeAOT 호환 실행 파일, 웹 기반 채팅/관리 UI, OpenAI 호환 API, 80개 이상의 내장 도구 어댑터, 다중 채널 지원(슬랙, 텔레그램 등), 클라우드 및 로컬 LLM 제공자(OpenAI, 클로드, 지미니, 딥시크, 올라마, 내장 지마-4)와의 최고 수준의 통합을 제공합니다. 고위험 도구 작업의 감사 및 승인을 가능하게 하는 선택적 거버넌스 기능도 포함되어 있습니다. Windows, macOS, Linux에서 실행 가능한 자체 호스팅 및 관측 가능한 AI 에이전트 플랫폼을 원하는 개발자들을 위한 것입니다.

marswaveai/TypeNo

macOS용 개인정보 중심의 로컬 음성-텍스트 도구로, 활성 애플리케이션에 직접 음성을 입력하고 텍스트를 붙여넣을 수 있습니다.

py-why/dowhy

DoWhy는 엔드투엔드 인과 추론을 위한 Python 라이브러리입니다. 인과 그래프를 정의하고, 자동으로 인과 효과를 식별하며, 다양한 통계적 방법으로 추정하고, 반증 테스트를 통해 강건성을 확인할 수 있습니다. 이 라이브러리는 근본 원인 분석, 반사적 분석, 개입 샘플링을 위한 그래픽 인과 모델도 지원합니다. `pip install dowhy`로 설치하고, 4단계 워크플로우(모델 → 식별 → 추정 → 반증)를 따르세요.

InternScience/InternAgent

InternAgent‑1.5는 장기적 과학적 탐구를 위한 오픈소스 자율 에이전트 프레임워크입니다. 가설 생성, 실험 설계 및 실행(시뮬레이션 포함), 알고리즘 최적화(MLEvolve 핵심을 통해), 그리고 Deep Research 파이프라인을 활용한 문헌 기반 답변을 수행할 수 있습니다. 시스템에는 지속 메모리 모듈, 알고리즘 발견 및 논문 재현용 태스크 스위트, 탐색 또는 QA 모드를 위한 통합 시작 스크립트가 포함되어 있습니다.

Piebald-AI/claude-code-lsps

Claude Code (Anthropic의 AI 코딩 보조 도구)가 수십 가지 언어에 대해 IDE와 유사한 기능(정의 이동, 호버, 참조 검색 등)을 제공할 수 있도록 해주는 LSP 서버 정의의 마켓플레이스입니다. Claude Code ≥ 2.1.50를 설치하고 `npx tweakcc --apply`를 실행하여 패치를 적용한 후, `/plugin marketplace add Piebald‑AI/claude‑code‑lsps`로 마켓플레이스를 추가하고, `rust-analyzer`, `pyright`, `clangd` 등의 언어 서버 바이너리를 README에 따라 설치합니다. 리포지토리는 `.lsp.json` 구성과 마켓플레이스 JSON을 동기화하는 검증 스크립트를 포함합니다.

xybrid-ai/xybrid

Xybrid은 오픈소스이며 크로스플랫폼 SDK로, LLM, 음성 인식(ASR), 음성 합성(TTS) 모델을 모바일, 데스크톱, Unity에서 디바이스 내부에서 로컬로 실행할 수 있습니다. Flutter, Swift, Kotlin, Unity, Rust, Python용 네이티브 바인딩을 제공하며, 많은 인기 오픈소스 모델을 지원하고, 다중 모델 파이프라인으로 연결할 수 있습니다. 클라우드 서비스가 필요하지 않습니다.

lakesoul-io/LakeSoul

LakeSoul은 Rust 네이티브 메타데이터 및 I/O 코어를 가진 오픈 소스 레이크하우스 프레임워크로, ACID 트랜잭션, 증분 upsert, 자동 컴팩션, 세밀한 RBAC를 제공하며 Spark, Flink, Presto, Ray, Daft, Python 기반 도구를 지원합니다. Vortex 포맷을 통해 일반 행과 멀티모달/벡터 데이터를 저장할 수 있으며, 실시간 CDC 인제스션, 스냅샷 쿼리 및 AI/ML 파이프라인과의 원활한 통합을 제공합니다.

bytechefhq/bytechef

ByteChef는 AI 에이전트 오케스트레이션과 시각적 워크플로우 자동화를 통합한 오픈소스 플랫폼입니다. 내장된 에이전트 루프, 250개 이상의 사전 제작된 커넥터, 다중 제공자 LLM 지원, 메모리/RAG 백엔드, 가드레일, Docker 대응 자체 호스팅 런타임을 제공합니다. 무료 코어(Apache 2.0)는 에디터, 에이전트, 커넥터, 다국어 코드를 포함합니다. 엔터프라이즈 기능은 API 노출 워크플로우, Git 네이티브 프로모션, SSO, AI 게이트웨이 제어를 추가합니다. Docker Compose를 통한 빠른 시작으로 수분 내에 로컬 인스턴스를 실행할 수 있습니다.

missuo/koe

ASR과 LLM 교정을 사용하여 정제된 음성 텍스트를 모든 앱에 직접 붙여넣는 경량 macOS 음성 입력 도구.

nimroddolev/chime_tts

알림 벨소리와 TTS 오디오를 로컬에서 하나의 매끄러운 파일로 결합하여 오디오 지연을 제거하는 Home Assistant 통합 기능입니다.

tronghieuit/v-tts

멀티 스피커 합성 및 제로샷 음성 클로닝 기능을 갖추고 CPU에서 효율적으로 실행되는 경량 베트남어 텍스트 음성 변환(TTS) 시스템입니다.

derek-larson14/obsidian-claude-sidebar

Claude Sidebar는 Claude Code(또는 다른 AI 에이전트 CLI)를 실행하는 터미널을 사이드바에 직접 내장하는 Obsidian 플러그인입니다. 에이전트 자동 실행, 여러 탭, 컨텍스트 메뉴 단축키, YOLO 모드를 지원하며 컴퓨터의 모든 폴더에서 작업할 수 있습니다. Obsidian의 커뮤니티 플러그인(또는 수동)으로 설치할 수 있으며, xterm.js와 작은 Python PTY 백엔드를 사용하여 macOS, Linux, Windows에서 실행됩니다.

caiovicentino/polymarket-mcp-server

Polymarket MCP Server는 Claude(또는 모든 LLM)가 Polymarket 예측 시장 포지션을 자율적으로 발견, 분석, 거래 및 모니터링할 수 있도록 하는 Python 기반 MCP 서버입니다. 시장 발견, 분석, 거래, 포트폴리오 관리 및 실시간 모니터링에 걸친 45가지 도구를 제공하며, 구성 가능한 안전 제한 및 풀 노드 인증으로 보호됩니다. 웹 대시보드를 통한 시각적 제어가 가능하며, 데모(읽기 전용) 및 실거래 설정을 위한 상세 문서, 실제 API 테스트, MIT 라이선스가 포함되어 있습니다.

kardolus/chatgpt-cli

ChatGPT CLI는 다양한 LLM 제공자를 위한 크로스 플랫폼 명령줄 클라이언트입니다. 스트리밍 쿼리, 스레드 기반 채팅 기록, 프롬프트 파일 주입, 멀티미디어 I/O, 그리고 예산 및 정책 제약 조건 하에서 셸/파일/웹 검색 도구를 실행할 수 있는 실험적 에이전트 모드 (ReAct / Plan-Execute)를 제공합니다. 또한 사용자 정의 도구 호출을 위해 Model Context Protocol (MCP)을 지원합니다. Homebrew 또는 사전 빌드된 바이너리를 통해 설치하고, `~/.chatgpt-cli/config.yaml`에서 API 키를 구성한 후 `chatgpt "your question"` 또는 `chatgpt --interactive`로 채팅을 시작하세요.

jamsch/expo-speech-recognition

iOS, Android, Web 에서 일관된 API 를 제공하는 React Native 및 Expo 전용 크로스플랫폼 라이브러리입니다.

claraverse-space/ClaraVerse

ClaraVerse는 AI 에이전트 팀, 계층형 메모리, 그리고 허용적인 라이선스를 중심으로 하는 프라이빗 AI 워크스페이스입니다. 채팅, 멀티 에이전트 협업, 터미널 에이전트, 워크플로우 자동화 및 150개 이상의 통합 기능을 제공합니다.

samuel-vitorino/sopro

노트북 CPU나 브라우저에서 고품질의 제로샷 음성 클론과 스트리밍 오디오 합성을 가능하게 하는 120M 파라미터의 경량 텍스트-to-음성 모델 패밀리입니다.

Natooz/MidiTok

MidiTok은 MIDI 및 abc 음악 파일을 토큰 시퀀스로 변환하는 Python 패키지로, Transformer와 같은 기계 학습 모델에 입력하여 음악 생성, 전사 및 기타 MIR 작업을 가능하게 합니다.

OHF-Voice/speech-to-phrase

Home Assistant 전용으로 설계된 빠른 로컬 음성‑텍스트 변환 시스템으로, 일반적인 음성 인식이 아니라 특정 알려진 구문과 장치 이름을 인식합니다.

shivammehta25/Matcha-TTS

Matcha-TTS는 조건부 흐름 매칭을 사용하여 고품질·고효율 음성 합성을 가능하게 하는 빠른 비자기 회귀 텍스트‑투‑스피치 아키텍처입니다.

hhblaze/DBreeze

DBreeze는 ACID 트랜잭션, 스키마 없는 테이블, 풀텍스트 검색을 지원하는 순수 C# 기반의 .NET용 임베디드 데이터베이스로, AI에 핵심적인 HNSW 기반 유사성 검색을 갖춘 통합 벡터 스토어를 제공하여 LLM 임베딩에 대한 빠른 최근접 이웃 쿼리를 가능하게 합니다.

Makememo/MemoAI

로컬 파일 또는 YouTube 링크에서 오디오 및 비디오를 AI로 음성 인식하고, 번역 및 자막 기능을 제공하는 도구.

sudoprivacy/sudocode

Sudo Code는 LLM(Anthropic, OpenAI, xAI, Gemini 등)을 터미널에서 직접 실행하는 오픈소스이자 Rust 기반의 CLI 코드 보조 도구입니다. 모델 독립적이고 파일 기반으로 설계되어, 고도로 사용하는 개발자들이 에이전트의 동작을 완전히 시각화하고 제어할 수 있도록 합니다. 단일 `scode` 바이너리는 대화형 또는 파이프 호환 단일 명령으로 작동할 수 있으며, 에디터/웹 UI용 ACP API를 제공하고, 로컬, 원격 Nexus VFS, 또는 관리형 에이전트의 여러 배포 모드를 지원합니다. 설치는 간단한 설치 스크립트로 가능하며, MIT 라이선스를 따르며 프라이버시 우선, 텔레메트리 없음, 벤더 종속성 없음을 목표로 합니다.

10000ge10000/luci-app-openclaw

OpenWrt 라우터가 OpenClaw AI 게이트웨이를 호스팅할 수 있도록 해주는 LuCI 플러그인으로, Node.js 설치, LLM 모델 관리, WeChat 같은 채널 활성화를 웹 UI로 제공합니다.

liyedanpdx/reddit-ai-trends

Reddit AI Trend Reports는 Docker 기반, MongoDB 백엔드 시스템으로, AI 중심 서브레딧에서 게시물을 가져오고, 이미지 캡셔닝, YouTube 자막 요약, 웹 페이지 스크레이핑으로 선택적으로 보강한 후, Groq 또는 OpenRouter LLM을 사용하여 매일 이중 언어(영어/중국어) 트렌드 보고서를 생성합니다.

mrthinger/wow-voiceover

ElevenLabs TTS를 사용하여 월드 오브 워크래프트 NPC 대화의 AI 음성 대사를 생성하고 재생하는 CLI와 게임 내 애드온으로 구성된 도구 세트입니다.

MahmoudAshraf97/ctc-forced-aligner

Hugging Face CTC 모델을 사용하여 1,100개 이상의 언어를 지원하는, 오디오와 텍스트 간의 효율적인 강제 정렬을 위한 파이썬 패키지입니다.

Deodat-Lawson/LaunchStack

LaunchStack은 수집, OCR, RAG, LLM 채팅 및 백그라운드 작업 인프라를 제공하는 AI 네이티브 애플리케이션을 위한 TypeScript 우선, 포트 기반 엔진입니다. Next.js 참조 앱은 엔진을 PostgreSQL + pgvector, S3, Inngest 및 Google Gemini(또는 OpenAI 호환 엔드포인트)에 연결하는 방법을 보여줍니다. 패키지는 현재 미출판 상태지만 출시 준비가 되어 있으며, 저장소는 로컬 또는 Docker를 통해 실행할 수 있습니다.

lofcz/LLMTornado

LLM Tornado는 30개 이상의 LLM 프로바이더와 벡터 데이터베이스에 대한 통합 액세스를 제공하는 .NET SDK로, 에이전트 오케스트레이션 프리미티브, 멀티모달 I/O, 엔터프라이즈 기능(가드레일, OpenTelemetry)을 추가합니다. 클라우드 API와 로컬 런타임(Ollama, vLLM)과 호환되며, 강형 도구 호출을 지원하고 Microsoft.Extensions.AI와 통합 가능합니다. NuGet을 통해 MIT 라이선스로 배포되며, 여러 공개 프로젝트에서 사용되고 있으며, 지속적으로 유지보수되고 있습니다.

echogarden-project/echogarden

Python이나 Docker를 필요로 하지 않고 오프라인 및 클라우드 기반의 text-to-speech, speech-to-text, 및 audio alignment 도구를 제공하는 Node.js용 포괄적인 음성 처리 도구 모음입니다.