karanb192/itr-wala
itr‑wala는 인도 개인 소득세 신고서를 로컬에서 준비하는 오픈소스 CLI입니다. LLM은 PDF 읽기에만 사용되며, 모든 법정 계산은 철저하게 테스트된 Python 엔진이 수행합니다. 이 도구는 입력을 검증하고, 구 제도 대비 신 제도를 비교하며, 즉시 입력 가능한 신고 팩을 출력합니다. 최종 제출과 지불은 정부 포털에서 수동으로 수행해야 합니다.
mrthinger/wow-voiceover
ElevenLabs TTS를 사용하여 월드 오브 워크래프트 NPC 대화의 AI 음성 대사를 생성하고 재생하는 CLI와 게임 내 애드온으로 구성된 도구 세트입니다.
NSHipster/sosumi.ai
sosumi.ai는 Node 기반 서비스로, Apple 개발자 문서(예: Swift 문서, HIG, WWDC 녹화 내용)를 깔끔한 Markdown으로 변환하여 AI 모델과 자동화 도구가 쉽게 사용할 수 있도록 합니다. 간단한 URL 리라이트, HTTP/MCP API, CLI, Chrome 확장 프로그램, Cloudflare Workers 또는 Hono 호환 런타임에서의 자체 호스팅이 가능합니다.
McCloudS/subgen
Bazarr, Plex, Jellyfin, Emby와 통합되는 자체 호스팅 AI 자막 생성 도구. 개인 미디어 라이브러리의 오디오를 트랜스크립트하고 자막을 생성합니다.
nethical6/conversation-steganography
Conversation Stenography는 AES-SIV로 비밀 메시지를 암호화하고, 로컬에서 실행되는 LLM(예: Llama 3.2 또는 GPT-2)의 토큰 선택에 암호문을 인코딩하여 자연스러운 외관의 커버 텍스트를 생성하는 오픈소스 Go CLI입니다. 사용자는 이 텍스트를 어떤 채팅 앱에도 복사할 수 있으며, 수신자는 동일한 도구를 실행하여 숨겨진 메시지를 복호화합니다. 시스템은 완전히 오프라인이며, 공유된 비밀 문구(PBKDF2 기반 키)를 사용하고 메시지를 무결성 보장을 위해 체인으로 연결합니다. 설치 마법사, 시뮬레이션 모드, 여러 CLI 명령어를 포함하지만, 개념 증명이며 기존 스테가노그래피 탐지 방법에 취약합니다.
mikeoliphant/neural-amp-modeler-lv2
NeuralAudio 엔진을 사용하여 뉴럴 네트워크 기계학습 앰프 모델을 재생하는 LV2 플러그인입니다.
kadirnar/whisper-plus
OpenAI의 Whisper를 확장하여 트랜스크립트 생성, 화자 다이어라이제이션, 요약, RAG 기반 동영상 채팅을 지원하는 종합적인 오디오 및 비디오 처리 툴킷입니다.
vercel-labs/coding-agent-template
認証済みユーザーがAI駆動のコーディングタスク(Claude、Codex、Copilot、Cursor、Gemini、opencode)を作成できるVercelホスティングテンプレート。Vercel Sandboxを起動し、選択されたエージェントを実行、AI生成ブランチに変更をコミット、リアルタイムログを表示。Next.js 15、Tailwind、Neon Postgres、Vercel AI Gatewayで構築。マルチユーザーOAuth、ユーザー別APIキー、イテレーティブ作業向けのオプションサンドボックスKeep-Aliveをサポート。
yym68686/uni-api
uni‑api는 OpenAI 호환 API를 단 하나 제공하는 설정 중심 서버로, OpenAI, Anthropic, Gemini, Vertex, Azure, AWS 등 다양한 LLM 제공업체로 요청을 라우팅합니다. 가중치 및 라운드로빈 로드 밸런싱, 자동 재시도, 모델별 타임아웃, 레이트 제한, 도구 호출 전달, 콘텐츠 모니터링, 세부 요청 오버라이드 등은 모두 `api.yaml` 파일 또는 `CONFIG_URL`로 정의 가능. Docker 컨테이너로 배포 가능 (Fugue의 원클릭 버튼 제공)
stenolabs/stenoai
데이터가 외부로 유출되지 않도록 기밀 회의를 장치 내에서 로컬로 기록, 전사 및 요약하는 프라이버시 우선 AI 메모장입니다.
braindecode/braindecode
Braindecode는 원시 뇌 신호 데이터(EEG/ECoG/MEG)에 딥러닝 모델을 적용하는 Python 툴박스입니다. PyTorch와 MNE-Python을 기반으로 구축된 데이터셋 로더, 전처리, 여러 기성 신경망 아키텍처 및 시각화 유틸리티를 제공합니다. `pip install braindecode`를 통해 설치할 수 있으며, 신경생리학적 데이터를 다루는 신경과학자 및 머신러닝 연구자를 대상으로 합니다.
SciML/NeuralPDE.jl
NeuralPDE.jl은 물리 기반 신경망으로 ODE, SDE, RODE, PDE를 푸는 Julia 라이브러리입니다. 기호적 방정식에서 손실 함수를 자동 생성하고, Flux/Lux를 사용해 GPU 훈련이 가능하며, NeuralOperators와 통합하여 고급 신경 연산자 모델을 구축할 수 있습니다.
dimastatz/whisper-flow
OpenAI Whisper를 사용하여 배치 처리 대신 실시간 스트리밍을 통해 저지연 음성-텍스트 변환을 제공하는 실시간 전사 서비스입니다.
BUTSpeechFIT/DiariZen
자기 지도 학습과 구조적 가지치기를 사용하여 오디오 녹음에서 누가 언제 말했는지를 정확하게 식별하는 화자 다이어리제이션 툴킷입니다.
bigsk1/voice-chat-ai
다양한 LLM 및 TTS 제공업체를 활용하여 실시간 대화와 로컬 음성 클로닝을 지원하는 음성 기반 AI 인터페이스입니다.
LambdaTest/agent-skills
AI 코딩 어시스턴트(Claude Code, Copilot 등)를 위한 플러그인 "스킬"을 제공하는 Node.js 라이브러리로, Selenium, Playwright, Cypress 등의 테스트 자동화 코드를 생성하고 TestMu AI 클라우드 플랫폼에서 실행할 수 있습니다.
Quantatirsk/qwen3-asr
Qwen3‑ASR는 Qwen3‑ASR 모델(0.6 B 및 1.7 B)을 감싸는 자체 호스팅 음성-텍스트 서버입니다. GPU‑vLLM 백엔드 또는 CPU‑Rust 백엔드를 자동 선택하며, OpenAI 및 Alibaba 호환 HTTP/WebSocket API를 제공합니다. 화자 분리, VAD 기반 세그멘테이션, 배치 추론을 지원하며 Docker, 커스텀 GPU 이미지, 오프라인 tar볼로 배포 가능합니다. MIT 라이선스입니다.
IBM/LNN
LNN은 논리 공식을 가중치가 있는 신경망으로 표현하는 파이썬 라이브러리로, 모순되거나 불완전한 지식이 있어도 해석 가능하고 미분 가능한 추론과 학습을 가능하게 합니다.
huisezhiyin/sdd-riper
SDD‑RIPER Light는 LLM 기반 코딩 에이전트에 제어 플레인을 제공하는 경량이고 리포지토리 내재형 프레임워크입니다. 명확한 루프(목표 재제시, 최소 사양 생성, 인간 승인 대기, 실행, 증거로 검증, 결과 동기화)를 통해 코드를 안전하고 감사 가능하며 복구 가능한 방식으로 수정할 수 있습니다. 네 가지 모듈식 '스킬'(light, strict, codemap, new‑chat‑ready)로 일상 업무, 고위험 작업, 낯선 코드베이스, 인수인계에 대응합니다.
leiting-eric/DailyBrief
DailyBrief는 26개의 무료 뉴스 피드, 21개 종목의 시장 데이터, AI 생성 요약을 통합하는 자체 호스팅형 Node/TypeScript 앱으로, 이중 언어(중국어/영어) 단일 페이지 HTML 보고서를 생성합니다. 6개의 교체 가능한 LLM 백엔드를 지원하며, GitHub Actions + Pages, 로컬 원클릭 설치, AI 에이전트 설치의 3가지 배포 옵션을 제공하며, 비용은 LLM API 호출만 발생(DeepSeek 사용 시 월 약 1달러).
timoncool/ACE-Step-Studio
ACE-Step 1.5 XL 모델을 사용하여 보컬, 가사, 음악 비디오를 포함한 완전한 곡을 로컬에서 생성하는 AI 음악 제작 스튜디오입니다.
huanchong-99/SoloDawn
SoloDawn은 풀스택 소프트웨어 개발을 자동화하는 오픈 소스 웹 앱입니다. 주요 LLM 기반 에이전트가 필요에 따라 자식 에이전트를 생성하여 여러 AI 명령줄 도구(Claude Code, Codex 등)를 오케스트레이션합니다. 작업은 병렬 Git 브랜치에서 실행되며, 각 작업은 3단계 품질 검사를 통과해야 합니다. 생성된 코드가 90점 루브릭 기준을 충족하면 자동으로 병합되어, 간단한 자연어 설명만으로 프로덕션 준비 상태의 제품을을 제공합니다.
strands-labs/ai-functions
Strands AI Functions는 일반적인 외형의 함수를 LLM 기반 에이전트로 전환하는 Python 라이브러리입니다. `@ai_function` 데코레이터를 사용하면 문서화된 프롬프트를 가진 일반 함수를 작성할 수 있습니다. 라이브러리는 프롬프트를 구성하고, 모델(Bedrock, OpenAI, Claude 등)을 호출하며, 타입화된 결과를 분석하고, 사용자 정의 포스트 조건이 충족될 때까지 자동으로 재프롬프트합니다. 함수는 실제 Python 객체(예: pandas DataFrames)를 반환할 수 있으며, 비동기로 실행 가능하고, *AI 스레드*를 통해 상태를 유지하며, 로컬 또는 WebSocket을 통해 코디네이터에 의해 팀으로 오케스트레이션될 수 있습니다. 기능으로는 자기 수정 루프, 경제적 인식 모델 선택, 메모리 기반 최적화, 분산 에이전트를 관리하는 CLI/TUI가 있습니다. `pip install strands-ai-functions`로 설치 가능(옵션 확장으로 Claude, Kiro, Codex 지원)
FrigadeHQ/yap
macOS용 가벼운 디바이스 내 음성 입력 도구로, Apple의 네이티브 음성 API를 사용하여 개인 정보를 보호하면서도, 어떤 활성 애플리케이션에도 전사된 텍스트를 붙여넣을 수 있습니다.
fluxions-ai/vui
Vui는 음성-텍스트 변환, 로컬 LLM, 스트리밍 TTS 모델(Vui Nano, 300 M 파라미터)을 연결하는 오픈소스 실시간 음성보조기 스택입니다. WebRTC/WebSocket 파이프라인, 전환 제어 및 바지인 기능, OpenAI Realtime-API 호환성, 한 번의 HTTP 요청으로 음성 노트 생성, 플러그인형 ASR(faster‑whisper 또는 Moonshine) 및 LLM 백엔드(Ollama, vLLM, OpenAI 호환), 도구 라우팅, 음성 클론, 옵션으로 Claude 스타일 작업 위임 기능을 제공합니다. 단일 명령어 스크립트 또는 Docker-compose로 설치 가능하며, Linux + NVIDIA GPU, macOS + MLX, Cloudflare Tunnel 또는 Tailscale를 통한 모바일 접근을 지원합니다.
MoonInTheRiver/DiffSinger
가사, MIDI, 및 음고 데이터를 사용하여 고품질의 노래 목소리 합성 및 TTS 생성을 위한 확산 모델 기반 프레임워크입니다.
GetBindu/Bindu
Bindu는 어떤 LLM 기반 에이전트도 보안적 신원 검증 및 결제 기능을 갖춘 인터넷 서비스로 전환할 수 있는 오픈소스 프레임워크입니다. 내장된 mTLS, DID 서명, Hydra를 통한 OAuth2, USDC(x402) 결제 강제, 스킬 광고, 푸시 알림, 다국어 SDK(파이썬, 타입스크립트, 코틀린)를 제공합니다. 단일 `bindufy()` 호출로 JSON-RPC 엔드포인트, 선택적 공개 터널, 배포 도우미를 얻어 스웜, 유료 API, 규제 대응 B2B 에이전트 통합을 쉽게 구축할 수 있습니다.
watzon/pindrop
장치 내 음성 인식 엔진을 사용하여 개인 정보 보호된 오프라인 음성-텍스트 변환을 제공하는 Mac 전용 AI 음성 입력 앱입니다.
sp-uhh/sgmse
PyTorch 기반 확산 생성 모델을 이용한 음성 향상 및 디레버브 구현으로, 오디오 신호에서 잡음과 잔향을 제거합니다.
prophesier/diff-svc
확산 모델을 사용하여 입력된 노래 목소리를 목표 음색으로 변환하고 기본적인 피치 교정을 지원하는 가창 목소리 변환 도구입니다.
VRCWizard/TTS-Voice-Wizard
VRChat 및 기타 환경을 위한 접근성 도구로, 음성을 텍스트와 텍스트를 음성으로 변환하고 실시간 번역 및 아바타 통합을 제공합니다.
aa0101181514/tw-legal-rag
tw-legal-rag는 2,200만 건 이상의 대만 판례, 법률, 행정 결정을 포함하는 호스팅된 의미 기반 검색 서비스에 연결하는 오픈소스 Python CLI입니다. 자연어 검색, 정확한 사건 번호 조회, 결과(요약, 판례 이력, 인용 허용 목록 포함)를 JSON 파일로 번들링, LLM 생성 답변에 대한 결정론적 인용 검증이 가능합니다. 도구 자체는 LLM을 호출하지 않으며 API 키도 필요 없으며, 법적 AI 애플리케이션을 위한 검색 증강 생성(RAG) 프론트엔드로 작동합니다.
tgies/klattsch
브라우저, Node.js, CLI에서 작동하는 원시적인 병렬 포르마턴트 음성 합성기로, 1970년대와 80년대 컴퓨터 음성의 레트로 사운드를 재현합니다.
MaKTaiL/gemini-srt-translator
Gemini SRT Translator는 Google Gemini 모델을 사용하여 자막 파일(.srt/.ass)을 번역하거나 음성 인식하는 Python 패키지입니다. 명령줄 도구(gst) 또는 Python API를 통해 작동하며, FFmpeg를 사용해 비디오에서 자막/음성을 추출할 수 있고, 재시도 가능하고 안전한 배치 처리, 모델 조정, 엔터프라이즈 Vertex AI 인증, AI 코딩 에이전트용 스킬 설치 기능을 지원합니다.
Stability-AI/stable-audio-metrics
장시간 스테레오 오디오 생성 모델을 평가하기 위한 평가 지표 모음으로, Fréchet 거리, KL 발산, CLAP 점수를 계산할 수 있는 도구를 제공합니다.
HexmosTech/git-lrc
git-lrc는 Go 기반 도구로, 전역 Git 훅을 설치하여 모든 커밋 시 AI 기반 코드 리뷰를 실행합니다. diff를 구성 가능한 LLM(기본값 Gemini)으로 전송하고, 인라인 주석, 위험 점수, 슬라이드 요약을 반환하며, 리뷰 상태를 커밋 메시지에 기록합니다. 월 30k LOC까지 무료이며, 유료 플랜은 100k LOC당 32달러부터 시작합니다.
ankur-anand/unisondb
UnisonDB는 엣지 AI를 위한 오픈소스, 로그 기반 실시간 데이터베이스입니다. 데이터는 B+ 트리(BoltDB 또는 LMDB)에 저장되며, 쓰기 전용 로그를 통해 gRPC 또는 객체 스토어(S3/MinIO)로 즉시 복제됩니다. Raft 기반 고가용성 쓰기, 밀리초 미만의 변경 알림, 다중 모델 지원(KV, 와이드 컬럼, 대용량 객체)을 제공하여 수천 개의 엣지 노드가 별도의 스트리밍 인프라 없이 동기화될 수 있습니다.
ratwithacompiler/OBS-captions-plugin
Google Cloud Speech Recognition API를 사용하여 Twitch 스트리밍 및 VOD에 실시간 자막을 제공하는 OBS 플러그인입니다.
AaronZ345/GTSinger
전문가 녹음과 현실적인 악보를 갖춘 대규모 다국어 가창 코퍼스로, AI 가창 음성 합성과 기술 제어를 향상시키는 것을 목표로 합니다.
decocms/studio
deco Studio는 조직이 프라이빗 AI 에이전트를 실행할 수 있도록 하는 오픈 소스 TypeScript 우선 플랫폼입니다. 모델 호출 라우팅, 내부 도구에 대한 보안 연결 관리, SSO/RBAC, 감사 로그 및 비용 배분을 위한 단일 Model Context Protocol (MCP) 컨트롤 플레인을 제공합니다. 에이전트는 컨텍스트, 도구 및 정책을 번들로 묶고, 연결은 GitHub, Slack 또는 데이터베이스와 같은 서비스에 대한 암호화된 자격 증명을 저장하며, 모델 레이어는 교체 가능합니다 (OpenRouter, Anthropic, OpenAI 등). 시스템은 로컬, Docker 또는 Kubernetes의 Helm을 통해 실행할 수 있으며 OpenTelemetry를 통한 완전한 관측성을 포함합니다.
statewright/statewright
Statewright는 LLM 기반 에이전트를 결정론적 상태기계로 감싸는 오픈소스 Rust 기반 프레임워크로, 각 상태별 도구 정책, 모델 라우팅, 승인 게이트를 강제하여 코드 작성 에이전트의 신뢰성을 높입니다. CLI/TUI, 호스트 플러그인(Claude Code, Codex, Cursor 등), 자체 호스팅 가능한 Docker 스택을 제공합니다.
johnmarktaylor91/torchlens
TorchLens는 어떤 PyTorch 모델(프리뷰 모드에서는 다른 프레임워크도 지원)의 전체 계산 그래프를 캡처, 시각화, 개입할 수 있는 파이썬 라이브러리입니다. 모든 활성화와 기울기를 기록하고, 형태, dtypes, FLOPs, 실행 시간, 파라미터 수 등 연산별 풍부한 메타데이터를 제공합니다. 텐서 쿼리 및 필터링, PDF 그래프 생성, 수용/사영 영역 계산, 전방 전파 중 실시간 개입, 재실행을 통한 "만약에" 실험이 가능합니다. 11,600개 이상의 아키텍처에서 검증되었으며, 약 89%가 알고리즘적으로 정확성 검증되었습니다.
JeffreyCA/spleeter-web
Spleeter 및 Demucs와 같은 AI 모델을 사용하여 노래에서 보컬, 베이스, 드럼을 분리하거나 제거하는 웹 애플리케이션입니다.
plmbr/notebook-intelligence
Notebook Intelligence(NBI)는 AI 채팅, 인라인 코드 생성, 자동 완성 및 자율적인 노트ブック 편집 에이전트를 추가하는 오픈소스 JupyterLab 확장 프로그램입니다. Copilot, OpenAI 호환 API, 로컬 Ollama 모델 또는 Anthropic Claude(Claude Code를 통해)와 함께 작동합니다. 기능에는 Claude 전용 도구, MCP 기반 도구 호출, 다국어 인식 및 AI 편집 파일의 라이브 리로드가 포함됩니다.
dectalk/dectalk
클래식 DECtalk 음성 합성 엔진의 원본 소스 코드를 현대적 플랫폼용으로 보존하고 컴파일하는 텍스트 음성 변환(TTS) 시스템입니다.
Aivis-Project/AivisSpeech
AivisSpeech Engine과 ONNX 기반 모델을 사용하여 감정 풍부한 합성 음성을 생성하는 일본어 텍스트 음성 변환(TTS) 소프트웨어입니다.
sandrohanea/whisper.net
whisper.cpp를 통해 OpenAI Whisper에 대한 Dotnet 바인딩을 제공하여 .NET 애플리케이션에서 고성능 음성-텍스트 변환 및 번역을 가능하게 합니다.
URUWorks/TeroSubtitler
프로페셔널한 자막 제작을 위해 AI 음성 인식, 번역, 더빙 도구를 통합한 오픈소스이며 크로스플랫폼 지원 자막 편집기입니다.