microsoft/TypeAgent
TypeAgent는 대규모 언어 모델, 구조화된 프롬프트, 그리고 혁신적인 "구조화된 RAG" 메모리 시스템을 사용하여 단일 개인용 AI 어시스턴트를 구축하는 Microsoft의 오픈소스 샘플입니다. Electron 기반의 쉘, 자연어 요청을 유형화된 에이전트로 라우팅하는 디스패처, 대화 사실을 논리적 엔티티로 저장하는 메모리 계층, 그리고 LLM 호출을 줄이는 캐시를 포함합니다. 이 리포지토리는 카렌더, 이메일, 브라우저 등 다양한 샘플 에이전트와 사용자 정의 에이전트를 추가할 수 있는 SDK를 제공합니다. 초기 단계의 샘플 코드로, Azure OpenAI에서 영어로 테스트되었으며, 추가 검증 없이는 프로덕션에 적합하지 않습니다.
erdogant/bnlearn
bnlearn는 베이지안 네트워크의 구조 학습, 파라미터화, 질의를 위한 파이썬 라이브러리입니다. 다양한 점수와 탐색 방법을 통한 구조 발견, CPT 추정, 인과 추론(do-계산), 합성 데이터 생성, 시각화를 지원하며, 간단한 API로 통합되어 있습니다.
bugbakery/transcribee
AI를 사용하여 자동 드래프트를 생성하고 공동 수동 편집을 지원하는 오픈소스 오디오 및 비디오 트랜스크립션 도구입니다.
joaopauloschuler/neural-api
CPU (AVX) 또는 OpenCL GPU에서 최신 LLM, 오디오 생성, 이미지 초해상도, 고전적 비전 모델을 실행할 수 있는 네이티브 Pascal 딥러닝 라이브러리. Python 또는 CUDA를 필요로 하지 않으며, 단일 바이너리로 컴파일된다.
FonaTech/Clouds-Coder
Clouds Coder는 CLI 실행과 브라우저 기반 IDE를 분리하고, AI 에이전트 오케스트레이션을 추가하며, 버전 관리된 파일, 충돌 해결, 관리자 승인된 도구 정책을 갖춘 LAN 전용 공동 작업 공간을 제공하는 Python 런타임입니다.
jim60105/docker-whisperX
단어 수준 타임스탬프와 화자 분리를 제공하는 WhisperX용 최적화된 Docker 이미지 모음. 사전 번들된 ASR 모델을 통해 빠르고 효율적인 음성-텍스트 변환을 가능하게 합니다.
TalAter/annyang
음성 인식을 사용하여 음성 명령으로 웹사이트를 제어할 수 있게 해주는 초경량 JavaScript 라이브러리입니다.
lenML/Speech-AI-Forge
ChatTTS, CosyVoice, Whisper를 포함한 여러 TTS 및 ASR 모델에 대해 중앙 집중식 인터페이스를 제공하는 통합 프레임워크 및 API 서버.
open-mmlab/FoleyCrafter
FoleyCrafter는 무음 비디오의 시각적 내용에 기반해 현실감 있고 동기화된 사운드 효과를 생성하는 비디오‑투‑오디오 프레임워크입니다.
brailcom/speechd
여러 텍스트 음성 변환 엔진에 접근하기 위한 통합 API를 제공하는 음성 합성용 장치 독립적 인터페이스.
walkingddd/CPA-Helper
CPA‑Helper는 CLIProxyAPI/CPA 계정을 관리하는 자체 호스팅 웹 대시보드(고 백엔드 + Vue 프론트엔드)입니다. 다중 사용자 분석, 사용자별 API 키 처리, 잔액 제한, 모델 가격 카탈로그, Codex 인증 파일의 건강 상태 점검을 모두 로컬 SQLite에 저장합니다.
CopilotC-Nvim/CopilotChat.nvim
GitHub Copilot Chat(또는 다른 LLM)을 편집기 내부에 직접 통합하는 Neovim 플러그인으로, 채팅, 도구 호출, 사용자 정의 프롬프트, 자동화를 위한 Lua API를 제공합니다.
nishuzumi/gemini-teacher
Google Gemini를 기반으로 한 AI 기반 영어 회화 보조 도구로, 실시간 발음 피드백과 문법 수정을 제공합니다.
dseditor/QwenASRMiniTool
Qwen3-ASR 및 Whisper 모델 기반의 로컬 오프라인 음성 인식 자막 생성 도구. 오디오, 비디오, 마이크 녹음을 SRT 자막으로 변환 가능. CPU 또는 GPU 가속 지원. 다양한 특화 언어 모델, 발화자 분리, 카라오케 문자 단위 하이라이트 내장. 명령줄 인터페이스 및 OpenAI 호환 API 제공.
chenpipi0807/ComfyUI-Index-TTS
고품질 음성 클론과 텍스트-음성 변환을 구현하는 ComfyUI 확장. 다국어 지원, 감정 제어, 다중 캐릭터 소설 구문 분석 기능을 갖춤.
dbccccccc/ttsfm
openai.fm 백엔드를 사용하여 텍스트를 자연스러운 음성으로 변환하는 OpenAI 호환 텍스트 음성 변환(TTS) API 서비스 및 Python SDK입니다.
hgneng/ekho
Ekho는 작성된 텍스트를 음성으로 변환하는 중국어 텍스트 음성 변환 엔진으로, 사용자 정의 음성 데이터 통합을 지원합니다.
bosun-ai/swiftide
Swiftide는 반자율형 에이전트를 위한 에이전트 하네스, 워크플로우 오케스트레이션을 위한 타입형 태스크 그래프, 인덱싱 및 검색을 위한 스트리밍 RAG 파이프라인이라는 세 가지 핵심 구성 요소로 구성된 LLM 애플리케이션 구축을 위한 Rust 프레임워크입니다.
facebookresearch/HolisticTraceAnalysis
Holistic Trace Analysis (HTA)는 분산 학습 작업에서 생성된 PyTorch 프로파일러(Kineto) 트레이스를 읽어 GPU가 계산, 통신, 메모리, 또는 대기 상태에 얼마나 시간을 쓰는지 데이터프레임과 시각화로 제공하는 Python 라이브러리입니다. 커널 수준 분해, 대기 시간 원인, 통신-계산 겹침, 자주 발생하는 커널 패턴, 실행 시간 통계, 증강된 메모리 대역폭/큐 길이 카운터, 트레이스 비교 도구를 제공합니다. `pip install HolisticTraceAnalysis` (Linux/macOS, Python ≥ 3.10)로 설치 가능하며, 노트북에서 `TraceAnalysis` 클래스를 사용해 각 분석용 pandas DataFrames를 얻을 수 있습니다. 문서, 예제, 실험적 CUPTI 카운터 API도 제공됩니다.
tsurumeso/vocal-remover
보컬을 배경 음악에서 분리하여 곡에서 인스트루멘탈 트랙을 추출하는 딥러닝 도구입니다.
ML-KULeuven/deepproblog
DeepProbLog는 확률이 PyTorch 모델에 의해 출력되는 사실인 신경 술어를 도입하여 ProbLog의 확률 논리 프로그래밍과 딥러닝을 병합하는 Python 라이브러리입니다. 정확한 추론과 선택적 근사 추론을 지원하며, 연구 논문의 예제 실험을 포함하고 `pip install deepproblog`으로 설치할 수 있습니다.
rossoctl/rossoctl
Rossoctl은 오픈소스이며 Kubernetes 네이티브 플랫폼으로, RossoCortex 데이터 플레인을 통해 AI 에이전트를 중계하여 신원, 승인, 회복성, 관찰 가능성을 강제합니다. 재사용 가능한 서비스(스킬, 도구, 메모리, 지식 기반, 사전)와 관리 도구를 제공하여 프레임워크에 관계없이 신뢰할 수 있는 프로덕션 수준의 에이전트 배포를 가능하게 합니다.
nnstreamer/nnstreamer
NNStreamer는 개발자가 신경망 추론을 미디어 파이프라인에 직접 임베드할 수 있게 해주는 GStreamer 플러그인을 제공하며, Linux, Android, Tizen 및 macOS 전반에 걸쳐 다양한 AI 프레임워크와 하드웨어 가속기를 지원합니다.
halo-dev/upage
UPage는 대규모 언어 모델을 사용하여 자연어 설명을 기반으로 완전히 반응형 웹 페이지를 생성하는 오픈소스이며 Docker 기반의 플랫폼입니다. 시각 에디터, 다중 페이지 생성, 깔끔한 HTML/CSS/JS 내보내기 기능을 제공하며, 모든 호환 가능한 LLM API와 작동합니다.
backmeupplz/voicy
워커-큐 아키텍처와 GPU 가속 트랜스크립션을 사용하여 음성 메시지를 자동으로 텍스트로 변환하는 Telegram 봇입니다.
tequilahub/tequila
Tequila는 변분 양자 알고리즘을 구축하고 최적화하기 위한 Python 프레임워크입니다. 회로, 하미르토니안, 기대값에 대한 추상 객체, 자동 미분, 여러 양자 시뮬레이터(Qulacs, Qiskit, Cirq 등) 및 양자 화학 패키지(Psi4, PySCF, Madness)와의 원활한 지원을 제공합니다. 사용자는 고수준 코드를 작성하고 `tq.minimize`를 호출하기만 하면 시뮬레이터 또는 실제 하드웨어에서 실행할 수 있습니다.
aliyun/alibabacloud-bailian-speech-demo
Alibaba Cloud Bailian용 개발자 샘플 모음. Qwen-Audio 및 기타 모델을 사용하여 음성 인식, 합성, 실시간 음성 대화를 구현할 수 있습니다.
jcvasquezc/DisVoice
음성에서 음향적 및 언어적 특징을 추출하여 음성 장애를 탐지하고 정서를 인식하기 위한 파이썬 프레임워크입니다.
wenet-e2e/wekws
저전력 IoT 기기용으로 설계된 소형 웨이크워드 탐지용 실용적 엔드투엔드 툴킷.
Azure-Samples/cognitive-services-speech-sdk
Microsoft Cognitive Services Speech SDK를 사용하여 음성 인식, 합성, 번역을 수행하는 크로스플랫폼 코드 샘플 모음입니다.
BindsNET/bindsnet
BindsNET은 CPU 또는 GPU에서 스파이킹 신경망을 구축하고 시뮬레이션하기 위한 PyTorch 기반 라이브러리입니다. 뉴런 모델, 생물학적으로 영감을 받은 학습 규칙(예: STDP), SNN을 ML 또는 RL 에이전트로 변환하는 도구를 제공합니다. pip, Poetry 또는 Docker로 설치할 수 있으며, MNIST 비지도 학습부터 Atari 게임 플레이까지 다양한 예제를 실행할 수 있습니다.
lean-dojo/LeanCopilot
Lean Copilot는 대규모 언어 모델을 증명 자동화 전략으로 통합하는 Lean 4 라이브러리입니다. `suggest_tactics`, `search_proof`, `select_premises`와 같은 명령어를 제공하며, 사전 빌드된 BYT5 모델을 포함하고, 외부 모델은 간단한 HTTP API를 통해 연결할 수 있습니다. 일반적인 Lake 패키지 매니저를 통해 설치 가능하며, 어떤 Lean 프로젝트에서도 즉시 사용할 수 있습니다.
inworld-ai/tts
단일 또는 멀티 GPU 클러스터에서 사전 훈련, SFT, RLHF 정렬을 지원하는 SpeechLM 기반 음성 합성 시스템을 위한 훈련 및 모델링 프레임워크입니다.
openyak/openyak
OpenYak은 모든 대화 기록, 파일 및 프로젝트 데이터를 로컬(Rust + SQLite)에 유지하면서 Codex 또는 Claude Code 에이전트와 채팅할 수 있는 오픈 소스 데스크톱 GUI(Electron + React)입니다. stdio를 통해 공식 런타임을 통합하고 참조 파일(Markdown, HTML, PDF, DOCX, 코드)을 표시하며, 사용자와 에이전트 모두 동일한 페이지를 제어할 수 있는 Playwright 기반 공유 브라우저를 제공합니다. Node 26, Rust 1.90 및 자체 Codex/Claude CLI 바이너리로 실행하십시오. 앱은 v2 alpha 버전이며 Apache-2.0 라이선스가 적용됩니다.
machinewrapped/llm-subtrans
LLM‑Subtrans는 Python 기반의 데스크톱 및 CLI 도구로, LLM API(Gemini, OpenAI, Anthropic 등)를 사용하여 자막 파일(SRT/ASS/VTT)을 번역합니다. 플러그인 가능한 자막 형식, 선택적 오디오 트랜스크립션, 프로젝트 파일 재개, 다양한 고급 CLI 옵션을 지원합니다. 사전 빌드된 Windows/macOS 패키지 또는 가상 환경 설치자로 설치 가능하며, GUI 또는 명령줄을 통해 실행할 수 있으며, 제공자의 API 키만 입력하면 사용 가능합니다.
neiltron/apple-health-mcp
AI 어시스턴트 클라이언트(MCP 경유)가 인메모리 DuckDB 데이터베이스를 사용하여 개인의 Apple Health CSV 내보내기 파일에 대해 SQL 쿼리를 실행할 수 있게 해주는 로컬 Node.js 서버입니다. 스키마 검색, 임시 쿼리, 건강 요약 보고서를 제공하며 데이터는 사용자의 컴퓨터에 유지됩니다.
ksenxx/kiss_ai
KISS Sorcar는 오픈소스이며 로컬 우선의 AI 에이전트 프레임워크로, 데몬(`kiss‑web`)을 실행하고 VS Code, 웹/모바일, Python 인터페이스를 통해 자연어 작업을 제출할 수 있습니다. OpenAI, Anthropic, Gemini, 로컬 엔드포인트 등 사용자가 설정한 모든 LLM을 지원하며, 하나의 워크플로우에서 여러 모델을 혼합 사용할 수 있습니다. 메시징, 이메일, 스마트홈, 생산성 서비스용으로 43개의 내장 제3자 에이전트를 제공합니다. 사용자 정의 Python "확장 에이전트"를 통해 각 작업마다 프롬프트, 도구, 예산, 안전 훅을 정의할 수 있습니다. 모든 프롬프트는 기기 내부에 유지되며, git worktree 격리, 음성 웨이크워드, 스케줄된 자동화, 도구 호출을 시스템이 처리하여 프라이버시 중심이며 확장 가능한 개인용 AI 어시스턴트입니다.
linuxrebel/DocuBrowser
DocuBrowse는 오프라인에서 작동하는 AI 강화 문서 검색 도구입니다. 다양한 파일 형식을 인덱싱하고, 키워드, 의미, 하이브리드 검색(로컬 Ollama 임베딩 사용)을 제공하며, 문서 내 '딥 링크'를 지원하고 로컬 모델로 AI 요약을 생성할 수 있습니다. 모든 작업은 로컬에서 수행되어 프라이버시를 보장하며, Linux, Windows, macOS용 패키지로 제공됩니다.
kstonekuan/tambourine-voice
AI를 사용해 음성을 깨끗한 텍스트로 변환하고 포맷하여, 어떤 활성 애플리케이션에도 직접 입력하는 오픈소스 유니버설 음성-텍스트 인터페이스입니다.
Lamatic/AgentKit
AgentKit는 70개의 완성된 "킷"(완전한 앱, 파이프라인 또는 템플릿)을 제공하는 오픈소스 SDK입니다. 킷은 간단한 구성 파일로 정의되며, 시각적 플로우 스튜디오에서 편집 가능하고, 서버리스로 실행되는 Next.js 앱으로 배포됩니다. 지원 트리지, 코드 리뷰, RAG 채팅, 채용 어시스턴트, 법무/의료 봇 등 다양한 비즈니스 중심의 에이전트를 커버하여 신뢰할 수 있고 엔터프라이즈 수준의 AI 에이전트를 즉시 구축할 수 있는 플랫폼입니다.
istupakov/onnx-asr
ONNX 모델을 사용하여 자동 음성 인식(ASR)을 수행하는 경량 Python 패키지로, 에지 및 서버 하드웨어에 빠른 배포를 위해 PyTorch나 Transformers가 필요하지 않습니다.
cyberofficial/Synthalingua
라이브 스트림, 마이크 오디오, 비디오 파일을 영어 및 기타 언어로 실시간 전사 및 번역하는 셀프 호스팅 AI 도구입니다.
AudarAI/Audar-ASR-V1
아랍어를 우선으로 하는 생성형 음성 인식 모델 패밀리로, 방언 아랍어와 코드 스위칭 음성에 대해 최첨단 변환 성능을 제공합니다.
janvarev/Irene-Voice-Assistant
기본적으로 오프라인으로 작동하며 확장 가능한 플러그인과 LLM 기반 자연어 명령 처리를 지원하는 러시아어 음성 비서.
cmusphinx/pocketsphinx
PocketSphinx는 저자원 장치에서 효율적으로 작동하는 오픈소스이며, 오프라인으로 동작하는 음성-텍스트 변환 엔진(C 라이브러리와 Python 바인딩 포함)입니다. 오디오 인식 또는 정렬을 수행하고 결과를 JSON 형식으로 출력하는 명령줄 도구와 API를 제공합니다.
ManimCommunity/manim-voiceover
OpenAI Whisper를 사용하여 단어별 애니메이션 동기화를 가능하게 하고, AI 음성 및 녹음 도구를 Python에 직접 통합하는 Manim 플러그인입니다.
Migushthe2nd/MsEdgeTTS
Microsoft Edge Read Aloud API를 사용하여 서버 측 런타임에 텍스트 음성 변환 합성을 제공하는 간단한 Azure Speech Service 모듈입니다.
PowerBeef/Vocello
macOS 및 iOS용 로컬 우선 음성 스튜디오로, MLX와 Swift를 사용하여 클라우드 의존 없이 고품질 음성 생성을 가능하게 하며, 음성 클로닝과 커스텀 음성 설계 기능을 제공합니다.