TensorSpeech/TensorFlowASR
TensorFlow 기반의 자동 음성 인식 (ASR) 프레임워크로, 다양한 ASR 아키텍처를 구현하고 효율적인 배포를 위해 TFLite 변환을 지원합니다.
sooftware/conformer
CNN과 Transformer를 결합하여 국소적 및 전역적 오디오 의존성을 모두 포착함으로써 음성 인식을 향상시키는 Conformer 아키텍처의 PyTorch 구현체입니다.
modal-labs/quillman
Moshi 음성 대 음성 모델을 기반으로 하여, 인간과 같은 상호작용을 위해 저지연, 양방향 오디오 스트리밍을 제공하는 음성 채팅 애플리케이션입니다.
flashlight/wav2letter
wav2letter++는 최첨단 음성-텍스트 변환 아키텍처를 구현하기 위한 레시피와 사전 학습된 모델을 제공하는 엔드 투 엔드 자동 음성 인식 프레임워크입니다.
Uberi/speech_recognition
OpenAI Whisper, Google Speech, Vosk와 같은 다양한 온라인 및 오프라인 엔진을 지원하는 음성 인식용 통합 인터페이스를 제공하는 Python 라이브러리입니다.
elevenlabs/elevenlabs-js
ElevenLabs의 공식 Node.js SDK로, 현실적인 AI 음성 합성, 실시간 오디오 스트리밍, 음성 기반 AI 에이전트를 애플리케이션에 통합할 수 있습니다.
wildminder/ComfyUI-VoxCPM
표현력 있는 음성 생성, 자연어 음성 설계 및 고급 보이스 클로닝을 가능하게 하는 토크나이저 프리 TTS 시스템인 VoxCPM을 위한 ComfyUI 커스텀 노드 통합.
codeforequity-at/botium-speech-processing
오픈 소스 및 클라우드 기반 음성-텍스트 변환(STT) 및 텍스트-음성 변환(TTS) 서비스를 위한 통합 API로, 챗봇 및 음성 애플리케이션의 오디오 처리를 간소화합니다.
hengruiyun/AI-Stock-Master
AI Stock Master는 Windows/macOS용 데스크톱 앱으로, 정량적 주식 분석 알고리즘(RTSI, TMA, MSCI)과 로컬에서 실행되는 LLM(Mini Ollama)을 결합하여 중국, 홍콩, 미국 주식에 대한 자연어 시장 보고서와 거래 신호를 생성합니다. 연구용 도구이며, 상업용 거래 플랫폼이 아닙니다.
24kchengYe/MemoMind
MemoMind는 AI 코딩 에이전트를 위한 로컬 호스팅, GPU 가속 메모리 시스템입니다. 채팅, 문서, 일상 이벤트에서 추출한 사실을 PostgreSQL + pgvector에 저장하고 지식 그래프를 구축하며, 빠른 4가지 방향 하이브리드 검색(의미적, BM25, 그래프, 시계열)을 제공합니다. 에이전트는 새로운 정보를 유지하고 관련 기억을 회상하며 전체 저장소를 반성할 수 있습니다. 모든 데이터는 사용자 기계에 머무르며, 어떤 OpenAI 호환 LLM과도 작동하고, 웹 대시보드를 통해 기억을 탐색하고 내보낼 수 있습니다.
adobe-research/dynasaur
DynaSaur는 작업을 수행하기 위해 Python 코드를 액션으로 작성하고 재사용하며, 사전 정의된 도구가 부족할 때 동적으로 적응하는 AI 에이전트 프레임워크입니다.
Paritok-official/paritok-4b-v1
Paritok은 코드 에이전트(Claude Code, Cursor, Codex, OpenHands 등)와 LLM API 사이에 위치하는 오픈소스 프록시입니다. (1) 관련 없는 도구 스키마를 필터링하고, (2) 4B 모델로 파일 읽기/도구 출력/기록을 압축하며, (3) 오래된 대화를 요약함으로써 입력 토큰 사용량을 줄입니다. 게이트웨이는 Python 패키지(`paritok[proxy]`)로, Ollama나 vLLM을 통해 로컬에서 실행하거나 호스팅 GPU 서비스를 통해 사용할 수 있습니다. 보고된 절약 효과는 첫 번째 타ーン에서 약 25%, 장시간 세션에서는 60% 이상이며, 비용 절감이 두드러집니다. 프로젝트는 Apache-2.0 라이선스이며, 대시보드와 VS Code 확장도 포함되어 있습니다.
Picovoice/speech-to-text-benchmark
다양한 데이터셋에서 음성‑텍스트 엔진을 벤치마킹하여 정확도, 지연 시간, 계산 효율성을 비교하는 미니멀리스트 프레임워크.
mrwadams/attackgen
AttackGen은 LiteLLM를 통해 LLM(OpenAI, Anthropic, Google, Mistral, Groq 등)을 사용하며, MITRE ATT&CK, MITRE ATLAS 및 AI 내부 위협 모델과 결합하여 완전한 사고 대응 테이블탑 시나리오, 탐지 및 대응 보고서, ATT&CK Navigator 레이어를 생성하는 오픈소스 Streamlit 기반 웹 앱입니다. 여러 LLM 제공자를 지원하며, 개선을 위한 채팅 어시스턴트를 제공하고, 로컬 또는 Docker 컨테이너로 실행할 수 있으며, 에이전트 통합을 위한 선택적 FastMCP 서버도 포함하고 있습니다.
nullpointexception-i/agent-sphere
AgentSphere는 LLM 기반 ReAct 루프를 실행하고, 멀티에이전트 서브런, Chrome 확장 프로그램을 통한 실제 브라우저 자동화, 모델 라우팅, 지속적인 다중 레벨 메모리, 인간이 루프에 개입하는 명확화, OIDC SSO, 임베디드 챗 위젯을 지원하는 Java-Spring/React 플랫폼입니다.
csdcorp/speech_to_text
Android, iOS 및 web에서 짧은 음성 명령이나 문구를 사용하기 위해 앱이 네이티브 장치의 음성 인식 기능에 액세스할 수 있도록 하는 Flutter 플러그인입니다.
Picovoice/leopard
Leopard는 여러 플랫폼에서 프라이버시를 보호하고 정확하며 계산 효율적인 음성 인식 전사 서비스를 제공하는 온디바이스 음성 인식 엔진입니다.
Picovoice/cheetah
디바이스에서 실행되는 스트리밍 음성-텍스트 엔진으로, 여러 플랫폼에서 개인 정보를 보호하면서 실시간 오디오 전사를 제공합니다.
innovatorved/whisper.api
whisper.cpp 기반의 고성능 자가 호스팅 음성 인식(speech-to-text) API로, Deepgram과 호환되어 통합이 용이합니다.
deepgram/deepgram-python-sdk
자동 음성 인식, 텍스트 음성 변환, 언어 이해 API를 간편하게 통합할 수 있는 Deepgram 공식 Python SDK입니다.
CortexReach/memory-lancedb-pro
memory-lancedb-pro는 AI 에이전트에게 지속적이고 검색 가능한 기억을 제공하는 프로덕션 수준의 OpenClaw 플러그인입니다. 자동으로 대화 조각을 캡처하고, LLM으로 분류하여 LanceDB 벡터+BM25 인덱스에 저장한 후, 가장 관련 있는 기억을 자동으로 프롬프트에 삽입합니다. 하이브리드 검색, 크로스 인코더 재랭킹, Weibull 기반 망각, 에이전트/사용자/프로젝트별 스코프, 모든 OpenAI 호환 임베딩 제공자 지원 기능을 갖추고 있습니다. 한 번의 클릭 스크립트 또는 OpenClaw CLI로 설치 가능하며, 짧은 JSON 블록으로 구성하고 내장 CLI로 저장소를 관리할 수 있습니다.
ankane/neighbor
Neighbor는 ActiveRecord 모델에 벡터 기반의 최근접 이웃 검색 기능을 추가하는 Rails gem입니다. PostgreSQL(pgvector 또는 cube), MariaDB, MySQL(HeatWave), SQLite, Redis, S3를 지원하며, 다양한 거리 메트릭, 여러 벡터 유형, 정확 및 근사 인덱싱을 제공합니다. Rails 앱 내에서 의미 검색, 추천, 하이브리드 검색을 직접 구현할 수 있습니다.
nii-yamagishilab/project-NN-Pytorch-scripts
신경망 보코더와 음성 위조 방지(위조 음성 탐지)에 초점을 맞춘 PyTorch 스크립트 및 도구의 모음입니다.
elyra-ai/elyra
Elyra는 비주얼 파이프라인 에디터, 노트북/Python/R 스크립트의 배치 작업 실행, 재사용 가능한 코드 스니펫, LLM 기반 코드 보조, Jupyter Enterprise Gateway를 통한 하이브리드 런타임 지원, Git 통합을 포함한 JupyterLab 확장 모음입니다. pip 또는 conda(또는 Docker를 통해) 설치 가능하며, 데이터 과학 팀이 노트북 환경을 벗어나지 않고 AI 파이프라인을 구축, 실행, 버전 관리할 수 있게 해줍니다.
QJHWC/PaperForge
PaperForge Research OS v3는 AI 보조 논문 작성, 실험 오케스트레이션, 아티팩트 추적 및 검증 가능한 출판을 통합하는 Python 기반 도구입니다. 모든 주장과 증거의 링크를 SQLite 'Scientific Memory'에 저장하고, 세 가지 실행 프로파일(writing-only, research, full)을 강제하며, 로컬, Docker, SSH, Slurm, Kubernetes 및 클라우드 컴퓨팅 백엔드를 지원합니다. CLI(`paperforge …`)와 로컬 웹 UI를 통해 사용자는 워크플로우 실행, 제안 승인, 내장 템플릿(generic, CVPR, IEEE, Elsevier)을 사용한 LaTeX 컴파일, 시크릿 스캔 후 결정론적 소스 번들 릴리스가 가능합니다. 재현 가능한 학술 연구를 위해 설계되었으며 비상업적 라이선스로 오픈 소스화되었습니다.
steipete/sag
ElevenLabs 또는 60db를 사용하여 고품질 AI 음성 합성을 제공하는 macOS 스타일의 'say' 경험을 지원하는 명령줄 TTS 도구입니다.
opendilab/LightRFT
LightRFT는 대규모 언어 및 멀티모달 생성 모델의 미세 조정을 위한 오픈 소스 분산 강화 학습 프레임워크입니다. DeepSpeed, FSDP와 같은 학습 백엔드와 SGLang, vLLM과 같은 롤아웃 엔진을 통합하고, GRPO, REINFORCE++, DAPO 등 다양한 RL 알고리즘을 지원하며, 텍스트, 이미지, 비디오, 오디오 모달리티를 모두 지원합니다. 이 라이브러리는 즉시 실행 가능한 예제(예: Qwen2.5를 사용한 GSM8K), 광범위한 문서, Docker 이미지를 제공하여 RL 기반 정렬 파이프라인을 구축하는 연구자 및 엔지니어를 위한 데일리 작업에 적합합니다.
SaynaAI/sayna
다양한 공급자에 걸쳐 실시간 음성 인식(STT) 및 텍스트 음성 합성(TTS) 서비스를 통합 API로 제공하는 고성능 Rust 기반 서버입니다.
optimatika/ojAlgo
ojAlgo는 고성능 선형 대수, 수치 최적화(LP/QP/MIP), 그리고 경량 데이터 과학 도구(신경망, 클러스터링)를 위한 순수 Java 라이브러리입니다. 외부 의존성 제로, MIT 라이선스, Java 기반 AI/ML 워크로드에 적합합니다.
kitlangton/Hex
Apple Silicon Mac용 온디바이스 음성 인식 유틸리티로, 음성을 실시간으로 텍스트로 변환하고 활성 애플리케이션에 바로 붙여넣습니다.
bootphon/phonemizer
다양한 백엔드를 사용하여 여러 언어의 텍스트를 음성적 표기로 변환하는 Python 라이브러리 및 명령줄 도구입니다.
nv-legate/cupynumeric
cuPyNumeric은 Legate 런타임에서 NumPy API를 구현하는 NVIDIA 라이브러리로, NumPy 코드를 GPU 및 분산 클러스터에서 실행할 수 있게 합니다. 드롭인 호환성을 제공하며 Linux Python 3.11-3.14를 지원하고 Conda 또는 PyPI를 통해 설치할 수 있습니다. 이 프로젝트는 현재 지원이 종료(최종 버전 v26.06.01)되었으나, Apache-2.0 라이선스 하에 과거 사용을 위해 계속 이용 가능합니다.
duckbugio/flock
Flock은 Docker 기반의 서비스로, Telegram, VK 또는 텍스트 전용 어댑터를 통해 채팅으로 제어 가능한 Claude-Code 기반 개발 팀을 제공합니다. 단일 메시지로 계획, 코드 작성, 테스트, 리뷰, 풀 리퀘스트 개설을 수행할 수 있으며, 자가 검증, 목표 평가, 스케줄된 작업, CI 감시를 위한 선택적 루프도 지원합니다. 각 채팅은 고유한 격리된 워크스페이스와 브랜치를 가지며, GitHub/GitLab/Gitea와 PAT를 통해 연동됩니다. `.env` 파일을 채운 후 `docker compose up -d`로 1줄로 배포 가능합니다. 핵심 로직은 `core/agents/`에 있으며, 어댑터는 얇은 래퍼입니다.
Gremble-io/Detto
Apple Silicon용 로컬 우선 macOS 앱으로, 회의, 음성 메모, 시스템 전체 음성 입력을 위한 개인 정보 보호 중심의 온디바이스 전사 기능을 제공하며, 구조화된 Markdown 파일을 출력합니다.
allgpt-co/QuickVoice
QuickVoice는 마케팅 사이트부터 전화 연결, RAG, 결제까지 음성 AI 스택의 모든 계층을 완전히 제어할 수 있는 오픈 소스 셀프 호스팅형 음성 에이전트 구축 플랫폼입니다.
aws-samples/amazon-bedrock-client-for-mac
macOS용 네이티브 Swift 앱으로, Amazon Bedrock에 직접 연결하여 텍스트, 이미지 및 기타 기초 모델과 대화할 수 있으며, 파일 첨부, 로컬 도구/스킬 실행, 자동화된 프롬프트 스케줄링이 가능하며, 모든 데이터는 Mac의 로컬에 저장됩니다.
Palm1r/QodeAssist
QodeAssist는 C++/QML을 위한 AI 기반 코드 완성, 채팅, 인라인 리팩터링 기능을 추가하는 GPL-v3 Qt Creator 플러그인입니다. 로컬(Ollama, llama.cpp, LM Studio) 및 클라우드 LLM 제공업체(Claude, OpenAI, Gemini, Mistral, Qwen, DeepSeek, 등)와 함께 작동하며, 프로젝트 인식 도구를 Model Context Protocol (MCP)를 통해 노출하여 다른 에디터에서 사용할 수 있게 합니다. 프로젝트는 아카이브되었으며 더 이상 유지 관리되지 않습니다.
jayminwest/mulch
Mulch는 CLI 기반의 Git 백업 지식 기반으로, AI 에이전트가 도메인별 JSONL 파일에 구조화된 학습(관례, 실패, 결정 등)을 기록하고, 나중에 프롬프트 인젝션을 위한 최적화된 요약을 검색할 수 있게 합니다. 사용자 정의 레코드 유형, 근거 기반 스코핑, 헬스 체크 및 정리 기능을 지원하여 팀이 에이전트 세션 간에 전문 지식을 축적하고 공유할 수 있도록 합니다.
izwi-ai/izwi
클라우드 API를 요구하지 않고, 음성 인식, 음성 합성, 채팅 워크플로우를 로컬에서 실행할 수 있는 로컬 우선 음성 AI 플랫폼. 데스크톱 앱, CLI, 서버를 제공.
6drf21e/ChatTTS_colab
ChatTTS를 위한 간편한 배포 래퍼로, 고급 텍스트 음성 변환(TTS) 생성을 위해 WebUI와 원클릭 Colab 설정을 제공합니다.
KlaatAI/klaatcode
Klaat Code는 호스팅된 Klaatu-o1 라우터와 통신하는 터미널 기반 AI 코딩 어시스턴트입니다. 라우터는 각 요청에 대해 가장 저렴한 모델 계층을 자동으로 선택하고 필요할 때만 에스컬레이션을 수행하여 비용을 대폭 절감합니다. 클라이언트는 프로젝트를 의미론적 호출 그래프로 인덱싱하고, 도구 호출(파일 편집, 셸 명령, 웹 검색)을 무료로 실행하며, 스마트 압축 및 검증을 통해 컨텍스트를 관리합니다. 기능으로는 풍부한 UI, 슬래시 명령, Git 통합, 하위 에이전트 위임, 광범위한 안전/권한 검사, 그리고 작업당 $0.027, 중앙값 23초의 성능을 보여주는 재현 가능한 벤치마크가 포함됩니다.
crabwise-ai/crabwalk
Crabwalk은 WhatsApp, Telegram, Discord 및 Slack에서 OpenClaw AI 에이전트의 활동을 시각화하는 실시간 웹 UI입니다. OpenClaw 게이트웨이에서 WebSocket을 통해 이벤트를 스트리밍하고, 실시간 세션 노드 그래프를 표시하며, 도구 호출을 검사할 수 있고 Docker, CLI 또는 소스 설치 배포를 지원합니다.
shibing624/agentica
Agentica는 오픈소스이며 Apache-2.0 라이선스 하에 제공되는 프레임워크로, 여러 LLM 기반 에이전트를 로컬에서 실행할 수 있습니다. 동일한 기록과 설정을 공유하는 통합 CLI, 웹 UI, 데스크톱 앱을 제공합니다. 비동기 우선 도구 실행, 다중 모델 및 다중 모달 지원, 지속적 메모리와 컨텍스트 압축, 마크다운 기반의 자가 진화 스킬 시스템, 안전성 가드레일, 내장된 협업 기능(피어 메시징, 작업/서브에이전트, 위임 프로세스)을 갖추고 있습니다. Python 및 TypeScript SDK를 통해 코드 내에 에이전트를 통합할 수 있으며, Docker/uv-tool 설치 도구로 설정이 간편합니다.
jitsi/jiwer
Word Error Rate (WER) 및 Character Error Rate (CER)와 같은 지표를 사용하여 자동 음성 인식 시스템을 평가하는 빠른 Python 패키지입니다.
shiwenwen/hope-agent
Hope Agent는 오픈소스, Rust 기반 데스크톱 AI 어시스턴트로, 네이티브 앱, 웹 UI를 갖춘 헤드리스 서버, 또는 IDE 통합 백엔드로 실행할 수 있습니다. 목표 기반 작업 자동화, 영구 메모리, 디자인 공간 생성, 그리고 강력한 보안(로컬 우선 데이터, 도구 승인, Docker 샌드박스)을 갖춘 완전한 컴퓨터 제어(파일, 셸, 브라우저)를 제공합니다. 패키지 관리자 또는 Docker를 통해 macOS, Windows, Linux에 설치할 수 있으며, 수십 개의 LLM 공급자 템플릿, 다중 플랫폼 IM 통합, 플러그인 스킬 시스템을 포함합니다.
resemble-ai/Perth
신경망 기반 접근 방식을 활용하여 변조에 강건한 인지할 수 없는 워터마크를 오디오 파일에 삽입하고 탐지하는 Python 라이브러리입니다.
qqqqqf-q/Arkloop
Arkloop는 오픈소스이며 로컬 우선의 AI 에이전트 플랫폼입니다. Go 백엔드, SQLite 저장소, Electron 기반 데스크톱 앱(React 웹 UI 포함)을 통합하여 다중 모델 라우팅, 도구 호출, 지속적 또는 의미적 메모리, Telegram, Discord, QQ, Feishu, WeChat와의 통합을 지원합니다. GitHub 릴리스, Homebrew, AUR를 통해 설치 가능하며, 모든 작업은 사용자의 기계에서 완전히 수행되어 클라우드 인프라스트럭처가 필요하지 않습니다.
jasonppy/VoiceCraft
몇 초의 참조 음성만으로 고품질의 제로샷 텍스트-to-음성 및 음성 편집을 가능하게 하는 토큰 보완 신경 코덱 언어 모델입니다.