understandable-machine-intelligence-lab/Quantus

Quantus는 PyTorch/TensorFlow를 지원하는 오픈소스 파이썬 라이브러리로, 신뢰성, 강건성, 국소화, 복잡성, 무작위화, 공리적의 6개 범주에 걸쳐 35개 이상의 정량적 지표를 제공합니다. 이미지, 시계열, 표 형식 데이터에 대한 재현 가능하고 배치 효율적인 XAI 기법 평가를 가능하게 하며, 튜토리얼, 문서, 커뮤니티 지원을 제공합니다.

ScottZt/jin-ce-zhi-suan

Python 기반의 정량 거래 플랫폼으로, 당나라 관료제를 영감으로 한 "삼성육부" 구조를 채택. 백테스트, 다중 전략 관리, 리스크 우선 실행, AI 기반 자연어 주식 스크리닝 기능 제공. FastAPI + HTML 대시보드로 작동하며, 다양한 데이터 소스를 지원. 개인/학술 사용은 무료(상업적 사용은 라이선스 필요).

yaojingang/yao-open-skills

Yao Open Skills는 의사결정 분석, 보안 감사, 튜토리얼 생성, 독서 보고서 시각화 등의 작업을 위한 재사용 가능한 AI '스킬'(구조화된 프롬프트+코드 워크플로우)의 오픈소스 카탈로그입니다. 각 스킬은 자체 폴더에 스크립트, 문서, 다중 형식 내보내기(Markdown, HTML, PDF 등)를 포함합니다. 리포지토리는 레지스트리, 공개 규칙, 보조 스크립트를 제공하여 컬렉션을 깨끗하고 버전 관리되며 공개적으로 탐색 가능한 상태로 유지합니다.

AddictedCS/soundfingerprinting

음향 및 비디오 해시를 통해 미디어 콘텐츠를 빠르게 식별할 수 있는 C# 프레임워크입니다.

OlympiaAI/raix

Raix는 어떤 Ruby 클래스에도 LLM 채팅, 도구(함수) 디스패치, 프롬프트 체인 기능을 추가하는 Ruby 라이브러리입니다. RubyLLM/OpenRouter를 통해 여러 제공자를 래핑하고, 대화 기록을 관리하며, 글로벌/클래스/인스턴스 수준의 훅을 제공하고, JSON 모드, 캐시, 프롬프트 캐시를 지원하며, 함수와 다단계 프롬프트를 선언하는 DSL을 제공합니다.

flyteorg/flytekit

Flytekit Python은 `@task` 및 `@workflow` 데코레이터를 사용하여 순수한 Python으로 AI/ML 워크플로우를 작성, 테스트, 배포할 수 있는 Flyte의 공식 SDK입니다. `pip install flytekit`로 설치하고, 빠른 시작 가이드를 따르며, 플러그인을 통해 확장하거나 제공된 문서를 통해 기여할 수 있습니다.

amsehili/auditok

에너지 임계값 또는 WebRTC VAD를 사용하여 오디오 스트림을 이벤트로 분할하는 경량 Python 라이브러리입니다.

vb000/LookOnceToHear

소음이 많은 환경에서 몇 초 동안 특정 화자를 바라보기만 하면 그 화자의 음성을 분리하여 들을 수 있는 지능형 헤어블 시스템.

composio-community/open-chatgpt-atlas

Open ChatGPT Atlas는 Gemini 2.5 Computer‑Use를 사용해 브라우저를 제어하고 Composio를 통해 500개 이상의 제3자 서비스를 호출할 수 있는 오픈소스 Chrome/Edge 확장 프로그램(옵션으로 Electron 앱)입니다. Node를 사용해 `dist` 폴더를 빌드하고 Google 및 선택적 Composio API 키를 추가한 후, 사이드바 채팅을 통해 '이 버튼을 클릭해' 또는 'GitHub 이슈 생성해'와 같은 자연어 명령어를 사용할 수 있습니다. 시각적 피드백, 안전성 확인 기능을 제공하며, 완전히 클라이언트 사이드에서 실행됩니다.

InternLM/InternBootcamp

InternAgentHarness (InternBootcamp)는 다중 라운드, 도구 보강형 LLM 에이전트의 생성, 실행, 평가를 위한 오픈소스 프레임워크입니다. 연구자는 합성 작업을 정의하고, 검증된 외부 도구를 노출하며, 다중 라운드 상호작용을 관리하고, 보상을 계산하며, 전체 트레이스를 로깅하여 데이터 생성 또는 RL 훈련에 활용할 수 있습니다.

pmarreck/yt-transcriber

Whisper를 사용하여 YouTube 동영상이나 로컬 미디어 파일을 음성 인식하는 CLI 도구. 선택적으로 AI 기반 요약 및 번역 기능 제공.

audeering/opensmile-python

기계학습 연구를 위한 표준화된 음성 특징 추출을 가능하게 하는 openSMILE용 파이썬 인터페이스입니다.

runesleo/claude-code-workflow

QuietHarness는 AI 코딩 에이전트(Claude Code, Codex, Cursor)용 작고 오픈소스의 안전 계층입니다. 공유 설정 템플릿, 드라이런 설치 스크립트, 자동 백업, 위험 게이트 작업을 통해 에이전트가 파일을 덮어쓰거나 테스트를 건너뛰거나 되돌릴 수 없는 작업을 수행하기 전에 확인을 받을 수 있도록 합니다. 프로젝트별 또는 전역 설치가 가능하며, 완전히 오프라인에서 작동하며 MIT 라이선스로 제공됩니다.

CaptainYifei/fake-news-detector

Streamlit 기반 웹 앱으로 LLM(예: Qwen2.5)과 BGE‑M3 임베딩을 사용해 뉴스에서 주장 추출, DuckDuckGo/SearXNG를 통해 웹 증거 검색, 3단계 파이프라인으로 주장 검증. 중국어, 영어, 일본어, 한국어 지원, 여러 모델 제공자, 사용자 계정, 기록, PDF 보고서 기능 포함.

Jittor/jittor

Jittor는 전체 계산 그래프를 JIT 컴파일하고 메타 연산자를 사용해 특정 모델에 최적화된 CUDA/C++ 커널을 생성하는 고성능 딥러닝 프레임워크입니다. PyTorch와 유사한 Python API를 제공하며, CPU 및 GPU 백엔드(CUDA, ROCm, Hygon)를 지원하고, 비전, 렌더링, 기하학적 학습, 강화학습을 위한 모델 라이브러리도 포함하고 있습니다.

yxlllc/DDSP-SVC

전통적인 SVC 모델보다 훨씬 낮은 하드웨어 요구 사항과 빠른 학습 시간을 제공하는 고품질 AI 음성 변경을 가능하게 하는 효율적인 가창 음성 변환 프로젝트.

strob/gentle

음성 오디오를 텍스트 전사와 정렬하여 정확한 단어 단위 타이밍을 제공하는 Kaldi 기반의 견고한 강제 정렬기.

appleboy/CodeGPT

CodeGPT는 Go 기반 CLI로, LLM API(OpenAI, Azure, Gemini, Anthropic, Ollama, Groq, OpenRouter)를 사용하여 Conventional-Commit 메시지와 간단한 코드 리뷰 요약을 자동 생성합니다. Git `prepare-commit-msg` 훅 설치, 사용자 정의 프롬프트, 언어 번역, 스트리밍 출력, 유연한 구성(API 키, 프로바이더, 프록시, 차이점 컨텍스트 등)을 지원합니다. Homebrew, Chocolatey, 스크립트, 바이너리 또는 `go install`로 설치 가능합니다.

VOICEVOX/voicevox_core

다양한 애플리케이션에 쉽게 통합할 수 있도록 제공되는 VOICEVOX의 핵심 음성 합성 엔진을 C 및 Python 라이브러리 형태로 제공.

DataBassGit/AgentForge

AgentForge는 AI 기반 자율 에이전트를 빠르게 구축하고 테스트하며 반복 개발할 수 있도록 해주는 저코드 Python 프레임워크입니다. Cogs(선언적 YAML 파일)를 사용해 에이전트를 구성하고, 선택적 메모리를 연결하며, 다중 에이전트 워크플로우를 오케스트레이션할 수 있으며, OpenAI, Gemini, Claude 및 Ollama/LMStudio를 통한 로컬 모델을 지원합니다.

fishaudio/fish-diffusion

다중 스피커 학습과 효율적인 하드웨어 활용을 지원하는 Text-to-Speech, Singing Voice Synthesis, Singing Voice Conversion을 위한 Diffusion 기반 훈련 프레임워크입니다.

wavlab-speech/versa

음성 및 오디오의 품질, 명료도, 기술적 속성을 평가하기 위한 90개 이상의 메트릭에 대한 통합 인터페이스를 제공하는 포괄적인 툴킷.

BakeLens/crust

Crust는 AI 코딩 어시스턴트와 LLM 제공자 사이에 위치하는 오픈소스이며 로컬에서 실행되는 프록시입니다. 모든 도구 호출(파일 읽기, 쉘 명령어, 네트워크 요청 등)을 감시하고, 비밀 정보 유출이나 호스트 손상 가능성이 있는 작업을 차단합니다. 게이트웨이는 HTTP 프록시, MCP/ACP stdio 래퍼 또는 Docker 컨테이너로 작동하며, 42개의 내장 보안 규칙, 51개의 DLP 패턴, 사용자 정의 정책용 플러그인 시스템을 포함합니다. 사용자 기기에서 완전히 실행되며, 로그는 OS 키링에 암호화 저장되며, Swift 패키지를 통해 iOS 통합도 가능합니다.

Stability-AI/stable-codec

텍스트에서 음성으로 변환(TTS)과 같은 하류 작업에 최적화된 고품질 저비트레이트 음성 인코딩 방식. 음성을 이산 토큰으로 압축.

Deep-unlearning/smol-audio

Hugging Face 생태계를 활용하여 ASR 및 음성 캡셔닝을 포함한 음성 AI 모델의 파인튜닝과 최적화에 도움이 되는 실용적인 노트북 모음입니다.

Kocoro-lab/Kocoro

Kocoro는 macOS용 오픈소스 AI 에이전트 데몬(`shan`)으로, 언어모델 에이전트가 파일 읽기/쓰기, 앱 제어, 쉘 명령 실행, 브라우저 자동화, Slack/Telegram 통합을 가능하게 합니다. CLI/TUI, HTTP API, MCP 스트리밍, 실시간 음성 프론트브레인을 제공합니다. npm, 스크립트, 또는 Go 빌드로 설치 가능하며, LLM 완성은 Shannon Cloud 또는 자체 호스팅 게이트웨이로 구성합니다. 데몬은 권한, 에이전트별 메모리, 스케줄링, 확장 가능한 도구를 처리하고, 별도의 폐쇄형 GUI(Kocoro Desktop)가 세련된 인터페이스를 제공합니다. MIT 라이선스.

milady-ai/milady

Milady는 로컬(또는 자체 호스팅 또는 클라우드 백엔드를 통해)에서 실행되는 개인정보 우선의 개인용 AI 보조자입니다. 3D 아바타를 갖춘 데스크톱 앱, 다중 플랫폼 채팅 연결, 점진적 액션 스트리밍, 내장된 BNB 스마트체인 거래 기능을 제공합니다. macOS/Windows/Linux용 서명된 설치 프로그램으로 설치하거나 CLI(`milody setup`)를 사용할 수 있습니다. 시스템은 에너지 인식형이며, 플러그인 확장 가능하며, API 토큰을 통해 안전하게 원격 백엔드로 노출할 수 있습니다.

absadiki/pywhispercpp

다양한 하드웨어 가속 백엔드를 지원하는 고성능 음성-텍스트 변환을 위한 파이썬 바인딩입니다.

microsoft/cognitive-services-speech-sdk-js

Microsoft Cognitive Services의 음성 기능을 통합하여 브라우저와 Node.js에서 음성 인식 및 음성 합성 기능을 구현하는 JavaScript SDK입니다.

ASLP-lab/MeanVC

MeanVC는 mean flows와 diffusion transformer를 사용하여 실시간 단일 단계 음색 전달을 가능하게 하는 가벼운 제로샷 음성 변환 시스템입니다.

Prorise-cool/Claude-Code-Multi-Agent

Claude Code Multi‑Agent는 Anthropic의 Claude Code 프로젝트에 인식 능력과 전문가 에이전트 기능을 제공하는 오픈소스 프레임워크입니다. Python Hook 시스템과 로컬에서 실행되는 Ollama 모델을 사용해 코드베이스 유형을 자동 감지하고, 사용자 의도를 분석하며, 300개 이상의 도메인 전용 "스킬"(백엔드, 프론트엔드, 테스트, 보안 등)을 로드하고, 자동 문서화(DEVELOPMENT.md, KNOWLEDGE.md, CHANGELOG.md)를 강제합니다. 리포지토리를 클론하고 Ollama, 모델, uv를 설치한 후 프로젝트를 리포지토리에 넣기만 하면, Claude Code는 즉시 컨텍스트를 이해하고 적절한 도구를 제안하며, `/backend‑specialist` 또는 `/kiro/spec`와 같은 슬래시 명령어로 조작할 수 있습니다. 주요 특징: - 제로 설정 시작; 모든 설정은 `.claude/settings.json`과 `prompts.json`에 저장. - 세션 시작, 사용자 프롬프트, 도구 사용 등에 따라 실행되는 Hooks로 프로젝트 감지, 의도 분석, 문서 업데이트 처리. - Skills는 `SKILL.md` 파일로 정의되며 자동 탐지됨. - 외부 API를 전혀 사용하지 않고 완전히 로컬에서 동작. Git과 통합 가능. MIT 라이선스. 개인 개발자나 소규모 팀이 재현 가능하고 온프레미스 AI 코딩 보조 도구를 원할 때 이상적입니다.

vercel/next-evals-oss

Next.js Evals 는 실제 월드 Next.js 작업에서 AI 코드 에이전트를 자동으로 테스트하는 Vercel 유지보수 프레임워크입니다. `vercel/next.js` 리포지토리에서 평가용 테스트 사례를 동기화하고, Vercel 사ند박스에서 에이전트를 실행하며, 숨겨진 어설션을 확인하고, 성공/실패, 토큰 사용량, 비용을 기록한 후 JSON 리더보드를 내보내어 공개된 Next.js 평가 사이트를 구동합니다.

PierrunoYT/Kokoro-TTS-Local

54개의 다국어 음성과 완전한 오프라인 지원을 갖춘 Kokoro-82M 텍스트-to-음성 모델의 로컬 구현. 웹 인터페이스 포함.

MisoLabsAI/MisoTTS

대화형 영어 음성 생성 및 보이스 클로닝을 위한 고품질 텍스트-대화 RVQ Transformer 모델.

OpenBMB/UltraEval-Audio

34개의 벤치마크에 걸쳐 음성 이해와 생성을 모두 지원하는 대규모 오디오 파운데이션 모델 평가를 위한 통합 오픈소스 프레임워크.

daanzu/kaldi-active-grammar

Kaldi‑Active‑Grammar은 Kaldi 음성 인식 엔진을 위한 Python 래퍼로, 여러 작은 문법을 컴파일하고 각 발화마다 필요한 것만 활성화할 수 있습니다. 주요 OS용 바이너리 웨일을 포함하고, 사전 학습된 영어 모델을 제공하며, Dragonfly 및 Caster 음성 제어 프레임워크의 백엔드를 지원합니다. pip로 설치하고, 모델을 다운로드하며, 규칙을 정의한 후 문맥에 맞는 명령 제어를 동적으로 활성화할 수 있습니다.

filippogiruzzi/voice_activity_detection

1D-ResNet과 MFCC 특징을 사용하여 오디오 신호를 음성 또는 노이즈로 분류하는 딥러닝 기반 음성 활동 감지(VAD) 시스템입니다.

dictation-toolbox/dragonfly

사용자가 사용자 정의 음성 명령을 만들어 컴퓨터 작업을 자동화하거나 음성으로 프로그래밍할 수 있도록 도와주는 Python 음성 인식 프레임워크입니다.

algolia/voice-overlay-ios

Apple의 네이티브 `SFSpeechRecognizer`를 사용하여 권한 및 음성 인식을 처리하는 세련된 음성-텍스트 변환 오버레이 UI를 제공하는 iOS 라이브러리입니다.

sveinbjornt/hear

macOS용 명령줄 인터페이스로, 시스템 내장 음성 인식 기능을 사용하여 라이브 마이크 입력과 오디오 파일의 음성 인식을 가능하게 합니다.

Picovoice/rhino

Rhino는 Picovoice의 온디바이스 Speech-to-Intent 엔진으로, 말하는 명령어를 실시간으로 구조화된 intent와 slot으로 변합니다합니다. 마이크로컨트롤러부터 휴대폰, 브라우저, 데스크톱까지 모든 기기에서 로컬로 실행되며, 다양한 언어를 지원하며 Python, .NET, Java, Flutter, React Native, Android, iOS, Web, Node.js, C용 SDK를 제공합니다.

openspeech-team/openspeech

20개 이상의 ASR 모델과 여러 언어용 레시피를 제공하는 엔드투엔드 자동 음성 인식 시스템을 구축하기 위한 프레임워크입니다.

yeyupiaoling/MASR

다양한 모델 아키텍처와 언어에서 스트리밍 및 비스트리밍 추론을 지원하는 PyTorch 기반 자동 음성 인식 프레임워크입니다.

mybigday/whisper.rn

디바이스 내 Whisper(및 NVIDIA Parakeet) 음성-텍스트 변환을 위한 React Native 바인딩. GPU/Core ML 가속, 음성 활동 감지(VAD), 실시간 스트리밍 지원.

TheStageAI/TheWhisper

NVIDIA GPU와 Apple Silicon에서 저지연 스트리밍 및 디바이스 내 추론에 최적화된, 파인튜닝된 Whisper 모델 기반의 고성능 음성-텍스트 솔루션입니다.

TensorSpeech/TensorFlowASR

TensorFlow 기반의 자동 음성 인식 (ASR) 프레임워크로, 다양한 ASR 아키텍처를 구현하고 효율적인 배포를 위해 TFLite 변환을 지원합니다.

sooftware/conformer

CNN과 Transformer를 결합하여 국소적 및 전역적 오디오 의존성을 모두 포착함으로써 음성 인식을 향상시키는 Conformer 아키텍처의 PyTorch 구현체입니다.

modal-labs/quillman

Moshi 음성 대 음성 모델을 기반으로 하여, 인간과 같은 상호작용을 위해 저지연, 양방향 오디오 스트리밍을 제공하는 음성 채팅 애플리케이션입니다.