facebookresearch/mmf
MMF는 시각 및 언어 멀티모달 연구를 위한 모듈형 PyTorch 기반 프레임워크로, 최첨단 모델의 참조 구현과 분산 학습을 위한 도구를 제공합니다.
om-ai-lab/VLM-FO1
VLM-FO1은 일반적인 추론 능력을 저하시키지 않으면서 세밀한 인지 및 공간 인식을 강화하는 Vision-Language Model용 플러그 앤 플레이 모듈입니다.
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling은 커뮤니티가 큐레이팅한 "아워소 리스트"로, 다중 모달 AI 모델을 조사합니다. Traditional, MLLMs, Unified, Native의 네 가지 명확한 패밀리를 정의하고, 아키텍처적 차이를 설명하며, Hugging Face의 오픈소스 모델 컬렉션에 링크합니다. 급속도로 변화하는 다중 모달 환경을 구조적으로 이해해야 하는 연구자와 엔지니어를 위한 리포지토리입니다.
OpenBMB/UltraEval-Audio
34개의 벤치마크에 걸쳐 음성 이해와 생성을 모두 지원하는 대규모 오디오 파운데이션 모델 평가를 위한 통합 오픈소스 프레임워크.
Sharrnah/whispering-ui
오디오 스트림 및 게임 내 이미지의 실시간 전사 및 번역을 가능하게 하는 Whispering Tiger 애플리케이션용 네이티브 Windows UI입니다.
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammar은 Kaldi 음성 인식 엔진을 위한 Python 래퍼로, 여러 작은 문법을 컴파일하고 각 발화마다 필요한 것만 활성화할 수 있습니다. 주요 OS용 바이너리 웨일을 포함하고, 사전 학습된 영어 모델을 제공하며, Dragonfly 및 Caster 음성 제어 프레임워크의 백엔드를 지원합니다. pip로 설치하고, 모델을 다운로드하며, 규칙을 정의한 후 문맥에 맞는 명령 제어를 동적으로 활성화할 수 있습니다.
cubist38/mlx-openai-server
Apple Silicon에서 로컬 MLX 모델을 실행하기 위한 OpenAI 호환 API 서버로, 텍스트, 멀티모달, 이미지 및 오디오 모델을 지원합니다.
filippogiruzzi/voice_activity_detection
1D-ResNet과 MFCC 특징을 사용하여 오디오 신호를 음성 또는 노이즈로 분류하는 딥러닝 기반 음성 활동 감지(VAD) 시스템입니다.
dictation-toolbox/dragonfly
사용자가 사용자 정의 음성 명령을 만들어 컴퓨터 작업을 자동화하거나 음성으로 프로그래밍할 수 있도록 도와주는 Python 음성 인식 프레임워크입니다.
algolia/voice-overlay-ios
Apple의 네이티브 `SFSpeechRecognizer`를 사용하여 권한 및 음성 인식을 처리하는 세련된 음성-텍스트 변환 오버레이 UI를 제공하는 iOS 라이브러리입니다.
judahpaul16/gpt-home
Raspberry Pi에서 작동하는 자체 호스팅 AI 홈 어시스턴트로, LiteLLM와 LangGraph를 사용해 LLM을 홈 오토메이션 및 개인 생산성 도구와 통합합니다.
sveinbjornt/hear
macOS용 명령줄 인터페이스로, 시스템 내장 음성 인식 기능을 사용하여 라이브 마이크 입력과 오디오 파일의 음성 인식을 가능하게 합니다.
Picovoice/rhino
Rhino는 Picovoice의 온디바이스 Speech-to-Intent 엔진으로, 말하는 명령어를 실시간으로 구조화된 intent와 slot으로 변합니다합니다. 마이크로컨트롤러부터 휴대폰, 브라우저, 데스크톱까지 모든 기기에서 로컬로 실행되며, 다양한 언어를 지원하며 Python, .NET, Java, Flutter, React Native, Android, iOS, Web, Node.js, C용 SDK를 제공합니다.
openspeech-team/openspeech
20개 이상의 ASR 모델과 여러 언어용 레시피를 제공하는 엔드투엔드 자동 음성 인식 시스템을 구축하기 위한 프레임워크입니다.
yeyupiaoling/MASR
다양한 모델 아키텍처와 언어에서 스트리밍 및 비스트리밍 추론을 지원하는 PyTorch 기반 자동 음성 인식 프레임워크입니다.
mybigday/whisper.rn
디바이스 내 Whisper(및 NVIDIA Parakeet) 음성-텍스트 변환을 위한 React Native 바인딩. GPU/Core ML 가속, 음성 활동 감지(VAD), 실시간 스트리밍 지원.
TheStageAI/TheWhisper
NVIDIA GPU와 Apple Silicon에서 저지연 스트리밍 및 디바이스 내 추론에 최적화된, 파인튜닝된 Whisper 모델 기반의 고성능 음성-텍스트 솔루션입니다.
TensorSpeech/TensorFlowASR
TensorFlow 기반의 자동 음성 인식 (ASR) 프레임워크로, 다양한 ASR 아키텍처를 구현하고 효율적인 배포를 위해 TFLite 변환을 지원합니다.
ardha27/AI-Waifu-Vtuber
음성 인식, LLM 및 TTS를 통합하여 라이브 스트리밍 및 개인용 대화형 가상 캐릭터를 생성하는 AI 기반 VTuber 어시스턴트입니다.
sooftware/conformer
CNN과 Transformer를 결합하여 국소적 및 전역적 오디오 의존성을 모두 포착함으로써 음성 인식을 향상시키는 Conformer 아키텍처의 PyTorch 구현체입니다.
modal-labs/quillman
Moshi 음성 대 음성 모델을 기반으로 하여, 인간과 같은 상호작용을 위해 저지연, 양방향 오디오 스트리밍을 제공하는 음성 채팅 애플리케이션입니다.
tensorflow/lingvo
특히 시퀀스 대 시퀀스 모델과 거대 언어 모델에 특화된 모듈식 TensorFlow 프레임워크.
HeyWillow/willow
Willow는 음성-텍스트 변환(STT), 텍스트-음성 변환(TTS) 및 LLM 처리를 포함한 빠른 언어 작업을 위한 셀프 호스팅 가능 추론 서버입니다.
flashlight/wav2letter
wav2letter++는 최첨단 음성-텍스트 변환 아키텍처를 구현하기 위한 레시피와 사전 학습된 모델을 제공하는 엔드 투 엔드 자동 음성 인식 프레임워크입니다.
Uberi/speech_recognition
OpenAI Whisper, Google Speech, Vosk와 같은 다양한 온라인 및 오프라인 엔진을 지원하는 음성 인식용 통합 인터페이스를 제공하는 Python 라이브러리입니다.
elevenlabs/elevenlabs-js
ElevenLabs의 공식 Node.js SDK로, 현실적인 AI 음성 합성, 실시간 오디오 스트리밍, 음성 기반 AI 에이전트를 애플리케이션에 통합할 수 있습니다.
wildminder/ComfyUI-VoxCPM
표현력 있는 음성 생성, 자연어 음성 설계 및 고급 보이스 클로닝을 가능하게 하는 토크나이저 프리 TTS 시스템인 VoxCPM을 위한 ComfyUI 커스텀 노드 통합.
codeforequity-at/botium-speech-processing
오픈 소스 및 클라우드 기반 음성-텍스트 변환(STT) 및 텍스트-음성 변환(TTS) 서비스를 위한 통합 API로, 챗봇 및 음성 애플리케이션의 오디오 처리를 간소화합니다.
tongjingqi/Thinking-with-Video
비디오 생성 모델이 복잡한 시각적 및 텍스트 추론 과제를 해결하는 능력을 평가하는 새로운 멀티모달 추론 패러다임 및 벤치마크(VideoThinkBench).
AceDataCloud/Nexior
Nexior는 MIT 라이선스를 따르는 Vue 기반 앱으로, 40개 이상의 채팅, 이미지, 오디오, 비디오 AI 모델을 단일 자체 호스팅 가능한 UI로 통합합니다. 1클릭 Vercel 또는 Docker 배포, BYOK 또는 단일 AceData 키, 내장된 사용자 계정, 결제 및 추천 메커니즘을 제공하여 AI 제품용 즉시 사용 가능한 SaaS 스타터로 활용 가능합니다.
EvolvingLMMs-Lab/lmms-engine
분산 학습, 카ーネル 융합, 고급 최적화를 통합하여 확장 가능한 사전 학습과 미세조정을 가능하게 하는 통합적이고 고성능의 멀티모달 모델 학습 엔진입니다.
awekrx/ChatGPT-MidJourney-prompt
간단한 텍스트 힌트를 기반으로 MidJourney 이미지를 위한 상세하고 창의적인 프롬프트를 자동으로 생성하는 Python 라이브러리입니다.
HorizonWind2004/reconstruction-alignment
통합 다중모달 모델을 위한 자기지도 후속 훈련 방법으로, 모델이 자신의 시각적 특징에서 이미지를 재구성하도록 훈련함으로써 이미지 생성 및 이미지 편집을 향상시킵니다.
shiimizu/ComfyUI_smZNodes
AUTOMATIC1111의 프롬프트 파싱 및 임베딩을 재현하는 사용자 정의 ComfyUI 노드(클립 텍스트 인코딩++ 및 설정)로, stable-diffusion-webui와 ComfyUI 간에 동일한 이미지 생성이 가능합니다.
biagiomaf/smart-comfyui-gallery
ComfyUI 및 AI 생산 라이브러리용으로 설계된 오픈소스 디지털 자산 관리자 및 갤러리로, 생성물의 정리, 검색, 리믹스를 지원합니다.
Windsander/ADI-Stable-Diffusion
ONNXRuntime을 사용하여 여러 플랫폼에서 Python 없이 고성능으로 Stable Diffusion 모델을 추론할 수 있는 C++ 라이브러리 및 CLI 도구.
Licoy/GoAmzAI
개인과 기업을 위한 텍스트, 이미지, 비디오, 음악, PPT 생성을 통합 관리 시스템으로 통합한 프라이빗 멀티모달 AIGC 플랫폼입니다.
mrhan1993/Fooocus-API
Fooocus를 위한 FastAPI 기반 REST API로, 수동 매개변수 조정 없이 프로그래밍 방식으로 고품질 이미지를 생성할 수 있습니다.
Acly/comfyui-tooling-nodes
ComfyUI를 외부 도구의 백엔드로 사용할 수 있게 해주는 ComfyUI 커스텀 노드 및 API 확장 세트입니다. 최적화된 이미지 전송, 지역 프롬프팅 및 모델 검사 기능을 특징으로 합니다.
melMass/comfy_mtb
ComfyUI를 위한 커스텀 노드 모음으로, 추가 유틸리티 도구를 통해 이미지 생성 워크플로우를 확장합니다.
a616567126/GPT-WEB-JAVA
사용자 관리 및 결제 시스템을 내장한 상용 AI 서비스로, GPT, Midjourney, Stable Diffusion를 통합한 자바 기반 웹 플랫폼입니다.
vual/ChatGPT-Next-Web-Pro
ChatGPT‑Next‑Web‑Pro는 OpenAI 스타일의 LLM을 위한 오픈 소스 셀프 호스팅 웹 UI로, 멀티모달(이미지, 오디오, 비디오) 생성, 파일 파싱, S3 스토리지 및 사용자 계정, 구독 플랜, 관리 패널이 포함된 옵션 백엔드를 추가했습니다. 단일 Docker run(백엔드 없음) 또는 Docker-Compose 스택(백엔드 있음)으로 배포할 수 있습니다.
basetenlabs/truss
AI/ML 모델을 본격적인 운영 환경으로 패키징하고 배포하기 위한 CLI 도구로, 컨테이너화, GPU 구성, 종속성 관리를 자동화합니다.
xxxily/hello-ai
AI 기반의 탐색 허브로, 자율 에이전트를 사용해 GitHub에서 고품질 오픈소스 AI 프로젝트를 탐색하고 평가하여 자동 업데이트되는 디렉터리로 정리합니다.
lobehub/sd-webui-lobe-theme
AI 이미지 생성의 워크플로우와 시각적 경험을 향상시키는, Stable Diffusion WebUI용 현대적이고 고도로 사용자 정의 가능한 인터페이스 프레임워크입니다.
mikekeith52/scalecast
ML 및 딥러닝 모델에 대한 통일된 인터페이스를 제공하여 모델 선택, 검증 및 파이프라인 생성을 단순화하는 시계열 예측 라이브러리입니다.
EternalEvan/Astra
Astra는 자기회귀 확산 트랜스포머를 사용하여 현실적인 동작 조건부 장기 비디오 예측을 생성하는 대화형 월드 모델입니다.
Ma-Zhuang/OmniNWM
OmniNWM은 자율주행 시뮬레이션을 위한 파노라마형 다중 모달 월드 모델을 구축하는 연구용 코드베이스입니다. 차량의 경로에서 RGB, 세분화, 깊이, 3D 점유 맵을 동시에 생성하고, 정규화된 Plücker 레이 맵을 사용해 정밀한 제어를 수행하며, 점유 기반 밀도 보상을 통해 폐루프 정책 평가를 가능하게 합니다. 리포지토리에는 transformers 패치 포함 설치 절차, nuScenes 데이터 준비 안내, 사전 학습 체크포인트 다운로드 링크, 추론, 분포 외 테스트, 단계별 학습용 스크립트가 포함되어 있습니다.