Core-Mate/OpenGUI

실기기에서 작동하는 안드로이드용 모바일 GUI 에이전트 프레임워크로, AI 에이전트가 앱 인터페이스를 인식하고 조작하여 장시간 지속되는 자동화 워크플로우를 가능하게 합니다.

istupakov/onnx-asr

ONNX 모델을 사용하여 자동 음성 인식(ASR)을 수행하는 경량 Python 패키지로, 에지 및 서버 하드웨어에 빠른 배포를 위해 PyTorch나 Transformers가 필요하지 않습니다.

cyberofficial/Synthalingua

라이브 스트림, 마이크 오디오, 비디오 파일을 영어 및 기타 언어로 실시간 전사 및 번역하는 셀프 호스팅 AI 도구입니다.

AudarAI/Audar-ASR-V1

아랍어를 우선으로 하는 생성형 음성 인식 모델 패밀리로, 방언 아랍어와 코드 스위칭 음성에 대해 최첨단 변환 성능을 제공합니다.

janvarev/Irene-Voice-Assistant

기본적으로 오프라인으로 작동하며 확장 가능한 플러그인과 LLM 기반 자연어 명령 처리를 지원하는 러시아어 음성 비서.

cmusphinx/pocketsphinx

PocketSphinx는 저자원 장치에서 효율적으로 작동하는 오픈소스이며, 오프라인으로 동작하는 음성-텍스트 변환 엔진(C 라이브러리와 Python 바인딩 포함)입니다. 오디오 인식 또는 정렬을 수행하고 결과를 JSON 형식으로 출력하는 명령줄 도구와 API를 제공합니다.

ManimCommunity/manim-voiceover

OpenAI Whisper를 사용하여 단어별 애니메이션 동기화를 가능하게 하고, AI 음성 및 녹음 도구를 Python에 직접 통합하는 Manim 플러그인입니다.

Migushthe2nd/MsEdgeTTS

Microsoft Edge Read Aloud API를 사용하여 서버 측 런타임에 텍스트 음성 변환 합성을 제공하는 간단한 Azure Speech Service 모듈입니다.

PowerBeef/Vocello

macOS 및 iOS용 로컬 우선 음성 스튜디오로, MLX와 Swift를 사용하여 클라우드 의존 없이 고품질 음성 생성을 가능하게 하며, 음성 클로닝과 커스텀 음성 설계 기능을 제공합니다.

cboard-org/cboard

발화 장애를 가진 사람들이 기호와 텍스트 음성 합성을 통해 소통할 수 있도록 도와주는 보조 및 대체 통신(AAC) 웹 앱입니다.

nateshmbhat/pyttsx3

인터넷 연결 없이 음성 출력을 생성하기 위한 Python 라이브러리로, 네이티브 시스템 엔진을 사용하여 오프라인 텍스트 음성 변환을 수행합니다.

readbeyond/aeneas

음성 내레이션과 해당 텍스트 조각을 자동으로 동기화하는 Python/C 라이브러리 및 도구 세트입니다.

showlab/Kiwi-Edit

Kiwi‑Edit는 자연어 명령(및 선택 사항인 참조 이미지)을 사용하여 전체 비디오를 편집할 수 있는 오픈 소스 비디오 편집 시스템입니다. 멀티모달 LLM 인코더와 비디오 Diffusion Transformer를 결합하여 스타일 변환, 객체 추가/교체/제거 및 배경 변경 기능을 제공합니다. 이 저장소는 전체 학습 스크립트(Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5B를 사용한 3단계 커리큘럼 학습), 사전 학습된 Diffusers 체크포인트, 그리고 OpenVE‑Bench 및 RefVIE‑Bench에 대한 평가 파이프라인을 제공합니다.

ashbuilds/payload-ai

콘텐츠 필드에 AI 기반 텍스트, 이미지, 음성 생성 기능을 추가하는 Payload CMS 플러그인. 여러 모델 제공업체를 지원하며, 세밀한 구성과 접근 제어를 제공합니다.

Chaoses-Ib/ComfyScript

ComfyUI를 위한 Python 프론트엔드 및 라이브러리로, 사용자가 시각적 노드 그래프 대신 Python 스크립트로 이미지 생성 워크플로우를 정의하고 실행할 수 있도록 합니다.

VibiumDev/vibium

CLI, MCP 또는 클라이언트 라이브러리를 통해 웹 기반 작업을 브라우저 자동화 및 검증할 수 있는 AI 코딩 에이전트용 검증 계층입니다.

Mengqi-Lei/count-anything

Count Anything은 자연어 질의를 기반으로 이미지 내 객체를 카운팅하는 연구용 모델입니다. 스파스 영역 카운터와 밀집 픽셀 카운터를 결합하여 파라미터 없는 융합 단계를 통해 6개 도메인(장면, 위성, 의료 등)에서 작동합니다. 리포지토리는 사전 학습된 체크포인트, 트레이닝/평가 스크립트, 그리고 대규모 CLOC 데이터셋 준비 방법을 제공합니다.

Intellindust-AI-Lab/EdgeCrafter

EdgeCrafter는 엣지 장치에 최적화된 컴팩트한 비전 트랜스포머(ViT)를 제공하여 낮은 지연 시간으로 고성능 객체 탐지, 인스턴스 세그멘테이션, 자세 추정을 가능하게 합니다.

microsoft/TimeCraft

TimeCraft는 Microsoft Research에서 개발한 확산 기반 합성 시계열 데이터 생성 프레임워크입니다. 프로토타입 사전을 통한 크로스도메인 소수 샘플 적응, 자연어 제어, 타겟 인식 생성을 지원하며, 인과 제약, 기초 모델 사전 학습용 온라인 증강, 불규칙 관측에서의 연속 시간 생성 등의 확장 기능을 제공합니다.

open-ribbi/velocut

AI 통합을 통해 자동 장면 구성과 편집이 가능한 멀티트랙 비디오 편집과 3D 장면 디렉션을 결합한 브라우저 기반 스튜디오입니다.

yan5xu/codexloom

CodexLoom은 자체 호스팅 플랫폼으로, Codex 채팅 에이전트에 내구성 있는 아이덴티티, 프로필, 조직 도구를 추가하여 여러 장치에서 접근 가능하고, 제한된 메시지를 통해 통신하며, Feishu, Slack, Parall과 같은 외부 채팅 플랫폼에 인터페이스 에이전트를 통해 노출할 수 있는 '도메인 에이전트'를 가능하게 합니다. 고급 단일 사용자를 대상으로 UI, CLI, 거버넌스 기능을 제공하며, Elastic License 2.0 하에 배포됩니다.

kris-hansen/comanda

리포지토리 내에서 내구적이고 자기 개선 가능한 에이전트 워크플로우를 실행하는 터미널 기반 런타임. 품질 게이트와 코드베이스 인덱싱을 사용하여 작업이 실제로 완료되었는지 보장합니다.

Cocolalilal/LastChat

RAG 기반 메모리, 다중 모달 입력 및 내장된 Python과 JavaScript 엔진을 갖춘 안드로이드용 개인정보 보호 중심의 AI 어시스턴트 앱입니다.

lhotse-speech/lhotse

기계학습 트레이닝을 위한 음성, 오디오, 비디오, 이미지 데이터의 로딩과 조작을 최적화하는 유연한 다중 모달 데이터 준비용 파이썬 라이브러리입니다.

SkyworkAI/Skywork-R1V

Skywork-R1V는 강화 학습과 시각적 사고의 연쇄(Visual Chain-of-Thought)를 사용하여 복잡한 시각적 논리, 수학 및 물리 작업에서 최첨단 성능을 달성하는 오픈 소스 멀티모달 추론 모델입니다.

do-md/domd

대용량 파일, 실시간 협업, 스트리밍 AI 출력을 위한 고성능 WYSIWYG Markdown 에디터 및 커널

NVlabs/physical_ai_av

엔드투엔드 주행 시스템을 구축하기 위해 NVIDIA Physical AI Autonomous Vehicles Dataset에 액세스하고 작업할 수 있는 Python 개발자 키트.

fajarhide/omni

노이즈가 많은 명령어 출력을 정제하고 반복 데이터를 재검색 가능한 핸들로 교체하여 AI 에이전트의 토큰 사용량을 줄이는 도구.

gobii-ai/gobii-platform

이메일이나 SMS를 통해 연락할 수 있고, 프로덕션 브라우저 자동화를 수행할 수 있는 내구성 있고 항상 켜져 있는 자율 에이전트를 실행하는 AI 직원 플랫폼입니다.

AmberSahdev/Open-Interface

LLM을 사용해 시각적 피드백을 기반으로 키보드와 마우스 입력을 시뮬레이션하여 PC를 자동으로 구동하는 AI 기반 컴퓨터 자동화 도구입니다.

SponsioLabs/Sponsio

Sponsio는 LLM 기반 에이전트에 결정론적이고 마이크로초 단위의 가드레일을 추가하는 오픈소스 라이브러리입니다. 형식 메서드 기반의 계약(YAML 규칙북)을 작성하여 모든 도구 호출 시 강제 적용할 수 있으며, 모델을 호출하지 않고도 작업을 차단, 경고 또는 허용할 수 있습니다. 이 라이브러리는 Python 또는 TypeScript의 LangChain, Claude, OpenAI, CrewAI 및 기타 에이전트 프레임워크와 통합되며, 22개의 기성 계약 번들이 포함되어 있고 감사 및 검토를 위한 호스팅 콘솔을 제공합니다. 벤치마크에 따르면 잘못된 동작이 95% 이상 감소하고 호출당 지연 시간이 0.2ms 미만으로, 프로덕션 AI 에이전트를 위한 빠르고 신뢰할 수 있는 안전 계층을 제공합니다.

av/harbor

Harbor는 CLI 기반의 Docker-Compose 조율기로, 단일 `harbor up` 명령어로 모델 백엔드(Ollama, llama.cpp, vLLM, MLX 등), 채팅 프론트엔드(Open WebUI, LibreChat, AnythingLLM 등), 웹 검색, 음성, 이미지 생성, Boost 기반 에이전트 워크플로우를 포함한 완전한 로컬 LLM 스택을 빠르게 구축할 수 있게 해줍니다.

artivis/manif

로봇 상태 추정을 위한 Lie 이론 라이브러리로, 다양한 Lie 그룹에 걸친 회전, 변위, 속도를 다루는 C++ 및 Python 도구를 제공합니다.

marcusquinn/aidevops

aidevops는 MIT 라이선스의 AI-DevOps 프레임워크로, 코드, 인프라, 제품, 마케팅 등 다양한 분야에서 AI 에이전트를 오케스트레이션하는 CLI와 OpenCode 플러그인을 제공합니다. 작업을 14개의 주요 에이전트와 수천 개의 하위 에이전트로 나누고, 펄스 감시자가 작업을 라우팅하고, 토큰 예산을 관리하며, 시크릿을 안전하게 보관하고 Git 위생을 유지합니다. npm 또는 Homebrew로 설치한 후, `aidevops init`, `aidevops pulse`, 또는 도메인 전용 슬래시 명령어를 실행하여 빌드, 배포, 보고서, 비즈니스 프로세스를 자동화하면서 감사 가능성을 유지할 수 있습니다.

pinecone-io/python-sdk

AI 애플리케이션을 위한 벡터 인덱스 생성, 관리 및 쿼리가 가능한 Python 클라이언트입니다.

ZhixiangLuo/10xProductivity

로컬 퍼스트 스택을 통해 기존 사용자 권한 및 도구 접근을 활용하여 코딩 에이전트를 업무용 개인 AI 어시스턴트로 전환하고 기업 IT 제약을 우회합니다.

SonySemiconductorSolutions/mct-model-optimization

A model compression toolkit for PyTorch and Keras that optimizes AI models for edge deployment using quantization, pruning, and hardware-aware optimization.

ultralytics/xview-yolov3

리모트 센싱 응용을 위한 xView 위성 이미지 데이터셋에서 객체 탐지를 훈련하고 실행하기 위해 특화된 YOLOv3 구현.

study8677/repobrain

코드베이스에 대한 근거 있는 Q&A 시스템을 생성하는 다중 IDE 호환 리포지토리 지식 엔진으로, AI 에이전트가 정확한 파일 경로와 행 번호를 포함한 답변을 제공할 수 있도록 합니다.

norse/norse

Norse는 PyTorch 기반 라이브러리로, 스파이킹 신경망 프리미티브(LIF, LSNN 등)를 추가하여 이벤트 기반 모델을 구축·학습·평가할 수 있게 합니다. pip/conda/Docker 설치를 지원하고, MNIST, CIFAR‑10, cart‑pole 등 준비된 예제 작업을 제공하며, PyTorch‑Lightning과 통합해 확장 가능한 학습을 가능하게 합니다.

mlmed/torchxrayvision

흉부 X‑ray 데이터셋 및 모델을 위한 라이브러리로, 사전 학습된 모델과 통합 인터페이스를 제공하여 여러 공개 흉부 X‑ray 데이터셋을 손쉽게 사용할 수 있습니다.

netket/netket

NetKet은 JAX를 기반으로 구축된 Python 라이브러리로, 신경망과 머신러닝을 사용하여 다체 양자 시스템을 연구합니다.

DougTrajano/pydantic-ai-skills

Pydantic AI의 보조 라이브러리로, 에이전트가 로컬 또는 원격 레지스트리에서 모듈화된 기술을 로드하고, 패키지된 스크립트를 실행하며, 점진적 공개를 통해 리소스를 관리할 수 있도록 합니다.

jahala/tilth

구문 인식 기능을 갖춘 코드 탐색 도구로, 인간과 AI 에이전트에게 구조적 인사이트를 제공하여 코드베이스 탐색에 필요한 도구 호출 횟수를 줄입니다.

tschnz/Live-Video-Magnification

Eulerian video magnification 기술을 사용하여 미세한 움직임과 색 변화를 실시간으로 증폭하는 비디오 확대 도구입니다.

LvcidPsyche/auto-browser

AI 에이전트에게 인간의 개입(human-in-the-loop)이 가능한 실제 브라우저, 재사용 가능한 인증 프로필 및 내장된 안전 장치를 제공하는 MCP 네이티브 브라우저 컨트롤 플레인입니다.

MigoXLab/dingo

Dingo는 AI 데이터, 모델 출력물, RAG 시스템 평가를 위한 오픈소스 Python 라이브러리(및 SaaS 제품)입니다. 규칙 기반, LLM 기반, 에이전트 기반 검사를 지원하며, 파일, 데이터베이스, S3, Hugging Face에서 데이터를 스트리밍으로 읽어들여 JSON 보고서와 선택적 시각화 대시보드를 제공합니다. `pip install dingo-python` (옵션 확장 기능 포함)로 설치하고 CLI(`dingo eval …`) 또는 Python SDK로 실행 가능하며, 사용자 정의 규칙, LLM 프롬프트, 에이전트로 확장할 수 있습니다.

papercopilot/paperlists

NeurIPS와 ICLR 등 주요 학회에서 학술 문헌을 분석하기 위한 구조화된 AI 학회 논문 레코드 저장소와 로컬 검색 도구입니다.