jitsi/jiwer

Word Error Rate (WER) 및 Character Error Rate (CER)와 같은 지표를 사용하여 자동 음성 인식 시스템을 평가하는 빠른 Python 패키지입니다.

innovatorved/whisper.api

whisper.cpp 기반의 고성능 자가 호스팅 음성 인식(speech-to-text) API로, Deepgram과 호환되어 통합이 용이합니다.

noahgsolomon/brainrot.js

Groq, OpenAI, Speechify를 활용해 유명인 음성 클론과 생성된 콘텐츠를 결합한 AI 생성 비디오를 자동으로 만드는 도구.

THU-BPM/MarkDiffusion

잠재 확산 모델(LDM)의 생성 미디어에 대한 오픈소스 Python 툴킷으로, AI 생성 이미지 및 동영상에 수식을 삽입, 탐지, 평가할 수 있는 도구를 제공합니다.

OpenImagingLab/AnyRecon

AnyRecon은 동영상 확산 모델을 사용하여 촬영된 시점의 집합에서 임의 시점의 고품질 3D 재구성을 생성하는 3D 재구성 프레임워크입니다.

nachifur/RDDM

고품질 이미지 복원 및 생성을 위한 잔차 디노이징 확산 모델 프레임워크로, 비 제거, 블러 제거 등의 작업을 지원합니다.

rohitgandikota/sliders

LoRA 어댑터를 생성하기 위한 프레임워크로, 슬라이더 역할을 하여 Stable Diffusion 및 FLUX와 같은 확산 모델에서 특정 시각 개념을 정밀하게 제어할 수 있습니다.

helblazer811/Diffusion-Explorer

확산 모델과 흐름 기반 생성 모델의 기하학적 직관을 설명하는 교육용 대화형 시각화 도구입니다.

viiika/Meissonic

Meissonic은 소비자용 GPU에서 실행되도록 설계된 효율적인 고해상도 텍스트-이미지 합성을 위한 비자기회귀 마스크 생성 트랜스포머입니다.

Karine-Huang/T2I-CompBench

텍스트-이미지 생성 모델(text-to-image generation models)의 복잡한 구성 요소, 속성 바인딩, 공간 관계 처리 능력을 중점적으로 평가하는 종합적인 벤치마크 및 평가 스위트입니다.

LHRLAB/HyperGraphRAG

하이퍼그래프 구조의 지식 표현을 사용하여 엔터티 간 복잡한 관계를 보다 잘 포착하는 Retrieval‑Augmented Generation 프레임워크입니다.

neuml/rag

txtai를 백엔드로 하는 Streamlit 애플리케이션으로, 벡터와 그래프 RAG를 구현하여 사실에 기반한 LLM 응답을 제공합니다.

LightningRAG/LightningRAG

시각적 에이전트 오케스트레이션 캔버스와 Webhook 커넥터를 통해 AI 에이전트를 제3자 메시징 플랫폼에 배포할 수 있는 풀스택 RAG 프레임워크입니다.

DataScienceUIBK/Rankify

검색, 재순위화(re-ranking), RAG를 위한 포괄적인 Python 툴킷으로, 최첨단 모델을 실험하고 배포할 수 있는 통합 인터페이스를 제공합니다.

graniet/llm

다중 LLM 백엔드와 상호 작용하기 위한 통합 API를 제공하는 Rust 라이브러리로, 다단계 체인, 에이전트 워크플로우 및 표준화된 REST API를 지원합니다.

Farzad-R/LLM-Zero-to-Hundred

RAG, 에이전트 워크플로우, 멀티모달 챗봇, 그리고 파인튜닝 파이프라인을 다루는 LLM 프로젝트와 튜토리얼 모음집으로, 기초부터 고급 AI 애플리케이션 개발로 나아가기 위한 과정을 제공합니다.

maze-agent/Maze

이종 리소스 스케줄링과 자동 모델 서빙을 지원하는 LLM 에이전트용 분산 프레임워크로, 에이전트 프로그램을 관측 가능한 워크플로우로 변환합니다.

suyoumo/ClawProBench

OpenClaw 런타임 내에서 AI 에이전트의 능력과 성능을 평가하기 위한 투명한 라이브 실행 벤치마크 허브로, 결정론적 채점을 제공합니다.

OpenManus/OpenManus-RL

강화 학습을 사용해 LLM 에이전트의 추론, 도구 사용 및 의사결정 능력을 최적화하는 오픈소스 프레임워크.

mkalten/reacTIVision

피델리티 마커와 멀티터치 손가락을 추적하여 물리적 사용자 인터페이스를 만들 수 있게 해 주는 크로스 플랫폼 컴퓨터 비전 프레임워크입니다.

frgfm/holocron

컴퓨터 비전 작업을 위한 최신 딥러닝 기법 및 모델 아키텍처의 고품질 PyTorch 구현 라이브러리입니다.

rapidsai/cucim

cuCIM은 바이오메디컬, 지리공간 및 원격 감지 응용 분야에서 사용되는 대규모 다차원 이미지를 위해 설계된 GPU 가속 컴퓨터 비전 및 이미지 처리 라이브러리입니다.

commaai/rednose

센서 퓨전, 시각적 주행 거리 측정(visual odometry) 및 SLAM을 위한 Kalman filter 프레임워크로, Jacobian 계산을 자동화하고 ESKF 및 MSCKF와 같은 고급 필터를 지원합니다.

theICTlab/3DUNDERWORLD-SLS-GPU_CPU

패턴화된 빛으로 비춘 물체 이미지에서 3D 포인트 클라우드를 재구성하는 구조광 스캔 도구로, CPU와 GPU 가속을 모두 지원합니다.

alicevision/popsift

CUDA 가속을 이용한 SIFT 알고리즘 구현으로 실시간 이미지 특징 추출이 가능합니다.

thp/psmoveapi

Linux, macOS, Windows를 지원하는 오픈소스 라이브러리로, PC가 Sony Move 모션 컨트롤러에 접근하여 AR/VR 애플리케이션에서 3D 트래킹 및 센서 융합을 가능하게 합니다.

rgeirhos/Stylized-ImageNet

Stylized-ImageNet을 생성하기 위한 도구로, 텍스처를 왜곡하여 CNN이 텍스처보다 객체 형태를 우선하도록 유도함으로써 견고성을 향상시킵니다.

Fabric-Project/Fabric

macOS에서 인터랙티브 3D 그래픽, 이미지/비디오 처리, AI 강화 비주얼의 빠른 프로토타이핑을 위한 비주얼 노드 기반 크리에이티브 코딩 환경.

VSLAM-LAB/VSLAM-LAB

통일된 구성과 벤치마킹을 통해 Visual SLAM 시스템의 개발, 평가, 적용을 간소화하는 포괄적인 프레임워크입니다.

askui/python-sdk

비전 기반 자동화를 사용하여, 취약한 UI selector 대신 AI agent가 데스크톱 및 모바일 기기를 제어할 수 있게 하는 Python SDK입니다.

l3p-cv/lost

유연한 웹 기반 협업 이미지 주석 프레임워크로, 반자동 파이프라인을 지원하여 머신러닝 데이터셋 라벨링 속도를 높입니다.

roboflow/roboflow-python

개발자가 모델, 데이터셋, 프로젝트와 프로그래밍 방식으로 상호작용하여 컴퓨터 비전 모델을 자동으로 구축하고 배포할 수 있도록 해주는 Roboflow 공식 Python 패키지입니다.

genicam/harvesters

GenICam 준수 장치를 위한 통합 인터페이스를 제공하여 컴퓨터 비전 애플리케이션의 이미지 획득을 단순화하는 Python 라이브러리입니다.

zju3dv/Diffuman4D

Diffuman4D는 희소한 뷰의 비디오로부터 자유 시점 렌더링을 가능하게 하는 고충실도 4D 일관성 인간 뷰 합성용 시공간 확산 모델입니다.

open-edge-platform/datumaro

AI 데이터셋을 구축, 변환 및 분석하는 데 사용되는 데이터셋 관리 프레임워크 및 CLI 도구로, 특히 다양한 어노테이션 형식을 변환하는 데 중점을 둡니다.

basler/pypylon

Basler pylon C++ API를 위한 공식 Python 바인딩으로, Python 애플리케이션에서 Basler 머신 비전 카메라를 제어하고 이미지 처리 작업을 수행할 수 있도록 합니다.

10up/classifai

클라우드 기반 및 로컬 AI 서비스를 통합하여 콘텐츠 생성, 이미지 처리 및 사이트 관리 작업을 자동화하는 WordPress 플러그인입니다.

cyrusbehr/YOLOv8-TensorRT-CPP

TensorRT를 이용한 C++ 구현 YOLOv8으로 고성능 GPU 추론을 제공하며, 객체 탐지, 의미 분할 및 포즈 추정을 지원합니다.

insight-platform/Savant

Nvidia 하드웨어에서 실시간 고성능 컴퓨터 비전 및 비디오 분석 파이프라인을 구축하기 위한 고수준 프레임워크로, DeepStream의 복잡성을 추상화합니다.

luispedro/mahotas

C++ 로 구현된 빠른 Python 컴퓨터 비전 라이브러리로, NumPy 배열에서 동작하는 100개 이상의 이미지 처리 알고리즘을 제공합니다.

FORTH-ModelBasedTracker/MocapNET

실시간 2D‑to‑3D 인간 포즈 추정기로, RGB 비디오 피드를 표준 BVH 모션 캡처 파일로 변환하여 3D 애니메이션에 활용합니다.

imagej/imagej2

ImageJ2는 다차원 이미지 데이터 지원 및 여러 프로그래밍 언어에 걸친 헤드리스 처리를 위해 기존 ImageJ를 확장한 과학적 이미징 프레임워크입니다.

IliasHad/edit-mind

전사와 시각 분석을 통해 비디오를 인덱싱하고, 자연어 의미 검색을 가능하게 하는 로컬 비디오 지식 베이스입니다.

opendatacam/opendatacam

오픈소스 컴퓨터 비전 도구로, 비디오 피드에서 움직이는 객체를 감지·추적·카운트하여 실제 움직임을 정량화합니다. 주로 교통 조사에 사용됩니다.

MRPT/mrpt

SLAM, 내비게이션, 맵핑 및 센서 통합에 필요한 도구를 제공하는 견고하고 모듈화된 모바일 로보틱스용 C++ 프레임워크입니다.

ARM-software/ComputeLibrary

Arm Cortex-A, Neoverse 및 Mali GPU 아키텍처에 최적화된 저수준 머신러닝 함수 모음으로 고성능 ML 추론을 제공합니다.

shimat/opencvsharp

C# 개발자에게 포괄적인 컴퓨터 비전 및 이미지 처리 기능을 제공하는 OpenCV용 크로스 플랫폼.NET 래퍼입니다.

deepgram/deepgram-python-sdk

자동 음성 인식, 텍스트 음성 변환, 언어 이해 API를 간편하게 통합할 수 있는 Deepgram 공식 Python SDK입니다.