FORTH-ModelBasedTracker/MocapNET
실시간 2D‑to‑3D 인간 포즈 추정기로, RGB 비디오 피드를 표준 BVH 모션 캡처 파일로 변환하여 3D 애니메이션에 활용합니다.
imagej/imagej2
ImageJ2는 다차원 이미지 데이터 지원 및 여러 프로그래밍 언어에 걸친 헤드리스 처리를 위해 기존 ImageJ를 확장한 과학적 이미징 프레임워크입니다.
IliasHad/edit-mind
전사와 시각 분석을 통해 비디오를 인덱싱하고, 자연어 의미 검색을 가능하게 하는 로컬 비디오 지식 베이스입니다.
opendatacam/opendatacam
오픈소스 컴퓨터 비전 도구로, 비디오 피드에서 움직이는 객체를 감지·추적·카운트하여 실제 움직임을 정량화합니다. 주로 교통 조사에 사용됩니다.
MRPT/mrpt
SLAM, 내비게이션, 맵핑 및 센서 통합에 필요한 도구를 제공하는 견고하고 모듈화된 모바일 로보틱스용 C++ 프레임워크입니다.
ARM-software/ComputeLibrary
Arm Cortex-A, Neoverse 및 Mali GPU 아키텍처에 최적화된 저수준 머신러닝 함수 모음으로 고성능 ML 추론을 제공합니다.
shimat/opencvsharp
C# 개발자에게 포괄적인 컴퓨터 비전 및 이미지 처리 기능을 제공하는 OpenCV용 크로스 플랫폼.NET 래퍼입니다.
deepgram/deepgram-python-sdk
자동 음성 인식, 텍스트 음성 변환, 언어 이해 API를 간편하게 통합할 수 있는 Deepgram 공식 Python SDK입니다.
vargHQ/sdk
오픈소스 TypeScript SDK로, 개발자와 AI 에이전트가 선언형 JSX 구문과 통합 API를 사용해 여러 AI 제공업체용 AI 생성 비디오를 만들 수 있습니다.
sdv-dev/SDGym
합성 데이터를 모델링하고 생성하는 벤치마크 프레임워크로, 사용자가 다양한 머신러닝 기법의 성능, 메모리 사용량 및 품질을 비교할 수 있습니다.
digital-go-jp/genai-ai-api
일본 디지털청이 정부 공무원이 특정 업무용 AI 애플리케이션을 배포할 수 있도록 개발한 생성형 AI 마이크로서비스 및 클라우드 템플릿 모음입니다.
inseq-team/inseq
시퀀스 생성 모델의 사후 해석성을 위한 PyTorch 기반 툴킷으로, 모델 출력을 설명하는 다양한 특징 귀속 방법을 제공합니다.
aws-samples/bedrock-engineer
Amazon Bedrock 기반의 자율 소프트웨어 개발 에이전트 앱으로, 파일 생성, 명령 실행 및 맞춤형 에이전트 인터페이스를 통해 프로젝트를 관리할 수 있습니다.
aws-samples/well-architected-iac-analyzer
Infrastructure as Code(IaC)와 아키텍처 다이어그램을 AWS Well-Architected 모범 사례에 대해 분석하여 우선순위가 정해진 시정 제안을 제공하는 AI 기반 도구.
eidolon-ai/eidolon
내장 HTTP 서버와 동적 에이전트 간 통신을 갖춘 모듈식·확장 가능한 서비스로 AI 에이전트를 구축·배포하기 위한 오픈소스 SDK.
GoogleCloudPlatform/genai-for-marketing
Google Cloud 기반 솔루션으로 Vertex AI와 Google Workspace 통합을 통해 마케팅 콘텐츠 자동 생성, 트렌드 분석 및 데이터 쿼리를 자동화합니다.
digital-go-jp/genai-web
...
nv-tlabs/XCube
XCube는 계층적 잠재 확산(hierarchical latent diffusion)과 VDB 데이터 구조를 사용하여 정교한 3D 오브젝트와 대규모 장면을 생성하는 고해상도 희소 3D 복셀 그리드용 생성 모델입니다.
alexiglad/EBT
텍스트, 이미지, 비디오 등 다양한 모달리티에서 확장 가능한 추론과 System 2 사고를 가능하게 하는 에너지 기반 트랜스포머(EBT) 프레임워크입니다.
FoundationVision/Liquid
Liquid는 외부 시각 임베딩 없이 시각 이해와 이미지 생성을 단일 LLM에 통합한 통합 자기 회귀 멀티모달 생성기입니다.
sdv-dev/Copulas
코퓰라 함수를 사용하여 다변량 분포를 모델링하고 합성 수치 데이터를 생성하는 파이썬 라이브러리.
SomeOddCodeGuy/WilmerAI
고급 의미적 프롬프트 라우팅과 다중 LLM 조율을 가능하게 하는 노드 기반 워크플로 엔진으로, 사용자가 복잡하고 문맥 인식 가능한 AI 에이전트를 만들 수 있도록 합니다.
Azure-Samples/serverless-chat-langchainjs
LangChain.js와 Azure를 활용한 서버리스 AI 챗봇 구현으로, RAG(Retrieval‑Augmented Generation)를 활성화하여 기업 문서를 기반으로 질의에 답변합니다.
jdh-algo/JoyVASA
JoyVASA는 diffusion 기반 프레임워크로, 오디오를 사용해 인간 및 동물 초상화를 애니메이션화하며 얼굴 정체성과 움직임을 분리해 고품질·장시간 비디오 생성을 가능하게 합니다.
Coframe/coffee
AI 기반 프런트엔드 엔진으로, 개발자는 IDE 내에서 특수 JSX 컴포넌트와 props를 사용해 React 컴포넌트를 생성, 반복, 정제할 수 있습니다.
LLPhant/LLPhant
Generative AI와 벡터 데이터베이스를 위한 PHP 라이브러리로, LLM과 벡터 스토어를 PHP 애플리케이션에 통합할 수 있는 통합 인터페이스를 제공합니다.
alan-ai/alan-sdk-web
웹 애플리케이션에 인텔리전트 레이어를 삽입하여 비즈니스 로직 및 UI 컴포넌트를 실시간으로 생성할 수 있는 SDK.
nxnai/Voost
Voost는 통합된 Diffusion Transformer로, 고품질 양방향 가상 착용 및 탈의를 가능하게 하여 사용자가 사람 이미지에 옷을 추가하거나 제거할 수 있습니다.
quantgirluk/aleatory
다양한 1차원 및 2차원 확률 과정을 시뮬레이션하고 시각화하기 위한 파이썬 라이브러리입니다.
Ammmob/PixelSmile
PixelSmile은 인간 및 애니메이션 캐릭터 이미지에서 신원을 유지하면서 감정을 변경할 수 있는 세밀한 얼굴 표정 편집 도구입니다.
Visionary-Laboratory/visionary
WebGPU 기반 플랫폼으로, ONNX Runtime을 사용하여 브라우저에서 Gaussian Splatting 변형 및 3D mesh를 실시간으로 렌더링합니다.
WHU-USI3DV/VistaDream
VistaDream은 생성된 새로운 뷰 간의 일관성을 보장함으로써 단일 뷰 이미지만으로 고품질 3D 씬을 재구성하는 트레이닝 프리 프레임워크입니다.
EzioBy/Ditto
Ditto is a framework for generating high-quality synthetic video editing data to train Editto, a state-of-the-art instruction-based video editing model.
thu-ml/DiT-Extrapolation
위치 임베딩 외삽(extrapolation)을 통해 더 긴 비디오와 더 높은 해상도의 이미지를 생성할 수 있게 하는 Diffusion Transformers용 플러그 앤 플레이 프레임워크입니다.
PKU-YuanGroup/ConsisID
ConsisID는 튜닝이 필요 없는 DiT 기반 텍스트‑투‑비디오 생성 모델로, 주파수 분해를 사용해 생성된 비디오 프레임 간에 일관된 인간 정체성을 유지합니다.
UCSC-VLAA/story-iter
학습이 필요 없는 반복 프레임워크로, 전역 레퍼런스 교차 주의 모듈을 사용해 최대 100 프레임에 걸친 긴 스토리 시각화에서 의미 일관성을 유지합니다.
haidog-yaqub/MeanFlow
A PyTorch implementation of Mean Flows and Improved Mean Flows for high-quality, one-step image generation.
PKU-YuanGroup/MagicTime
MagicTime은 텍스트 프롬프트를 기반으로 현실적인 타임랩스 영상을 생성하여 눈에 띄는 물리적 변화를 묘사하는 메타모픽 비디오 생성 파이프라인입니다.
DaoyuanLi2816/can-i-finetune-this
소비자용 GPU에서 LoRA 및 QLoRA를 사용하여 LLM을 미세 조정할 때 VRAM 사용량을 추정하고, 성능을 벤치마킹하며, 학습 레시피를 생성하는 CLI 도구입니다.
nolabs-ai/deepfabric
실제 도구 실행 및 주제 그래프 매핑을 사용하여 에이전트형 LLM을 위한 고품질 학습 데이터셋을 생성하는 합성 데이터 생성 및 평가 프레임워크입니다.
open-edge-platform/geti_v2
Geti는 스마트 데이터 어노테이션 및 액티브 러닝부터 모델 학습 및 에지 배포에 이르기까지 전체 AI 라이프사이클을 간소화하는 엔드 투 엔드 컴퓨터 비전 플랫폼입니다.
kaito-project/aikit
컨테이너화된 이미지와 OpenAI 호환 API를 사용하여 LLM의 호스팅, 배포, 파인튜닝을 통합적으로 지원하는 포괄적인 플랫폼입니다.
Koldim2001/YOLO-Patch-Based-Inference
이미지 타일링 및 결과 통합을 통해 대형 이미지에서 작은 객체 검출을 향상시키는 패치 기반 추론을 지원하는 Python 라이브러리입니다.
zhiqwang/yolort
YOLOv5를 위한 런타임 스택으로, 전처리 및 후처리를 모델 그래프에 내장하여 다양한 하드웨어 가속기를 위한 객체 탐지 배포를 단순화합니다.
run-house/kubetorch
Pythonic한 서버리스 인터페이스로, ML 개발자가 로컬 환경에서 직접 Kubernetes 클러스터에 워크로드를 실행하고 확장할 수 있으며 시작 시간이 거의 즉시입니다.
facebookincubator/nimble
Meta가 설계한 대규모 및 와이드 데이터셋을 위한 열 지향 파일 형식으로, 머신러닝 학습 테이블과 피처 엔지니어링을 위한 스토리지 및 액세스 최적화를 제공합니다.
VIAME/VIAME
VIAME은 모듈식 다국어 파이프라인 프레임워크를 통해 탐지, 추적, 주석, 검색 및 기타 많은 이미지/비디오 처리 기능을 제공하는 오픈 소스 컴퓨터 비전 툴킷입니다. 데스크톱 및 웹 GUI, 명령줄 도구, 사전 빌드된 바이너리 및 Docker 이미지가 포함되어 있으며 C++, Python 또는 MATLAB 플러그인을 통해 확장할 수 있습니다.
tensorflow/model-optimization
양자화 및 가지치기(pruning)와 같은 기술을 사용하여 머신러닝 모델의 배포 및 실행을 최적화하기 위한 도구 모음입니다.