lucidrains/transfusion-pytorch

텍스트의 다음 토큰 예측과 이미지와 같은 연속 모달리티의 흐름 매칭을 하나의 모델에서 통합하는 PyTorch 구현.

landing-ai/ade-python

LandingAI ADE API용 파이썬 라이브러리로, PDF 및 이미지를 구조화된 마크다운으로 변환하고 Pydantic 모델을 사용해 형식화된 데이터를 추출합니다.

NEKOparapa/ReaDreamAI

텍스트 생성, 일관된 캐릭터 일러스트, 동영상 아다프테이션을 자동화하는 AI 기반 플랫폼.

OpenEnvision/WorldFoundry

동영상 생성, 3D/4D 표현, 몸체 기반 AI에서 추론, 자산 스테이징, 벤치마크 평가를 통합적으로 제공하는 오픈소스 인프라스트럭처입니다.

alexiglad/EBT

텍스트, 이미지, 비디오 등 다양한 모달리티에서 확장 가능한 추론과 System 2 사고를 가능하게 하는 에너지 기반 트랜스포머(EBT) 프레임워크입니다.

potamides/DeTikZify

DeTi*k*Zify는 스케치나 래스터 과학 그림을 편집 가능한 TikZ 코드로 변환하는 오픈소스 멀티모달 LLM입니다. 이미지-투-TikZ 생성, Ti*k*Zero 어댑터를 통한 텍스트-투-TikZ, 몬테카를로 트리 탐색을 통한 반복적 개선을 지원합니다. pip로 설치할 수 있으며, 전체 TeX Live, Ghostscript, Poppler 설치가 필요하고 GPU(8‑b 모델) 또는 CPU(1‑b)에서 실행됩니다. 저장소는 CLI/웹 UI, Python API 예제, Hugging Face의 모델 가중치, 훈련 데이터셋 재생성 스크립트를 제공합니다.

apple-aiml-research/ml-hierarchical-confusion-matrix

Neo는 오픈소스 JavaScript 라이브러리(패키지 `@apple/hierarchical-confusion-matrix`)로, 계층적 및 다중 출력 클래스 레이블을 지원하는 인터랙티브한 혼동행렬 시각화를 제공합니다. npm을 통해 설치하고, 스펙과 `{actual, observed, count}` 레코드 배열을 전달하면 웹 페이지 어디에든 매트릭스를 삽입할 수 있습니다. 평탄, 계층적(`:`), 다중 출력(`,`), 그리고 복합 레이블 구조를 지원하며, 실시간 데모, 단위 테스트, 완전한 TypeScript 소스 트리가 포함되어 있습니다.

lxtGH/OMG-Seg

A unified framework for visual perception and reasoning that combines image, video, and pixel-level segmentation into a 시각적 지각 및 추론을 위한 통합된 프레임워크로, 이미지, 비디오, 픽셀 수준의 세그멘테이션을 단일 모델로 결합하여 전문화된 모델의 필요성을 줄입니다.

baxtree/subaligner

Subaligner는 자막과 비디오/오디오를 동기화하는 오픈소스 파이썬/CLI 도구입니다. Whisper를 통한 음성 인식, HuggingFace 모델을 통한 자막 번역, 사용자 정의 동기화 모델 훈련 기능을 제공합니다. 다양한 자막 및 미디어 형식을 지원하며, 빠른 전역 이동(`single`)과 고정밀 이중 단계(`dual`) 동기화를 제공하고, Docker, pip, LLM 기반 기능용 선택적 확장 기능도 제공합니다.

Softlandia-Ltd/vision-is-all-you-need

VLM을 사용해 PDF 페이지를 이미지로 임베딩하여 문서 검색 시 텍스트 청크화의 필요성을 제거하는 비전 기반 RAG(V-RAG) 데모.

openaiotlab/CUHK-X

인간 행동 인식과 추론을 위한 대규모 다중 모달 데이터셋과 벤치마크로, 7개의 동기화된 센서 모달리티를 통합하여 복잡한 행동 이해를 가능하게 합니다.

EleutherAI/gpt-neox

GPT‑NeoX는 다중 GPU 클러스터에서 수십억 매개변수 언어 모델을 훈련하기 위한 Megatron 기반의 오픈 소스 라이브러리입니다. DeepSpeed 스타일의 최적화를 추가하고, 많은 런처(Slurm, MPI 등)를 지원하며, NVIDIA 및 AMD GPU에서 작동하고, Flash Attention, Mixture‑of‑Experts 및 선호 학습 미세 조정과 같은 최신 기능을 포함합니다. 대규모 컴퓨팅 예산을 가진 연구실에 이상적입니다. 추론 전용 사용에는 Hugging Face `transformers`를 권장합니다.

mbzuai-oryx/Video-ChatGPT

LLM과 시공간 시각 인코더를 결합하여 동영상 콘텐츠에 대해 세부적이고 자연스러운 언어 대화를 가능하게 하는 동영상 대화 모델입니다.

mbzuai-oryx/groundingLMM

GLaMM은 자연어 응답과 객체 분할 마스크를 통합하여 정확한 시각적 그라운딩을 제공하는 픽셀 그라운딩 대형 멀티모달 모델입니다.

mbzuai-oryx/LLaVA-pp

LLaVA++는 LLaMA-3와 Phi-3 LLM을 통합하여 LLaVA 1.5의 시각적 지시 수행 능력을 향과 학술적 작업 성능을 향상시킵니다.

NVlabs/OmniVinci

OmniVinci는 시각, 오디오, 텍스트를 공동으로 이해하기 위해 특화된 시간적 및 정렬(alignment) 아키텍처를 사용하여 크로스 모달 추론 능력을 향상시킨 오픈소스 멀티모달 LLM입니다.

blendi-remade/falcraft

텍스트 프롬프트에서 fal.ai를 사용해 3D 구조물과 게임 세계 내 실시간 AI 영상 방송을 생성하는 마인크래프트 Fabric 모드입니다.

TetreesEX/TetreesAgent_EX

Tetrees Agent EX는 공개 MCP 계약을 통해 Tetrees EX 마켓플레이스의 AI 팩을 검색, 견적, 실행, 확장, 게시할 수 있는 Node.js SDK/CLI입니다. 구매자, 빌더, 판매자 흐름용 예제 스크립트를 제공하며, 모든 자격 정보를 로컬에 보관합니다.

JavisVerse/JavisDiT

텍스트 프롬프트에서 음성과 영상의 의미적 및 시간적 일치를 보장하는, 음성-영상 동시 생성을 위한 통합 Diffusion Transformer 프레임워크입니다.

caiyuanhao1998/Open-DiffusionGS

확산 노이즈 제거기에 가우시안 스플래터링을 통합한 단일 단계 이미지에서 3D 생성 및 재구성 프레임워크로, 빠르고 확장 가능한 3D 생성을 가능하게 합니다.

open-gigaai/giga-models

GigaModels는 수십 가지 사전 학습된 시각, 확산, 다중모달 모델(예: Grounding DINO, Depth Anything, GigaBrain‑0, Pi0, Cosmos‑Predict2.5)을 통일된 `load_pipeline` API 뒤에 포장하는 오픈소스 파이썬 도구상자입니다. 추론과 학습을 모두 지원하며, 즉시 실행 가능한 스크립트를 제공하고, conda + pip로 설치할 수 있습니다.

huggingface/huggingface-gemma-recipes

Gemma 모델 패밀리와 함께 다중 모달 추론, 파인튜닝 및 RAG를 구현하기 위한 최소한의 레시피와 노트북 모음입니다.

microsoft/XPretrain

XPretrain은 video-text 및 image-text 쌍에 대한 대규모 멀티모달 사전 학습을 위한 코드, 사전 학습된 체크포인트, 그리고 HD-VILA-100M video-language 데이터셋을 제공하는 Microsoft Research 저장소입니다. HD-VILA, LF-VILA, CLIP-ViP, Pixel-BERT, SOHO, SOHO, VisualParsing과 같은 모델들을 포함하며, 각 모델은 최근 컨퍼런스 논문과 연결되어 있습니다.

OliverDOU776/Few-step-probabilistic-glucose-forecasting-from-continuous-glucose-monitoring-and-meal-images

대규모 소스 데이터셋에서 소규모 타겟 데이터셋으로 지식을 전이하는 조건부 리크티파이드 플로우를 사용한 빠른 확률적 예측 도구.

wit-ai/pywit

Wit.ai용 Python SDK로 개발자가 애플리케이션에 텍스트 및 음성 자연어 이해를 쉽게 통합할 수 있습니다.

6551Team/opentwitter-mcp

opentwitter‑mcp는 준비된 도구와 WebSocket 푸시 API를 통해 AI 어시스턴트가 Twitter/X 프로필, 트윗, 검색 및 실시간 팔로워 이벤트를 가져올 수 있는 Python MCP 서버입니다.

wladradchenko/wunjo.wladradchenko.ru

개인정보 보호를 위해 로컬에서 실행되는 페이스 스와핑, 음성 클로닝 및 비디오 생성을 위한 올인원 AI 미디어 도구

erdogant/pca

scikit‑learn의 PCA/SparsePCA/TruncatedSVD를 래핑하고, 사전 제작된 바이플롯, 설명 분산 차트, 이상치 탐지(Hotelling T², SPE/D‑ModX), 특성 중요도 추출, 모델 저장/로드, 분산 정규화 및 새로운 데이터 투영 기능을 추가하여 주성분 분석(PCA)을 간소화하는 Python 라이브러리입니다.

MemeMeow-Studio/MemeMeow

임베딩 모델과 비전 AI를 사용하여 감정이나 장면 설명에 기반해 미ーム을 검색하는 자연어 기반 검색 도구입니다.

tensorflow/model-analysis

TensorFlow Model Analysis (TFMA)는 대규모 및 슬라이스 인식 평가를 위한 라이브러리입니다. 분산 Beam 파이프라인을 실행하고, Jupyter에서 결과를 시각화하며, TFX/Kubeflow 파이프라인과 통합할 수 있습니다.

tensorflow/data-validation

TensorFlow Data Validation (TFDV)는 기계학습 데이터셋의 통계 계산, 스키마 추론, 이상 탐지를 수행하는 확장 가능한 Python 라이브러리입니다. TensorFlow/TFX 파이프라인과 통합되며, Apache Beam을 사용한 분산 처리를 지원하고 데이터 품질을 검사하기 위한 시각적 UI 도구를 제공합니다.

polyaxon/haupt

Haupt는 실행의 출처 정보, 아티팩트/메트릭 스트리밍, 인터랙티브 사전 세션(SSH/tmux), 로컬 뷰어 API, 호스팅된 노트북 공간을 제공하는 Polyaxon 서비스입니다. 이러한 도구들은 기계학습 실험의 관리, 모니터링, 재현을 돕습니다.

tonywu71/colpali-cookbooks

시각 기반 문서 검색을 위한 ColPali 및 ColQwen2 모델의 구현, 파인튜닝, 해석을 위한 노트북 모음.

vincentarelbundock/marginaleffects

`marginaleffects`는 100가지 이상의 통계 및 머신러닝 모델 유형에서 예측, 대비, 한계효과, 가설검정 결과를 추출할 수 있도록 도와주는 R/Python 라이브러리이며, 무료 보조 책이 제공됩니다.

eeeXun/gtt

gtt는 Go 기반의 터미널 UI로, Google, DeepL, Bing, Apertium, LibreTranslate, Reverso, ChatGPT 등 다양한 온라인 서비스를 사용해 텍스트를 번역할 수 있습니다. API 키 설정, 사용자 정의 키 바인딩, 색상 테마, 클립보드 통합, 텍스트 음성 변환을 지원하며, 바이너리, 패키지 매니저, Docker, 또는 소스에서 빌드하여 설치할 수 있습니다.

deeplearning4j/deeplearning4j-examples

Eclipse Deeplearning4J 생태계(DL4J, ND4J, SameDiff, DataVec, RL4J 등)를 사용하여 기본 신경망 학습부터 Spark 분산 및 GPU 가속 학습, 모델 임포트, 안드로이드 배포에 이르기까지 다양한 작업을 수행하는 Maven 기반 자바 예제 프로젝트 모음.

wandb/examples

인기 있는 ML 프레임워크(PyTorch, TensorFlow/Keras, Hugging Face, XGBoost, scikit‑learn 등)에 Weights & Biases 추적 라이브러리를 통합하는 방법을 보여주는 즉시 실행 가능한 스크립트와 Colab 노트북의 커리레이티드 세트입니다. 실행 로깅, 설정, 메트릭, 기울기, 아티팩트 기록을 시연하여, 몇 줄의 코드로 모델의 실험 추적과 재현성을 쉽게 추가할 수 있도록 도와줍니다.

ai-ng/2txt

Next.js와 Vercel AI SDK를 사용하여 GPT-5-nano 모델을 활용해 구축된 빠른 이미지-텍스트 변환 도구입니다.

leamsigc/ShortsGenerator

AI 스크립트 생성, 스톡 영상 조달, TTS 보이스오버, 소셜 미디어 스케줄링을 처리하는 자동화된 파이프라인.

win4r/openclaw-a2a-gateway

OpenClaw A2A Gateway – Node.js 플러그인으로 Google의 Agent-to-Agent v0.3.0 프로토콜을 구현. 제로 컨피그 설치, 자동 피어 발견(DNS-SD/mDNS), 다중 트랜스포트 폴백(JSON-RPC, REST, gRPC), 생물학적 영감 라우팅, 서킷 브레이커 회복성, 베어러 토큰 인증, 파일 전송 도구를 제공.

duolahypercho/fusion-fable

Fusion-Fable은 Opus 4.8, GPT-5.5, Gemini 3.1 Pro 등 여러 LLM을 병렬로 실행하고, Opus 4.8가 독립적인 응답을 심사하여 구조화된 최종 답변을 합성하는 Claude Code 스킬입니다. 슬래시 명령어로 설치되며, 증거 파일을 저장하고 OMC 계획 시스템과 연동하는 반복 계획 모드(`/fusion-plan`)를 포함합니다. 제로 설정 패널(2회 Opus 4.8 실행)은 즉시 사용 가능하며, 더 풍부한 패널은 `codex` 및 `agy` CLI가 필요합니다. 트레이드오프는 토큰 비용과 지연 시간 증가이지만, 결과적으로 고품질이고 감사 가능한 답변을 제공합니다.

nikkigallery/Whimbox

LLM과 이미지 인식을 사용하여 화면 캡처와 입력 시뮬레이션을 통해 게임 Infinity Nikki의 일상 작업 및 세계 탐색을 자동화하는 AI 에이전트입니다.

commaai/commavq

VQ-VAE를 사용한 동영상 압축과 GPT 기반 모델을 활용해 미래 주행 장면을 예측하는 자율주행용 세계 모델 프레임워크 및 데이터셋.

kyegomez/MultiModalMamba

Vision Transformer (ViT)와 Mamba를 통합하여 텍스트, 이미지, 오디오, 비디오 데이터를 동시에 효율적으로 처리하고 해석하는 다중 모달 AI 모델입니다.

ashnkumar/sketch-code

이미지 캡셔닝 아키텍처를 사용하여 손으로 그린 웹 모크업을 HTML 코드로 변환하는 딥러닝 모델입니다.

mlcommons/training

MLPerf Training 벤치마크 스위트의 참조(최적화되지 않은) 구현을 모아둔 리포지토리로, 비전, 언어, 추천, 그래프 모델을 포함합니다. 각 벤치마크에는 모델 코드, Dockerfile, 데이터셋 스크립트, 목표 품질에 도달하는 데 걸리는 시간을 측정하는 훈련 실행 스크립트가 포함됩니다. 벤치마크 제출, 하드웨어 평가, 학습용으로 적합하지만, 실제 세계의 성능용으로는 사용되지 않습니다.

luciddreamer-cvlab/LucidDreamer

LucidDreamer는 단일 이미지와 텍스트 프롬프트에서 도메인 자유로운 3D 가우시안 스플래터링 장면을 생성하는 시스템입니다.

HITsz-TMG/Uni-MoE

Uni-MoE는 텍스트, 이미지, 음성 등 다양한 모달리티 간에 이해 및 생성이 가능한 Mixture-of-Experts 기반의 오미모달 대규모 모델입니다.