fudan-generative-vision/Hallo-Live

Hallo-Live는 인과적 듀얼 스트림 Diffusion Transformer를 사용하여 디지털 아바타를 위한 동기화된 오디오와 비디오를 실시간으로 생성하는 텍스트 기반 프레임워크입니다.

Lightning-AI/litData

LitData는 Lightning AI의 라이브러리로, S3/GCS/Azure/HF 허브에서 직접 비동기 배치 다운로드로 원시 파일을 스트리밍하거나, 한 번만 데이터셋을 LitData 고유의 청크 기반 바이너리 형식으로 변환하여 PyTorch 학습을 최대 20배 빠르게 합니다. `StreamingRawDataset`는 클라우드 스토리지에서 직접 데이터를 스트리밍하고, `ld.optimize`는 데이터를 최적화하여 재시작 가능하고 샤프링 인식의 고속 스트리밍을 가능하게 합니다. 또한 `ld.map`을 통해 이미지 리사이징, 임베딩 생성 등의 병렬 전처리가 가능하며, PyTorch Lightning, Hugging Face datasets, Lightning Cloud와의 통합도 완비되어 있어 I/O가 버퍼넥이 되는 대규모 ML 프로젝트에 이상적입니다.

ZebangCheng/Emotion-LLaMA

Emotion-LLaMA는 음성, 시각, 텍스트 입력을 전용 인코더와 지시 튜닝을 통해 통합하여 감정 인식과 추론을 목적으로 하는 다중 모달 대규모 언어 모델입니다.

RTGS2017/NagaAgent

NagaAgent는 Windows/macOS/Linux를 지원하는 크로스플랫폼 데스크톱 AI 어시스턴트로, OpenAI 호환 LLM과의 채팅, JSON 블록을 통한 사용자 정의 도구 호출, Neo4j에 저장된 그래프-RAG 메모리, Live2D 애니메이션 아바타, 리프싱크 기능이 있는 음성 합성/인식, 날씨, 웹 검색, 게임 가이드 등 다양한 플러그인을 지원하는 MCP 프레임워크, 포럼과 스킬 마켓을 포함한 커뮤니티 기능을 제공합니다. Electron/Vue 프론트엔드와 Python FastAPI 백엔드로 구성되며, `uv sync` (또는 pip)로 설치 가능하며, AGPL-3.0 + 독점적 상용 라이선스의 이중 라이선스입니다.

microsoft/foldingdiff

계산 단백질 설계를 위한 새로운 단백질 접힘 구조를 생성하는 확산 모델.

HKU-BAL/Clair3

Clair3는 롱리드 시퀀싱을 위한 오픈소스 딥러닝 변이 호출기입니다. 먼저 pileup 기반 신경망으로 빠르게 스캔한 후, 불확실한 위치를 full‑alignment 모델로 정밀하게 검토하여 실행 시간을 합리적으로 유지하면서도 높은 정확도를 제공합니다. CPU, GPU, 애플 실리콘 빌드로 제공되며, Docker, Singularity, Bioconda, 또는 Conda 환경을 통해 설치 가능하며, ONT, PacBio HiFi, Illumina 데이터용 사전 훈련된 PyTorch 모델을 함께 제공합니다.

tin2tin/Pallaidium

Blender Video Editor에 통합된 생성형 AI 영화 스튜디오로, AI 생성된 영상, 음성, 텍스트를 사용하여 전체 영화 제작을 프로토타이핑할 수 있습니다.

Sharrnah/whispering

스트리밍 오버레이 및 게임 내 사용을 위해 설계된 로컬 오픈소스 도구로, 실시간 오디오 전사, 번역 및 OCR을 수행합니다.

jtydhr88/ComfyUI-HY-Motion1

HY-Motion 1.0 기반의 텍스트에서 3D 인간 동작을 생성하는 ComfyUI 플러그인. 프롬프트 최적화 및 GLB, FBX 내보내기 기능을 제공.

InternRobotics/PointLLM

PointLLM은 객체 분류 및 캡션과 같은 작업을 위해 색상 3D 포인트 클라우드를 이해할 수 있도록 하는 멀티모달 대규모 언어 모델입니다.

OpenBMB/VisRAG

텍스트 파싱에 의한 정보 손실을 방지하기 위해 문서를 이미지로 임베딩하고, 다중 이미지 QA에 증거 기반 추론을 사용하는 시각-언어 RAG 파이프라인.

zju3dv/Diffuman4D

Diffuman4D는 희소한 뷰의 비디오로부터 자유 시점 렌더링을 가능하게 하는 고충실도 4D 일관성 인간 뷰 합성용 시공간 확산 모델입니다.

apple-aiml-research/ml-neuman

NeuMan은 단일 영상에서 애니메이션 가능한 인체와 배경 장면을 재구성하는 신경 렌더링 필드 구현체로, 원래 환경 내에서 새로운 시점과 자세의 합성을 가능하게 합니다.

uezo/ChatdollKit

Unity용 3D 가상 보조자 SDK로, 3D VRM 모델을 음성 기능이 있는 챗봇으로 전환하고, 동기화된 발화, 리핑싱크, 자율 애니메이션을 제공합니다.

apple-aiml-research/ml-lito

LiTo는 객체 형상과 시점 의존 외관을 공동으로 모델링하는 3D 잠재 표현 시스템으로, 사실적인 조명 효과를 갖춘 고품질 이미지-3D 생성을 가능하게 합니다.

monatis/clip.cpp

메모리 제약이 있는 장치와 서버리스 배포에 효율적인 추론을 제공하는, 의존성 없는 C/C++ CLIP 구현체.

android/androidify

Gemini API, Imagen, Jetpack Compose를 사용하여 AI 기반 경험을 구축하는 오픈소스 Android 샘플 앱. Android 봇 메이커를 재구성합니다.

Voine/ChatWaifu_Mobile

ChatGPT, 로컬 VITS 음성 합성, 그리고 Live2D 애니메이션을 통합하여 몰입형 캐릭터 기반 AI 동반자를 만드는 Android 애플리케이션입니다.

kyegomez/Gemini

텍스트, 이미지, 오디오를 하나의 아키텍처 내에서 네이티브로 처리할 수 있는 오픈소스 멀티모달 트랜스포머 모델의 구현.

PozzettiAndrea/ComfyUI-UniRig

UniRig와 Make it Animatable (MIA)를 사용하여 ComfyUI에서 3D 캐릭터 메시의 리깅과 스킨닝을 자동화하는 확장 기능입니다.

theopenconversationkit/tock

Tock은 NLP 스택, 대화 흐름 설계를 위한 시각적 스튜디오, Kotlin 기반 DSL(파이썬, Node.js 및 REST 바인딩 포함), 채팅/음성 채널용 사전 구성된 커넥터, 그리고 Docker 기반 배포를 제공하는 오픈소스 대화형 AI 플랫폼입니다.

Angel-ML/angel

Angel은 파라미터 서버 아키텍처를 사용하는 Java/Scala 기반의 분산 기계학습 및 그래프 컴퓨팅 플랫폼입니다. 다양한 전통적인 ML 알고리즘(LR, SVM, GBDT, LDA* 등)과 그래프 알고리즘(PageRank, GCN, GraphSAGE 등)을 지원하며, YARN 또는 로컬에서 실행 가능하며 Spark 통합(Spark on Angel)을 통해 작업 제출이 간편합니다.

facebookresearch/multimodal

CLIP 및 BLIP-2와 같은 모델을 위한 모듈식 구성 요소와 사전 학습된 가중치를 제공하여 최첨단 멀티모달 모델을 대규모로 학습할 수 있는 PyTorch 라이브러리입니다.

mattmireles/gemma-tuner-multimodal

Gemma‑tuner‑multimodal은 macOS 전용 Python 패키지로, Google의 Gemma 모델(3n 및 4시리즈)을 LoRA로 텍스트, 이미지, 오디오 데이터에 대해 미세조정할 수 있습니다. Apple Silicon(MPS)에서 네이티브 실행, GCS/BigQuery에서 대규모 데이터 스트리밍, 워즈드 형 CLI, 실시간 웹 시각화 도구를 제공하며, Core ML 또는 GGUF 추론용으로 병합된 체크포인트를 내보낼 수 있습니다.

flutter-ml/google_ml_kit_flutter

모바일 앱이 디바이스에서 비전, 자연어 및 생성형 AI 기능을 사용할 수 있도록 해주는 Flutter 플러그인 세트입니다.

aws-samples/sample-mobile-ai-assistant

Android, iOS, macOS용 크로스플랫폼 AI 어시스턴트 앱으로, 실시간 채팅, 멀티모달 분석, 다양한 LLM 제공업체를 활용한 즉시 웹 앱 생성을 가능하게 합니다.

Osilly/Vision-DeepResearch

이미지와 비디오를 통해 반복적인 시각적 및 텍스트 검색을 수행하며, 심층 연구를 수행할 수 있는 다중모달 대규모 언어 모델(MLLM) 개발을 위한 프레임워크 및 벤치마크.

PozzettiAndrea/ComfyUI-TRELLIS2

Microsoft의 TRELLIS.2 모델을 구현한 커스텀 ComfyUI 노드로, 단일 이미지에서 PBR 재질을 갖춘 고품질 3D 메시를 생성합니다.

wuxiran/cc-pane

CC‑Panes는 Windows/macOS/Linux용 오픈 소스 데스크톱 앱으로, 여러 AI 코딩 CLI 에이전트를 병렬로 실행, 구성 및 조정할 수 있습니다. 워크스페이스 수준 대시보드, 재사용 가능한 시작 프로필, MCP 기반 오케스트레이션 레이어, 통합 터미널 분할, Git/기록 도구, 계획 표면, 웹/Android 액세스를 제공합니다. 모두 Tauri, xterm.js 및 Rust로 구축되었습니다.

deepmodeling/dpgen

DP‑GEN은 딥러닝 원자간 포텐셜(Deep Potential 모델) 생성을 자동화하는 Python 플랫폼입니다. 구조 샘플링, DFT 계산에 가장 정보가 많은 구조 선택, 모델 재훈련의 동시 학습 루프를 실행하며, HPC 클러스터에서 작업 스케줄링을 처리하고 많은 MD 및 양자 화학 코드와 인터페이스합니다.

vinavfx/ComfyUI-for-Nuke

ComfyUI 노드를 Nuke에 통합하는 API로, VFX 아티스트가 전문적인 합성 소프트웨어 내에서 직접 생성형 AI 워크플로우를 사용할 수 있도록 합니다.

PEPETII/danmuai

비전 모델을 사용하여 실시간으로 화면 콘텐츠를 분석하고, 선택 사항인 음성 합성을 통해 스크롤되는 AI 댓글(danmu)을 생성하는 Windows 데스크톱 어시스턴트입니다.

kkirchheim/pytorch-ood

pytorch‑ood는 PyTorch 기반으로 구축된 진정한 Python 라이브러리로, 분포 외 탐지를 위한 것입니다. 30개 이상의 검출기, 손실 함수, 사전 학습된 모델, 데이터셋, 유틸리티를 통합하고, pytorch‑lightning과 통합되며, 간단한 API와 벤치마크 헬퍼를 제공합니다. `pip install pytorch-ood`로 설치하고, `EnergyBased`와 같은 검출기를 몇 줄의 코드로 바로 사용할 수 있습니다.

Utopai-Research/pai-pro

코드 에이전트와 시각적 캔버스, 그리고 이미지, 비디오, 음성 생성을 위한 통합 미디어 API를 결합한 로컬 우선 AI 영화 제작 환경

elder-plinius/GL4SS

2억 5,200만 년 전부터 서기 3050년까지, 지구상의 모든 장소의 모든 시점의 AI 비주얼을 생성하는 시공간 이미지 및 비디오 엔진입니다.

microsoft/Tutel

T وتعel은 Microsoft의 오픈 소스 고성능 MoE 라이브러리입니다. 동적 병렬 처리, 저정밀도 추론(NVFP4, MXFP4, FP8, BF16), 최대 1M 토큰의 컨텍스트, 비전 확장 기능, 그리고 NVIDIA 및 AMD GPU에서 DeepSeek-V3.2, Kimi-K3, GLM-5.x, Qwen-3, GPT-OSS와 같은 모델을 서비스하는 Docker 이미지를 제공합니다. pip를 통해 Git 저장소에서 설치하거나 소스에서 빌드한 후, 제공된 Docker 컨테이너를 실행하거나 커스텀 MoE 라우팅을 위한 Python API를 사용하십시오.

IDEA-CCNL/Fengshenbang-LM

중국어 사전 학습된 기초 모델의 오픈 소스 생태계와 자연어 이해, 생성 및 멀티모달 작업을 지원하는 프레임워크입니다.

open-ribbi/velocut

AI 통합을 통해 자동 장면 구성과 편집이 가능한 멀티트랙 비디오 편집과 3D 장면 디렉션을 결합한 브라우저 기반 스튜디오입니다.

yan5xu/codexloom

CodexLoom은 자체 호스팅 플랫폼으로, Codex 채팅 에이전트에 내구성 있는 아이덴티티, 프로필, 조직 도구를 추가하여 여러 장치에서 접근 가능하고, 제한된 메시지를 통해 통신하며, Feishu, Slack, Parall과 같은 외부 채팅 플랫폼에 인터페이스 에이전트를 통해 노출할 수 있는 '도메인 에이전트'를 가능하게 합니다. 고급 단일 사용자를 대상으로 UI, CLI, 거버넌스 기능을 제공하며, Elastic License 2.0 하에 배포됩니다.

SkyworkAI/Skywork-R1V

Skywork-R1V는 강화 학습과 시각적 사고의 연쇄(Visual Chain-of-Thought)를 사용하여 복잡한 시각적 논리, 수학 및 물리 작업에서 최첨단 성능을 달성하는 오픈 소스 멀티모달 추론 모델입니다.

datawhalechina/torch-rechub

Torch-RecHub는 30개 이상의 모델, 모듈식 설계, ONNX 내보내기, 여러 하드웨어 백엔드를 지원하는 PyTorch 프레임워크입니다.

OpenImagingLab/AnyRecon

AnyRecon은 동영상 확산 모델을 사용하여 촬영된 시점의 집합에서 임의 시점의 고품질 3D 재구성을 생성하는 3D 재구성 프레임워크입니다.

jd-opensource/JoyAI-Image

이미지 이해, 텍스트-이미지 생성 및 지시 기반 이미지 편집을 통합하며 공간 지능에 초점을 맞춘 통합 멀티모달 파운데이션 모델입니다.

Capsize-Games/airunner

프라이빗하고 로컬 우선인 AI 컴패니언 및 아트 생성 플랫폼으로, 맞춤형 채팅 파트너와 레이어형 크리에이티브 캔버스를 결합합니다.

yuqie6/ProductFlow

AI 기반 시각적 워크플로우를 사용하여 복사 및 이미지 생성을 자동화하는 오픈소스이며 자체 호스팅 가능한 워크스페이스로, 소규모 상점에 적합합니다.

mintdotgg/mint-playground

Mint 자산 파이프라인으로 구축된 인터랙티브 3D 전시실, 게임, 데이터 시각화를 제공하는 오픈소스 Three.js 경험의 컬렉션입니다.

openbezal/rhema

라이브 오디오 피드에서 성경 구절을 실시간으로 AI로 탐지하고 NDI를 통해 방송용 오버레이로 렌더링하는 데스크톱 앱

lucidrains/transfusion-pytorch

텍스트의 다음 토큰 예측과 이미지와 같은 연속 모달리티의 흐름 매칭을 하나의 모델에서 통합하는 PyTorch 구현.