J3n5en/EnsoAI

EnsoAI는 Electron 기반의 데스크톱 워크벤치로, Git worktree 관리와 지속적인 AI 에이전트 세션(Claude, Gemini, Codex 등)을 결합합니다. 내장된 Monaco editor, 시각적 Git UI, 3-way merge 도구, 그리고 원클릭 IDE 브릿지 기능을 제공하여, 개발자가 여러 브랜치를 병렬로 작업하면서 각 브랜치마다 전용 LLM 컨텍스트를 누릴 수 있도록 합니다.

tensorflow/java

TensorFlow‑Java는 Maven에 게시 가능한 Java/JVM 바인딩을 제공하며, 저수준 JNI 래퍼(`tensorflow‑core`), 고수준 신경망 API(`tensorflow‑framework`), 독립형 ndarray 라이브러리를 포함합니다. Linux(x86_64, arm64) 및 macOS(Apple Silicon) 바이너리를 지원하며, 선택적 GPU 빌드도 가능하며 표준 자바 빌드 도구와 통합됩니다.

mistralai/client-python

Mistral AI의 클라우드 API(채팅, 임베딩, 오디오, 파일, 에이전트 등)용 공식 Python SDK. `pip`/`uv`/`poetry`로 설치하고 `MISTRAL_API_KEY`를 설정한 후, `client.chat.complete(...)`를 동기 또는 `asyncio`로 호출할 수 있습니다. Azure 및 GCP 래퍼, 스트리밍, 페이지네이션, 재시도 등도 지원합니다.

nextcloud/recognize

로컬 AI 모델을 사용하여 사진, 동영상, 음악을 자동으로 분류하는 Nextcloud용 스마트 미디어 태깅 앱

inclusionAI/Ming

Ming-flash-omni 2.0은 텍스트, 이미지, 오디오, 비디오의 다중 모달 인식과 생성을 하나의 MoE 기반 아키텍처에서 통합하는 오픈소스 오미니MLLM입니다.

cgnomads/GSOPs

SideFX Houdini용 플러그인으로, VFX 제작을 위한 가우시안 스플래터링 시나리오의 가져오기, 편집, 애니메이션을 위한 포괄적인 도구 세트를 제공합니다.

sambanova/bloomchat

BLOOMChat은 오픈소스 BLOOM 모델에서 파인튜닝된 1760억 파라미터의 다국어 챗 LLM입니다. 리포지토리는 데이터 준비, 토크나이제이션, SambaNova의 RDU 하드웨어용 학습 스크립트를 포함하며, Hugging Face의 Bloom 추론 코드를 사용한 GPU 추론에 대한 상세한 지침도 제공합니다. 연구자와 개발자가 모델을 재현하거나 실행하고자 하는 진정한 대규모 LLM 프로젝트입니다.

remyxai/VQASynth

시각-언어 모델의 3D 공간 추론 및 거리 추정 능력을 향상시키기 위해 이미지 데이터셋을 공간 VQA 데이터셋으로 변환하는 파이프라인.

smartscanapp/smartscan-android

온디바이스 처리와 자동 미디어 그룹화를 사용하여 이미지와 동영상을 검색 가능한 개인 지식 기반으로 변환하는 안드로이드 앱.

AIGeeksGroup/3D-R1

3D-R1은 합성 CoT 데이터와 강화학습을 통해 공간 추론과 장면 이해를 향상시키는 일반화 3D 비전-언어 모델입니다.

kozistr/pytorch_optimizer

PyTorch와 호환되는 라이브러리로, 100개 이상의 연구용 옵티마이저, 여러 학습률 스케줄러 및 손실 함수를 단일하고 일관된 API를 통해 제공하며, 저정밀도 훈련을 위한 선택적 통합 기능을 지원합니다.

OmniCustom-project/OmniCustom

OmniCustom은 참조 입력과 텍스트 프롬프트를 기반으로 특정 시각적 정체성과 목소리 톤을 유지하는 동기화된 비디오를 생성하는 통합 오디오-비디오 생성 프레임워크입니다.

kyegomez/ScreenAI

사용자 인터페이스와 인포그래픽을 이해하도록 설계된 ScreenAI 비전-언어 모델의 구현.

Cerlancism/chatgpt-subtitle-translator

OpenAI ChatGPT API(또는 호환 서비스)를 사용하여 SRT 자막 파일을 줄 단위로 번역하는 Node.js CLI/Web UI. 타이밍을 유지하고, 배치 처리, 구조화된 JSON 출력, 프롬프트 캐싱, 선택적 모더레이션, 고급 다단계 '에이전트' 모드를 지원합니다.

HUANGLIZI/LViT

LViT는 언어와 시각 변환기를 결합하여 CT 스캔 및 기타 의료 영상에서 의료 영상 세그멘테이션의 정확도를 향상시키는 다중 모달 프레임워크입니다.

MME-Benchmarks/Video-MME-v2

세 단계의 점진적 난이도 스케일과 그룹화된 비선형 점수 매기기를 사용하여 MLLM에서의 동영상 이해 능력과 진정한 시간적 추론 능력을 평가하는 견고한 벤치마크입니다.

software-mansion-labs/private-mind

클라우드 의존 없이 완전히 오프라인으로 작동하는 모바일 AI 앱. 기기 내에서 비밀스럽고 개인적인 채팅, 문서 분석, 다중 모달 상호작용을 가능하게 합니다.

VrchStudio/comfyui-web-viewer

ComfyUI용 커스텀 노드 컬렉션으로, 스트리밍 및 MIDI, OSC, 게임패드와 같은 외부 제어를 통합하여 실시간 인터랙티브 AI 아트를 가능하게 합니다.

ixaxaar/pytorch-dnc

PyTorch 라이브러리로 Differentiable Neural Computers (DNC), Sparse DNC (SDNC), Sparse Access Memory (SAM)를 구현. 설치 지침, API 사용법, 디버깅 지원, 예제 학습 작업(복사, 덧셈, argmax) 포함.

tianclll/Ace-Translate

개인정보 보호에 중점을 둔 오프라인 문서 번역 도구로, 로컬 LLM과 OCR을 사용하여 다양한 파일 형식을 번역하면서 원래 레이아웃을 유지합니다.

PipeNetwork/kimi-k3-mlx

Apple Silicon에서 실행 가능한 Moonshot의 Kimi-K3 멀티모달 MoE 모델의 MLX 포트로, 스트리밍 컨버터와 REAP 프리닝을 포함합니다.

pipecat-ai/pipecat-client-web

Pipecat 프레임워크로 구축된 음성 및 멀티모달 AI 애플리케이션과 연결하고 상호작용하는 웹 클라이언트 SDK 및 React 라이브러리.

facebookresearch/mmf

MMF는 시각 및 언어 멀티모달 연구를 위한 모듈형 PyTorch 기반 프레임워크로, 최첨단 모델의 참조 구현과 분산 학습을 위한 도구를 제공합니다.

om-ai-lab/VLM-FO1

VLM-FO1은 일반적인 추론 능력을 저하시키지 않으면서 세밀한 인지 및 공간 인식을 강화하는 Vision-Language Model용 플러그 앤 플레이 모듈입니다.

OpenEnvision/Awesome-Multimodal-Modeling

Awesome‑Multimodal‑Modeling은 커뮤니티가 큐레이팅한 "아워소 리스트"로, 다중 모달 AI 모델을 조사합니다. Traditional, MLLMs, Unified, Native의 네 가지 명확한 패밀리를 정의하고, 아키텍처적 차이를 설명하며, Hugging Face의 오픈소스 모델 컬렉션에 링크합니다. 급속도로 변화하는 다중 모달 환경을 구조적으로 이해해야 하는 연구자와 엔지니어를 위한 리포지토리입니다.

Sharrnah/whispering-ui

오디오 스트림 및 게임 내 이미지의 실시간 전사 및 번역을 가능하게 하는 Whispering Tiger 애플리케이션용 네이티브 Windows UI입니다.

ardha27/AI-Waifu-Vtuber

음성 인식, LLM 및 TTS를 통합하여 라이브 스트리밍 및 개인용 대화형 가상 캐릭터를 생성하는 AI 기반 VTuber 어시스턴트입니다.

tongjingqi/Thinking-with-Video

비디오 생성 모델이 복잡한 시각적 및 텍스트 추론 과제를 해결하는 능력을 평가하는 새로운 멀티모달 추론 패러다임 및 벤치마크(VideoThinkBench).

AceDataCloud/Nexior

Nexior는 MIT 라이선스를 따르는 Vue 기반 앱으로, 40개 이상의 채팅, 이미지, 오디오, 비디오 AI 모델을 단일 자체 호스팅 가능한 UI로 통합합니다. 1클릭 Vercel 또는 Docker 배포, BYOK 또는 단일 AceData 키, 내장된 사용자 계정, 결제 및 추천 메커니즘을 제공하여 AI 제품용 즉시 사용 가능한 SaaS 스타터로 활용 가능합니다.

awekrx/ChatGPT-MidJourney-prompt

간단한 텍스트 힌트를 기반으로 MidJourney 이미지를 위한 상세하고 창의적인 프롬프트를 자동으로 생성하는 Python 라이브러리입니다.

HorizonWind2004/reconstruction-alignment

통합 다중모달 모델을 위한 자기지도 후속 훈련 방법으로, 모델이 자신의 시각적 특징에서 이미지를 재구성하도록 훈련함으로써 이미지 생성 및 이미지 편집을 향상시킵니다.

Licoy/GoAmzAI

개인과 기업을 위한 텍스트, 이미지, 비디오, 음악, PPT 생성을 통합 관리 시스템으로 통합한 프라이빗 멀티모달 AIGC 플랫폼입니다.

a616567126/GPT-WEB-JAVA

사용자 관리 및 결제 시스템을 내장한 상용 AI 서비스로, GPT, Midjourney, Stable Diffusion를 통합한 자바 기반 웹 플랫폼입니다.

lone-cloud/gerbil

자신의 하드웨어에서 로컬 텍스트 및 이미지 생성을 실행하는 크로스플랫폼 데스크톱 애플리케이션으로, 통합 모델 검색 및 다양한 GPU 가속기를 지원하는 기능을 제공합니다.

SkyworkAI/UniPic

이미지 편집, 생성 및 이해를 위한 통합 멀티모달 모델 시리즈로, 고속 멀티 이미지 편집 및 자기회귀 모델링을 특징으로 합니다.

noahgsolomon/brainrot.js

Groq, OpenAI, Speechify를 활용해 유명인 음성 클론과 생성된 콘텐츠를 결합한 AI 생성 비디오를 자동으로 만드는 도구.

Fabric-Project/Fabric

macOS에서 인터랙티브 3D 그래픽, 이미지/비디오 처리, AI 강화 비주얼의 빠른 프로토타이핑을 위한 비주얼 노드 기반 크리에이티브 코딩 환경.

askui/python-sdk

비전 기반 자동화를 사용하여, 취약한 UI selector 대신 AI agent가 데스크톱 및 모바일 기기를 제어할 수 있게 하는 Python SDK입니다.

IliasHad/edit-mind

전사와 시각 분석을 통해 비디오를 인덱싱하고, 자연어 의미 검색을 가능하게 하는 로컬 비디오 지식 베이스입니다.

nv-tlabs/XCube

XCube는 계층적 잠재 확산(hierarchical latent diffusion)과 VDB 데이터 구조를 사용하여 정교한 3D 오브젝트와 대규모 장면을 생성하는 고해상도 희소 3D 복셀 그리드용 생성 모델입니다.

FoundationVision/Liquid

Liquid는 외부 시각 임베딩 없이 시각 이해와 이미지 생성을 단일 LLM에 통합한 통합 자기 회귀 멀티모달 생성기입니다.

WHU-USI3DV/VistaDream

VistaDream은 생성된 새로운 뷰 간의 일관성을 보장함으로써 단일 뷰 이미지만으로 고품질 3D 씬을 재구성하는 트레이닝 프리 프레임워크입니다.

OpenDCAI/OpenWorldLib

고급 월드 모델을 위한 통합 코드베이스 및 프레임워크로, 비디오 생성, 3D 장면 생성 및 시각-동작 추론을 위한 다양한 오픈소스 연구를 통합합니다.

livekit/python-sdks

LiveKit Python SDK는 LiveKit 방에 참여하고, 비디오-오디오 트랙을 공유/수신하며, RPC 호출을 실행하고 하드웨어 코덱을 제어할 수 있는 비동기 클라이언트 도구를 제공합니다. 보조 패키지 `livekit-api`는 방 생성, 토큰 생성, SIP, 에그레시 등 LiveKit 서버 REST 엔드포인트를 래핑하며, LiveKit Agents와 통합하여 STT, LLM, TTS 모델을 결합한 음성 AI 봇을 구축할 수 있습니다.

ChilloutCharles/BrainFlowsIntoVRChat

생체 센서에서 나오는 EEG 및 생체 데이터를 OSC 파라미터로 변환하여 VRChat에서 뇌 제어 아바타 애니메이션과 효과를 가능하게 하는 도구입니다.

Nutlope/make-comics

Google Flash Image 2.5와 Qwen3 80B를 사용하여 스토리, 캐릭터, 패널을 AI로 생성하는 AI 기반 만화 제작 도구입니다.

vual/lobe-chat-pro

Lobe Chat Pro는 오픈소스이며 셀프호스팅 가능한 AI 채팅 플랫폼(lobe‑chat의 포크)으로, 완전한 관리자 콘솔, 사용자/그룹 관리, 다중 벤더 모델 가격 설정, 결제 통합(WeChat, Stripe 등), 이미지, 음악, 동영상 생성을 위한 멀티모달 "무한 캔버스" 패널을 추가했습니다. Docker를 통해 세 가지 형태로 배포 가능: 전체 백오피스, 로그인 있는 게이트웨이 전용, 로그인 없는 게이트웨이 전용.

GitHpriyanshu23/Smart-Plant-Doctor

ESP32를 통한 실시간 환경 센싱과 이미지 기반 질병 탐지, Gemma 4 기반 케어 어시스턴트를 결합한 AI 및 IoT 식물 건강 플랫폼.