vanloctech/youwee
1,800개 이상의 사이트에서 동영상을 다운로드할 수 있는 오픈소스 GUI로, 통합된 AI 동영상 요약, 자연어 편집, AI 기반 자막 생성 기능을 제공합니다.
morsoli/aimangastudio
스크립트 생성, 스토리보드 작성, 캐릭터 스타일 제어까지를 종합적으로 제공하는 AI 기반 만화 제작 도구.
jeremychone/rust-genai
genai는 OpenAI, Anthropic, Gemini, Ollama, Bedrock 등 26개 이상의 제공업체에서 제공하는 200개 이상의 LLM 모델과 대화할 수 있는 단일하고 사용하기 쉬운 비동기 API를 제공하는 Rust 크레이트입니다. 올바른 네이티브 프로토콜을 자동으로 선택하고, 사용자 정의 OpenAI 호환 엔드포인트, 스트리밍, 도구 호출, 이미지 분석을 지원하며, ChatOptions를 통해 풍부한 설정이 가능합니다. 현재 v0.6가 릴리스되었고, v0.7 베타 버전이 곧 출시될 예정이며, 많은 예제와 문서를 포함하고 있습니다.
X-GenGroup/Flow-Factory
이미지, 동영상, 오디오-비디오 모달리티에 걸쳐 확산 및 플로우 매칭 모델의 온라인 RL과 오프라인 파인튜닝을 위한 통합 프레임워크입니다.
tiiuae/Falcon-Perception
Falcon‑Perception은 Falcon 다중 모달 트랜스포머를 위한 오픈소스 PyTorch/MLX 추론 라이브러리로, 자연어 질의에 따라 객체 탐지, 인스턴스 세그멘테이션 또는 OCR을 수행할 수 있습니다. 고도로 최적화된 페이지 및 배치 엔진, FastAPI 서버, Streamlit UI, Docker/vLLM 배포용 OCR, Colab 노트북을 제공합니다. 270 M 파라미터의 Falcon‑OCR 1.5 모델은 훨씬 더 큰 VLM과 유사한 엔드투엔드 OCR 품질을 제공하면서도 3배 작아 실시간 또는 엣지 배포에 적합합니다.
notepower2k1/CapCap
Faster-Whisper와 다양한 TTS 엔진과 같은 AI 모델을 사용하여 음성 인식, 번역 및 더빙을 자동화하는 Windows용 비디오 현지화 애플리케이션입니다.
dabit3/react-native-ai
실시간 LLM 스트리밍과 이미지 생성을 내장한 크로스플랫폼 모바일 AI 앱을 빌드하기 위한 전단계 프레임워크입니다.
Kazama-Suichiku/Houdini-Agent
Meshy AI를 활용하여 노드 네트워크 생성, VEX/Python 코드 작성, 3D 자산 생성을 자동화하는 SideFX Houdini용 자율형 AI 어시스턴트입니다.
oracle/mcp
LLM 기반 도구가 Oracle Cloud 서비스와 상호 작용할 수 있도록 하는 Model Context Protocol (MCP) 서버의 참조 구현입니다. 다국어(Python, Node.js, Java) 서버, stdio 또는 HTTP 전송, 컨테이너 지원, 그리고 Cline, Cursor, mcphost용 클라이언트 구성 스니펫을 제공합니다.
OpenMOSS/MOVA
MOVA는 텍스트 프롬프트(선택적으로 참조 이미지 포함)에서 동기화된 동영상 + 오디오를 생성하는 오픈소스 모델입니다. 이중 타워형 동영상 오디오 아키텍처를 사용하며, 360p/720p 체크포인트, 추론 스크립트, LoRA 미세조정 파이프라인, 평가 코드, SGLang, ComfyUI 및 호스팅 API와의 통합을 제공합니다.
xandergos/terrain-diffusion-mc
확산 모델을 사용해 매우 다양하고 현실감 있는 지형과 풍경을 생성하는 Minecraft Fabric 모드입니다.
OpenVGLab/OmniLottie
OmniLottie는 사전 학습된 비전‑언어 모델을 사용하여 텍스트, 이미지 또는 비디오 입력으로부터 복잡한 벡터 Lottie 애니메이션을 생성하는 멀티모달 AI 생성기입니다.
valentinfrlch/ha-llmvision
LLM Vision은 멀티모달 대규모 언어 모델(OpenAI, Anthropic, Gemini, Ollama 등)을 사용하여 이미지, 비디오 클립, 라이브 카메라 피드 및 Frigate 이벤트를 분석하는 Home Assistant 통합 기능입니다. 자연어 설명, 식별된 사람/반려동물/물체를 기억하고, 각 분석 결과를 대시보드에 표시하거나 Assist를 통해 조회할 수 있는 타임라인에 저장합니다. HACS를 통해 설치하고, LLM 제공업체를 구성하고, 선택적으로 제공되는 Blueprint를 추가하여 AI 요약 카메라 알림을 받을 수 있습니다.
pwilkin/trellis.cpp
GGML을 사용한 독립형 C++ 구현으로, 런타임 시 Python 없이 이미지에서 텍스처가 적용된 3D 모델을 생성하는 TRELLIS 이미지에서 3D 파이프라인을 제공합니다.
HELPMEEADICE/TE-Speed-MiniMaxH3-OSS
DiT 블록의 잔차 캐싱 메커니즘을 사용하여 ComfyUI에서 MiniMax H3 모델 추론을 최대 45% 가속화하는 사용자 정의 노드입니다.
microsoft/unilm
Microsoft가 제공하는, 텍스트, 비전, 음성, 멀티모달 작업에 걸쳐 대규모 자기지도 사전 훈련을 목표로 하는 포괄적인 기초 모델 및 아키텍처 모음.
oxbshw/watch-skill
동영상, 오디오, 화면 활동을 타임스탬프 기반 증거로 변환하는 인식 및 검증 엔진으로, 결정론적 검증 시스템과 전용 에이전트 워크스페이스를 갖추고 있습니다.
tegnike/aituber-kit
OpenAI, Anthropic, Google Gemini, Ollama, LM Studio 등 다양한 LLM, TTS 엔진, 2D/3D 아바타를 지원하는 인터랙티브 AI 캐릭터(AITuber)를 만드는 올인원 툴킷입니다.
1038lab/ComfyUI-QwenVL
이미지 및 비디오 이해를 위해 Qwen-VL 비전-언어 모델을 통합하는 ComfyUI 확장 기능으로, 듀얼 HF 및 GGUF 백엔드와 GPU 최적화 추론을 특징으로 합니다.
bkingfilm/lapian-notes
로컬에서 작동하는 영화 분석 도구로 프레임과 자막을 추출하여 AI 지원 내러티브 구조 트리, 플롯 스위姆레인, 감정 곡선을 생성합니다.
NVIDIA-BioNeMo/bionemo-agent-toolkit
NVIDIA의 모델과 라이브러리를 사용하여 단백질 접힘, 분자 도킹, 유전체 분석 등의 작업을 수행할 수 있도록 AI 에이전트에 전문적인 생명과학 기술을 제공하는 툴킷입니다.
fangwei123456/spikingjelly
SpikingJelly은 PyTorch 기반의 오픈소스 라이브러리로, 스파이킹 신경망(SNN)의 구축, 학습, 배포를 가능하게 합니다. 뉴런 모듈, ANN에서 SNN로의 변환, 다중 백엔드 가속(torch, CuPy, Triton), 대규모 학습 유틸리티, 뉴로모르픽 데이터셋 로더, 프로파일링 도구, 뉴로모르픽 하드웨어용 내보내기 인터페이스를 제공합니다. Python ≥ 3.11 및 PyTorch ≥ 2.6를 필요로 하며, Open-Intelligence Open Source License 하에 배포됩니다.
facebookresearch/VLM3
VLM³은 텍스트 기반 출력과 데이터 스케일링만을 사용하여 표준 비전 언어 모델(VLM)이 깊이 추정 및 카메라 자세 추정과 같은 3D 비전 작업을 수행할 수 있도록 하는 프레임워크입니다.
xikhar/persona
AI 어시스턴트의 음성 출력에 반응하는 실시간으로 표현력 있는 3D 캐릭터 아바타를 제공하는 크로스 플랫폼 데스크톱 애플리케이션.
sakalond/StableGen
TRELLIS.2와 ComfyUI를 통합하여 텍스트나 이미지에서 3D 메시를 생성하고 기존 모델에 AI 기반 텍스처를 적용하는 Blender 애드온입니다.
katanaml/sparrow
Vision LLMs와 에이전트 워크플로우를 사용하여 송장, 영수증, 명세서를 구조화된 JSON으로 변환하는 기업용 문서 인텔리전스 API-first 플랫폼입니다.
ZJU4HealthCare/HealthGPT
의료 텍스트, 2D 이미지, 3D 볼륨을 통합하는 의료용 멀티모달 대규모 언어 모델 패밀리로, 고도의 의료 이해 및 생성을 가능하게 합니다.
microsoft/Biodiversity
생물다양성 모니터링을 위한 오픈소스 AI 도구 모음으로, 카메라 트랩 이미지, 바이오음향, 항공 영상 및 소나에서 동물 탐지 모델을 제공합니다.
NX-AI/xlstm
xLSTM은 지수 게이팅과 행렬 메모리를 도입한 새로운 순환 신경망 아키텍처로, 대규모 언어 모델(예: 70억 파라미터 모델)을 구현할 수 있게 합니다. 리포지토리는 PyTorch 코드, 커스텀 CUDA/Triton 커널(`mlstm_kernels` 패키지 제공), 단일 파일 70억 파라미터 구현, 설정 유틸리티, 그리고 Hugging Face에 호스팅된 사전 학습된 가중치를 포함합니다. 설치는 conda + pip를 통해 가능하며, NVIDIA GPU(빠른 Triton 커널)에서 작동하며 AMD 또는 Apple Silicon용 백업 옵션도 제공됩니다.
catlog22/maestro-flow
Maestro‑Flow는 자연어 의도를 여러 LLM 에이전트(Claude, Gemini, Codex 등)가 실행하는 풀스택 개발 파이프라인으로 전환하는 TypeScript/Node.js 프레임워크입니다. Ralph 엔진은 의도를 40개 이상의 명령 체인으로 분류하고, '결정' 체크포인트에서 계속 진행, 롤백, 또는 수리 루프 삽입 여부를 동적으로 판단하며, 발견된 패턴을 SQLite 지식 그래프에 자동 저장하여 이후 실행에 주입합니다. 4가지 협업 모드(Delegate, Team, Wave, Swarm), Odyssey 명령어를 통한 장시간 자율 루프, 정확한 리터럴/의미적 코드 검색을 지원합니다. 설치는 `npm i -g maestro-flow`로 진행되며, CLI 및 웹 대시보드 문서가 풍부합니다.
VILA-Lab/FigMirror
FigMirror는 사용자 데이터를 제공된 참조 과학 그림의 스타일로 자동으로 Matplotlib 코드를 생성하는 에이전트 기반 도구입니다.
OFA-Sys/Chinese-CLIP
2억 개의 이미지-텍스트 쌍으로 학습된, 교차 모달 검색 및 제로샷 이미지 분류를 위한 중국어 버전 CLIP 모델입니다.
anysearch-ai/anysearch-mcp-server
AnySearch MCP Server는 실시간 작동하는 MCP 호환 백엔드로, 일반 웹 검색, 수직 도메인 검색, 병렬 배치 검색, URL 콘텐츠 추출을 제공합니다. OpenCode, Claude Code, Cursor, VS Code, Windsurf, Cline 등의 인기 AI 보조 도구 IDE와 간단한 JSON 설정으로 연동 가능하며, API 키 인증을 선택적으로 지원해 레이트 제한을 높일 수 있고, 익명 사용도 가능합니다. README에는 등록 절차, 키 관리, 클라이언트별 설정 스니펫, 그리고 네 가지 도구 엔드포인트(`search`, `get_sub_domains`, `batch_search`, `extract`)에 대한 자세한 설명이 포함되어 있습니다.
Asad-Ismail/MoneyPrinterTurbo-Extended
스크립트 생성, 로컬 음성 클로닝을 통한 음성 합성, 그리고 동기화된 단어 수준 자막이 포함된 관련 영상 클립 매칭을 수행하는 자동 영상 생성 도구.
NoizAI/HelixWorld
HelixWorld는 사용자 움직임에 따라 소리와 시각이 동기화되어 업데이트되는 탐색 가능한 환경을 생성하는 실시간 인터랙티브 오디오-비주얼 월드 모델입니다.
tryonlabs/opentryon
패션 테크놀로지를 위한 오픈소스 AI 툴킷으로, 가상 피팅, 이미지/비디오 생성, 멀티모달 이해를 위한 통합 인터페이스를 제공합니다.
CronusL-1141/AI-company
AI Team OS는 Claude 스타일의 LLM을 자율적으로 작동하는 ‘CEO’로 만드는 오픈소스 플랫폼입니다. 지속적으로 실행되며 전문 에이전트, 작업 벽, 연구 파이프라인, 이중 레이어 메모리 시스템을 조율합니다. FastAPI + React 대시보드는 실시간 워크플로우, 의사결정 추적, 모든 메모에 대한 통합 검색을 표시합니다. 기술적 창업자나 연구 팀이 AI 중심, 자율 운전형 워크플로우를 원할 때 이상적입니다.
om-ai-lab/VLM-R1
VLM-R1은 GRPO를 사용해 R1 스타일 대형 비전-언어 모델을 훈련시키는 프레임워크로, 시각적 그라운딩, 수학, 객체 탐지와 같은 작업에서 추론 및 일반화를 향상시킵니다.
StanfordMIMI/Merlin
Merlin은 CT 스캔용 3D 비전-언어 기반 모델 및 데이터셋으로, CT 스캔과 전자 건강 기록 및 방사선 보고서를 통합하여 의료 분석을 수행합니다.
OpenBMB/MiniCPM-V-Apps
iOS, Android, HarmonyOS용 온디바이스 데모 앱 모음으로, MiniCPM-V 계열의 멀티모달 및 텍스트 모델을 llama.cpp를 통해 완전히 로컬에서 실행할 수 있습니다.
pengchujin/jzsub
여러 플랫폼에서 고화질 동영상을 다운로드하고 GPT를 사용해 이중 언어 자막을 생성 및 내장하는 자동화 도구.
Intent-Lab/VisionClaw
Gemini Live를 사용해 시각과 청각을 인식하고, OpenClaw 통합을 통해 행동을 수행하는 실시간 AI 어시스턴트.
TinyLLaVA/TinyLLaVA_Factory
다양한 LLM, 비전 타워, 커넥터를 지원하는 소규모 대규모 다중모달 모델을 구축하고 훈련하기 위한 모듈화된 코드베이스입니다.
Anionex/agent-vision-toolkit
이미지 Q&A 및 GUI 자동화를 위한 태스크 중심 시각 도구와 원활한 프록시 통합을 통해 텍스트 기반 LLM 에이전트에 시각 능력을 부여하는 툴킷.
fruitbars/simple-one-api
simple‑one‑api는 여러 LLM 프로바이더를 OpenAI 호환 엔드포인트로 통합하고, 용량 인식 키 스케줄링, 4단계 속도 제한, 내장된 React 채팅 UI, 시각적 설정 콘솔, Wails 데스크톱 클라이언트를 제공하는 오픈 소스 Go 게이트웨이입니다. 단일 바이너리, Docker 컨테이너, 또는 데스크톱 앱으로 실행할 수 있으며, 설정은 SQLite에 저장됩니다.
thanhkeke97/RSTGameTranslation
OCR과 LLM을 사용하여 화면의 텍스트와 오디오를 사용자의 언어로 번역하는 Windows 게임용 실시간 화면 번역 도구입니다.
MooreThreads/torch_musa
torch_musa는 Moore Threads GPU용 **MUSA** 백엔드를 추가하는 PyTorch 확장입니다. 표준 PyTorch API를 모방하여 `cuda`를 `musa`로만 바꾸면 됩니다. C/C++ 확장 빌드 도구, **mccl** 백엔드를 통한 분산 학습, 그리고 설치가 쉬운 Docker 이미지를 포함합니다. 또한 torchvision, torchaudio 및 기타 인기 PyTorch 라이브러리의 MUSA 호환 빌드도 제공합니다. 미리 빌드된 wheel에서 설치하거나 MUSA SDK를 설치한 후 소스에서 빌드할 수 있습니다. 프로젝트는 BSD 라이선스입니다.
crisng95/flowboard
Google Flow를 통해 일관된 캐릭터와 제품을 이미지 및 비디오로 구성하기 위해 그래프 기반 접근 방식을 사용하는 로컬 전용 무한 캔버스 워크스페이스.