solidSpoon/DashPlayer

영어 학습자를 위한 AI 강화 비디오 플레이어로, 몰입형 언어 습득을 촉진하기 위해 로컬 AI 자막 생성, 문장 분해 및 어휘 도구를 제공합니다.

flyteorg/flyte

Flyte 2는 ML 파이프라인과 AI 에이전트를 정의, 오케스트레이션 및 서빙하기 위한 오픈소스 Python 프레임워크입니다. 일반적인 Python 함수를 태스크로 작성하고, 이를 워크플로우로 구성하며, 로컬 또는 향후 출시될 Kubernetes-native 백엔드에서 실행할 수 있게 해줍니다. 이 프로젝트는 CLI, 개발자 중심의 TUI, 그리고 FastAPI 모델 서빙에 대한 일급 지원을 포함합니다.

Jamailar/Beav

Beav(구 RedBox)는 1인 미디어 크리에이터를 위한 크로스 플랫폼 데스크톱 AI 워크스테이션입니다. 웹/소셜 미디어 자료 수집, 로컬 지식 베이스 저장, AI를 활용한 텍스트/이미지/비디오 생성, 보이스오버 편집, 애니메이션 추가, 게시 일정 관리까지 하나의 UI에서 모두 처리할 수 있습니다. Chrome/Edge 스크레이퍼, 일일 운영 보고서, 재사용 가능한 이미지 템플릿, 멀티트랙 비디오 편집기를 포함하며 외부 에이전트와도 연동 가능합니다. macOS, Windows, Linux를 지원하며 내장 AI 서비스나 OpenAI 호환 엔드포인트를 사용할 수 있고, MIT-NC(비상업적) 라이선스로 배포됩니다.

smixs/visual-skills

전문 영화 제작 및 드라마투르기 원칙을 적용하여 AI 비디오 및 이미지 모델용 고정밀 프롬프트를 생성하는 AI 에이전트 스킬 툴킷.

ErickWendel/localstudio

Web AI와 WebGPU를 사용하여 백엔드 없이 AI 기반 슬라이드 생성, 번역 및 프레젠테이션 도구를 제공하는 브라우저 네이티브, 로컬 우선 슬라이드 편집기입니다.

verl-project/verl-omni

다중 모달 생성 모델을 위한 일반적인 RL 학습 프레임워크로, 확산 모델 및 옴니모달 모델의 빠른 롤아웃과 안정적인 후 학습을 제공합니다.

ModernRelay/omnigraph

Omnigraph는 어떤 S3 호환 객체 스토리지에도 저장 가능한 열 기반의 Lance 형식으로 데이터를 저장하는 Rust 기반의 레이크하우스 스타일 그래프 데이터베이스입니다. AI 에이전트 펌프를 위한 것으로 설계되어 각 에이전트는 고립된 브랜치에 쓰고, 검토 및 Git 스타일 머지로 변경 사항을 제출할 수 있습니다. 쿼리는 그래프 탐색, 벡터 ANN, 전체 텍스트 검색을 하나의 런타임에서 융합하며, Cedar 정책으로 모든 변경 사항에 세밀한 보안을 강제합니다. CLI, Axum HTTP 서버, TypeScript SDK, LLM 호스트용 "MCP" 브리지가 포함되어 있어 에이전트 메모리, 기업 뇌 지식 그래프, 개발 그래프 자동화, 버전 관리된 ML 데이터 레이어를 위한 완전한 스택 솔루션입니다.

NVIDIA/cosmos

로보틱스 및 자율 시스템을 위한 텍스트, 시각, 음성, 행동 시퀀스의 공동 처리 및 생성을 가능하게 하는 오미모달 세계 모델과 도구의 오픈 플랫폼입니다.

TrenTorch/TrenTorch

Tren⚡Torch는 교육용으로 설계된 NumPy 전용 딥러닝 프레임워크로, TinyTorch를 재구현하고 텐서와 자동 미분부터 CNN, 트랜스포머, 양자화, 벤치마킹까지 20개의 단계적 모듈을 추가했습니다. CLI와 역사적 마일스톤 스크립트를 포함해 실습 중심 학습을 지원합니다.

Yuliang-Liu/MonkeyOCRv2

문서 AI를 위한 시각-텍스트 기반 모델로, 다국어 비전 인코더와 문서 파싱 및 이해에 특화된 모델을 제공합니다.

apify/mcpc

mcpc 는 AI 에이전트의 도구, 프롬프트, 작업, 결제를 위한 표준 API인 Model Context Protocol (MCP) 에 대한 완전한 접근을 제공하는 경량이고 크로스플랫폼 CLI 입니다. 에이전트와 스크립트가 Bash 쉘에서 어떤 MCP 작업도 호출할 수 있으며, 지속적 세션, OS 키체인에 저장된 OAuth 2.1, JSON 친화적 출력, grep 기반 동적 도구 탐색, 실험적인 x402 결제 통합을 지원합니다.

nexmoe/VidBee

1,000개 이상의 사이트에서 비디오와 오디오를 다운로드하고, 로컬에서 전사하며, AI를 사용하여 콘텐츠를 요약하고 검색할 수 있는 오픈소스 데스크톱 앱.

kgoedecke/doop

Doop은 인간과 AI 에이전트(Claude Code 또는 내장 Doop 에이전트를 통해)가 HTML 프레임을 실시간으로 함께 편집할 수 있는 오픈소스 실시간 디자인 캔버스입니다. 실시간 멀티플레이어 기능, AI 기반 디자인 작업, 개인 정보 보호 공유 기능을 제공하며, 단일 Docker 명령어 또는 `bun run dev`로 자체 호스팅이 가능합니다. AI 백엔드는 Anthropic(무료 티어) 또는 사용자가 제공하는 OpenAI/ChatGPT 키와 호환됩니다.

869413421/ai-moive-studio

텍스트를 AI 영화와 단편 영상으로 변환하는 무한 캔버스와 에이전트 지원 워크플로우를 갖춘 풀스택 AI 콘텐츠 제작 워크벤치입니다.

Huanshere/VideoLingo

일관된 Streamlit 인터페이스를 통해 음성 인식, 번역, 음성 생성을 자동화하는 AI 기반 동영상 번역 및 더빙 도구입니다.

nicobailon/pi-mcp-adapter

하나의 가벼운 도구를 통해 MCP 서버를 프록시하고, 서버를 지연 로드하며, 필요 시 도구를 동적으로 탐색하여 컨텍스트 창을 절약하는 Pi 에이전트 플러그인

google-deepmind/alphagenome

DNA 서열의 규제 코드를 해독하기 위한 통합 모델과 API. 유전자 발현, 스플라이싱, 크로마틴 특성을 예측합니다.

taylorwilsdon/google_workspace_mcp

Google Workspace MCP Server는 120개 이상의 Google Workspace 기능(Gmail, Drive, Docs, Calendar 등)을 Model‑Client‑Protocol를 통해 노출하는 오픈소스 파이썬 서비스로, Claude나 ChatGPT 같은 LLM 어시스턴트가 Workspace 데이터를 읽고 쓸 수 있도록 합니다. 다중 사용자 OAuth 2.1, 3단계 도구 레벨, 상태 없는 컨테이너 배포, 완전한 CLI를 지원하며, 모든 트래픽은 Google API에 한정되며 MIT 라이선스로 자체 호스팅이 가능합니다.

localai-org/kimodo.cpp

텍스트 프롬프트로부터 캐릭터 및 로봇 동작 애니메이션을 생성하는 NVIDIA Kimodo 모델의 GGML/C++ 구현체입니다.

OpenBMB/MiniCPM-V

모바일 기기에서 효율적으로 배포할 수 있도록 설계된 휴대용 다중모달 LLM 시리즈로, 스마트폰에서 고성능 이미지, 동영상, 실시간 오미모달 상호작용을 가능하게 합니다.

BasedHardware/omi

웨어러블 및 데스크톱 앱에서 화면과 오디오 데이터를 캡처하여 실시간 전사, 요약 및 검색 가능한 AI 채팅을 제공하는 오픈 소스 AI 메모리 시스템입니다.

tracel-ai/burn

Burn은 단일 API로 트레이닝과 추론을 통합하는 Rust 네이티브 딥러닝 프레임워크입니다. PyTorch와 유사한 사용성, 자동 미분, JIT 컴파일을 통한 커널 융합, 그리고 유연한 백엔드 시스템(CUDA, ROCm, Metal, Vulkan, WebGPU, CPU, no-std)을 제공합니다. ONNX 임포트, 가중치 로드, 터미널 트레이닝 대시보드, 임베디드 및 브라우저 환경 지원 도구를 갖추고 있어, 모델을 한 번 작성하면 어디서든 실행할 수 있습니다.

huggingface/diffusers

이미지, 오디오, 3D 분자 구조 생성을 위한 최신 확산 모델을 사용하고 학습할 수 있는 모듈식 라이브러리.

koharu-rs/koharu

Rust로 작성된 ML 기반 만화 번역 도구로, 텍스트 검출, OCR, 번역, 생성 인페인팅을 자동화하여 로컬 우선 워크플로우를 제공합니다.

off-grid-ai/OGAM

Android, iOS, macOS에서 완전히 오프라인으로 작동하는 종합적인 오프라인 AI 솔루션으로, 텍스트, 이미지, 비전 AI 및 음성 전사 기능을 모두 네이티브로 디바이스 내에서 실행하여 완전한 프라이버시를 보장합니다.

icebird1998/scientific-illustrator

Codex 플러그인으로, Microsoft PowerPoint, WPS Presentation 또는 draw.io에서 참조 이미지를 자동으로 재그리하여 편집 가능한 다이어그램으로 변환합니다.

modelscope/FunClip

ASR과 LLM을 사용하여 음성 텍스트, 화자 ID 또는 AI 기반 콘텐츠 분석에 따라 동영상 세그먼트를 추출하는 오픈소스 자동 동영상 클리핑 도구입니다.

bytebase/dbhub

DBHub는 LLM 기반 도구가 PostgreSQL, MySQL, SQL Server, Oracle, SQLite 및 MariaDB를 안전하게 쿼리할 수 있도록 하는 최소한의 토큰 효율적인 MCP 서버입니다. 약 1.4k 토큰 내에서 두 가지 핵심 도구(SQL 실행 및 스키마 검색)만을 제공하며, 선택적 추가 도구, 가드레일 및 내장 웹 UI를 갖추고 있어 AI 에이전트와 실제 데이터베이스 간의 가벼운 가교 역할을 합니다.

datascale-ai/opentalking

LLM, TTS, STT, 비디오 렌더링을 WebRTC를 통해 통합하는 오픈소스 오케스트레이션 프레임워크입니다.

diffusionstudio/lottie

텍스트 프롬프트와 SVG 자산에서 프로덕션 준비 완료된 Lottie 애니메이션을 생성할 수 있는 오픈소스 프레임워크입니다.

Tencent-Hunyuan/Hunyuan3D-WorldClaw

WorldClaw는 대규모, 오픈 월드 3D 환경을 생성하기 위해 설계된 에이전트 방식의 3D 생성 프레임워크입니다.

pollinations/pollinations

텍스트, 이미지, 동영상, 오디오, 3D, 임베딩 생성을 위한 통합적이고 OpenAI 호환되는 오픈소스 생성형 AI 플랫폼 제공.

TencentARC/Pixal3D

Pixal3D는 단일 이미지 또는 여러 뷰에서 피크셀 정렬 백프로젝션을 사용하여 세부적인 기하 구조와 PBR 텍스처를 생성하는 고정밀 3D 자산 생성기입니다.

ahujasid/ableton-mcp

Claude AI를 Ableton Live에 연결하는 Model Context Protocol (MCP) 서버로, 프롬프트 기반 음악 제작, 트랙 조작, 자율적 곡 아렌지먼트를 가능하게 합니다.

liuzhao1225/YouDub-webui

YouTube, Bilibili 또는 로컬 파일에서 동영상을 가져와 음성 인식, 번역, 더빙을 자동화하는 오픈소스 동영상 로컬라이제이션 도구입니다.

neavo/LinguaGacha

LinguaGacha는 OpenAI, DeepSeek, Anthropic, Google 또는 로컬 모델(Qwen2.5-7B 등)과 같은 대규모 언어 모델 API를 사용하여 자막, 전자책, 게임 스크립트를 수십 가지 언어로 한 번의 클릭으로 번역할 수 있는 크로스플랫폼 데스크톱 앱입니다. 자동 용어집 추출, 일괄 번역, 자동 리뷰를 포함한 "AGENT" 워크플로우를 통해 포맷과 코드 스타일을 유지한 채 번역을 수행합니다.

oil-oil/oil-motion

Oil Motion은 디자인 프롬프트와 소스 이미지를 인터랙티브 웹 애니메이션(스크롤 드리븐, 마우스 팔로우, 터치 등)으로 변환하는 AI 에이전트 기술입니다. 키프레임 생성, AI 비디오 생성, 프레임 단위 정리, MP4 또는 WebP 자산으로 패키징을 자동화하고, 바로 삽입 가능한 프론트엔드 코드를 제공합니다.

SamurAIGPT/Generative-Media-Skills

스키마 기반 아키텍처를 통해 AI 에이전트가 전문적인 이미지, 비디오, 오디오를 생성 및 편집할 수 있도록 하는 멀티모달 툴세트 및 MCP 서버.

jnMetaCode/agency-orchestrator

Agency Orchestrator는 단일 문장 또는 작은 YAML 파일에서 다중 에이전트 AI 워크플로우를 자동으로 구성하고 실행하는 npm 기반 도구(CLI + 웹 UI)입니다. 276개의 사전 구축된 중국어(191개의 영어) 역할 정의를 제공하며, 15개의 LLM 제공자(다수의 키 없음)를 지원하고, DAG를 생성하여 병렬 실행, 출력 검증, 공유 가능한 HTML 리포트 생성을 수행합니다. 코드를 작성하지 않고도 "AI 팀"을 활용하고 싶은 개인 창업가, 제품 분석가, 개발자에게 이상적입니다.

diivi/aseprite-mcp

104개의 포괄적인 도구 세트를 통해 AI 어시스턴트가 Aseprite를 완전히 제어하여 전문가 수준의 픽셀 아트와 애니메이션을 생성할 수 있도록 하는 MCP 서버입니다.

jaredrhod/barehands

웹캠 기반의 손 추적 인터페이스로 노트, 이미지 및 3D 모델을 공간적으로 조작할 수 있게 해주며, AI 에이전트의 시각적이고 인터랙티브한 '몸'으로 연결되도록 설계되었습니다.

777genius/agent-teams-ai

Agent Teams AI는 AI 에이전트 팀(Claude Code, Codex, OpenCode, Cursor, SuperGrok, GitHub Copilot, Z.AI, MiniMax, Kiro 등)을 구축하고 모니터링할 수 있는 무료 크로스 플랫폼 데스크톱 앱입니다. 에이전트는 작업을 생성하고, 통신하고, 코드와 터미널 명령을 실행하고, 칸반 보드를 보면서 코드 검토를 수행할 수 있습니다. 이 앱은 토큰 사용량, 예산, 에이전트별 리소스 통계를 추적하고, 내장 터미널, Git 인식 편집기, 다국어 UI, `mcp-server` 구성 요소를 통한 플러그인 지원을 제공합니다.

jd-opensource/JoyAI-VL-Interaction

사용자 프롬프트를 기다리지 않고 1초 미만으로 실시간 비디오 스트림에 능동적으로 반응할 수 있는 8B 규모의 시각-언어 상호작용 모델 및 시스템

IBM/mcp-context-forge

ContextForge는 MCP, A2A, REST 및 gRPC 서비스를 하나의 중앙 관리되는 엔드포인트로 통합하는 오픈소스 게이트웨이입니다. 인증, 레이트 제한, OpenTelemetry 추적, 플러그인 시스템, 관리자 UI를 제공하며, PyPI, Docker 또는 Helm을 통해 실행할 수 있습니다.

google-gemini/gemini-live-api-examples

Gemini Live API의 예제 모음으로, 다중 모달 입력을 지원하는 저지연 실시간 음성 및 비디오 AI 에이전트를 개발할 수 있도록 도와줍니다.

X-PLUG/MobileAgent

시각적 인지 및 계획을 사용하여 모바일, 데스크톱 및 웹 인터페이스 전반의 작업을 자동화하는 멀티 플랫폼 GUI 에이전트 및 파운데이션 모델 제품군입니다.

YouMind-OpenLab/awesome-seedance-2-prompts

CC-BY-4.0 라이선스 하에 6,405개의 커뮤니티 제출 프롬프트를 모은 ByteDance의 Seedance 2.0 다중 모달 동영상 생성 모델용 큐레이된 컬렉션. 피처드 예시, 검색 가능한 웹 갤러리, 기여 가이드 포함.

niedev/RTranslator

Whisper와 NLLB와 같은 기기 내 AI 모델을 사용하는 안드로이드용 오프라인 실시간 번역 앱으로, 개인 정보 보호와 인터넷 없이 대화가 가능합니다.