latent-spaces/brag

Hyperframes를 사용하여 소프트웨어 프로젝트를 음악과 모션이 포함된 짧고 공유 가능한 런칭 비디오로 자동 변환하는 Claude Code 스킬입니다.

TauricResearch/TradingAgents

TradingAgents는 LangGraph 기반의 오픈소스 프레임워크로, 여러 LLM 기반 에이전트(기초, 감성, 뉴스, 기술, 리서처, 트레이더, 리스크, 포트폴리오)를 조율하여 완전한 스택 거래 회사를 시뮬레이션합니다. 수십 가지 LLM 제공자, SEC EDGAR, FRED, Yahoo Finance, 소셜 감성 등의 시점 데이터를 지원하며, 체크포인트 기반 그래프 실행, 지속적 학습을 위한 의사결정 로깅, 종목과 날짜를 기반으로 한 백테스팅 CLI를 제공합니다. 연구용이며 투자 조언이 아닙니다.

wide-trace/open-higgsfield

32개의 다른 AI 모델을 통일된 프롬프트 인터페이스와 사용자 제공 API 키를 통해 이용할 수 있는 오픈소스이며 자체 호스팅 가능한 스튜디오입니다.

ApodexAI/FrontierAgent

FrontierAgent는 자율적인 ReAct 에이전트 또는 병렬 에이전트 팀 워크플로우를 실행할 수 있는 오픈소스 터미널 기반 런타임입니다. 사전 파일 시스템, 실시간 TUI 작업 보드, 비동기 사용자 개입, 연구용 장기 작업을 위한 내장 벤치마크 허브를 제공합니다. `uv`로 설치하고, 어떤 OpenAI 호환 모델 엔드포인트(무료 Apodex-1.1 서비스 포함)를 지정한 후 `--mode react`로 단일 에이전트 또는 `--mode agent_team`로 병렬 에이전트를 실행할 수 있습니다. 프로젝트는 Apache-2.0 라이선스입니다.

spinabot/brigade

Brigade는 자체 호스팅형 멀티에이전트 AI 어시스턴트 프레임워크입니다. Tideline이라는 지속적이고 증거 기반 메모리를 공유하는 에이전트 팀을 조직도 형식으로 구성하고, 터미널 UI, WhatsApp, Slack, Discord, iMessage 등 다양한 채널을 통해 접근할 수 있습니다. 모든 API 키와 데이터는 당신의 머신에 머물며, SaaS 계정이나 텔레메트리가 필요하지 않습니다. Claude, OpenAI, Gemini, 로컬 Ollama 등 원하는 LLM을 연결하고, Composio를 통해 1,000개 이상의 제3자 앱에 연결할 수 있습니다. 기능으로는 스킬, 서브에이전트 팬아웃, cron 스케줄링, 문서/미디어 처리, 선택적 Convex 저장소, MCP 메모리 서버 등이 있습니다. 1줄 스크립트나 npm으로 설치한 후, 온보딩하고 항상 실행되는 게이트웨이를 시작한 후 대화를 시작할 수 있습니다.

nexu-io/open-design

브랜드의 디자인 시스템을 기반으로 코드 에이전트가 웹 프로토타입, 프레젠테이션, 모션 그래픽을 생성하고 렌더링할 수 있는 오픈소스이며 로컬 우선의 디자인 플랫폼입니다.

yi1108/printfilm

템플릿 기반 파이프라인을 통해 스토리보드, 이미지/영상 생성, 음성 녹음까지 자동화하는 오픈소스 AI 스튜디오. 짧은 영상과 연재 만화 제작을 지원합니다.

Comfy-Org/ComfyUI

정밀한 파라미터 제어를 통해 이미지, 동영상, 오디오, 3D 모델 생성을 위한 복잡한 워크플로우를 구축할 수 있는 모듈식 노드 기반 AI 엔진.

docling-project/docling

Docling은 PDF, Word, 슬라이드, 스프레드시트, 전자책, 오디오, 비디오, 이메일, 이미지 및 여러 XML 스키마 등 다양한 문서 형식을 파싱하는 오픈소스 Python 라이브러리입니다. AI 기반 레이아웃 분석, OCR, 시각-언어 모델 이해, 음성-텍스트 변환을 추가하여 통합된 `DoclingDocument`를 출력합니다. 이 문서는 Markdown, HTML, JSON, DocLang, DocTags 등으로 내보낼 수 있으며, LangChain, LlamaIndex, Crew AI, Haystack 또는 커스텀 에이전트에 MCP 또는 REST API를 통해 직접 통합할 수 있습니다. 개인정보가 중요한 데이터에는 로컬에서 실행 가능하며 CLI 및 서비스 모드도 제공되어 RAG 파이프라인, 기업 지식 기반, 금융 또는 법적 문서 처리, 다중 모달 AI 에이전트 구축에 이상적입니다.

higgsfield-ai/higgsfield

higgsfield는 거대한 LLM을 위한 오픈소스 GPU 노드 관리자 및 트레이닝 프레임워크입니다. 노드 할당, ZeRO-3/FSDP 샤딩, 작업 대기열, GitHub Actions 기반 배포를 처리하여, 단순한 Python 데코레이터로 LLaMA-70B와 같은 모델을 클러스터에서 트레이닝할 수 있게 해줍니다.

milind-soni/OpenMausBot

OpenMausBot은 Claude, Codex, Grok 또는 호환 CLI를 사용하는 여러 AI 에이전트를 연락처처럼 관리할 수 있는 데스크톱 채팅 앱입니다. 각 봇은 작은 하네스 서버를 통해 로컬에서 실행되며, 클라우드 또는 로컬 컴퓨터를 제어할 수 있고, Composio를 통해 제3자 앱과 연결할 수 있습니다. UI에는 모델 전환, 위험한 작업에 대한 승인 대화상자, ElevenLabs를 통한 음성 출력, 마크다운 기반 팀 임포트 기능이 포함되어 있습니다. macOS, Windows, Ubuntu에서 작동하며, 외부 서비스를 활성화하지 않는 한 모든 데이터는 로컬에 저장됩니다.

ruvnet/ruflo

Ruflo는 Claude Code/Codex 주변에 완전한 에이전트 실행 계층을 추가하는 오픈소스 프레임워크입니다. 100개 이상의 전문 에이전트, 스웜 조율, 지속적 벡터 메모리, 자기학습 루프, 제로트러스트 페더레이션, 플러그인 마켓플레이스, 멀티모델 채팅용 웹 UI를 제공하며, `npx ruflo init`으로(풀 스택) 또는 Claude Code 플러그인으로(라이트) 설치 가능합니다.

krillinai/OpenCreator

OpenCreator는 Codex 기반의 대화형 에이전트와 멀티모달 콘텐츠 생성(동영상 번역, 다운로드, 썸네일 및 이미지 생성)을 위한 시각적 대시보드를 결합한 오픈소스로 로컬에서 실행되는 AI 워크스페이스입니다. 버전 관리된 워크플로우, 로컬 데이터 저장, 동일한 웹 UI를 기반으로 한 데스크톱 클라이언트를 제공합니다. 다양한 LLM, Whisper, GPT-Image 및 기타 음성/번역 서비스를 지원합니다. 클라우드 전용 플랫폼에 의존하지 않고 AI 지원 미디어 제작을 원하는 크리에이터와 소규모 팀을 위한 설계입니다.

ahujasid/mcp-for-blender

LLM을 Blender에 연결하여 프롬프트 기반 3D 모델링, 장면 조작 및 에셋 통합을 가능하게 하는 MCP 기반 통합입니다.

Anil-matcha/Open-Generative-AI

콘텐츠 필터나 구독료 없이 400개 이상의 모델을 사용하여 이미지, 비디오 및 오디오를 생성하는 무제한 오픈소스 AI 스튜디오입니다.

gzxx-2025/aid-studio

AI 영화, 드라마, 만화 제작을 위해 각본 작성, 스토리보드, 이미지/비디오 생성, 더빙을 단일 워크플로우로 통합한 자체 호스팅 AI 제작 플랫폼입니다.

microsoft/playwright-mcp

Playwright MCP는 LLM 기반 에이전트가 Model Context Protocol을 통해 Playwright 브라우저를 제어할 수 있게 해주는 Node.js 서버입니다. 스크린샷 대신 구조화된 접근성 스냅샷(JSON)을 반환하여 토큰 효율적이고 결정론적인 웹 자동화와 영구적인 브라우저 상태를 가능하게 합니다.

ZJU-REAL/Easel

Easel은 소셜 미디어 크리에이터를 위한 오픈소스 AI 기반 콘텐츠 워크벤치입니다. OpenClaw LLM 에이전트, 계정별 프로필, 113개 이상의 실행 가능한 '스킬'을 결합하여 트렌드 발견, 주제 계획, 텍스트·이미지·오디오·비디오 생성, 7개 중국 플랫폼 직접 게시, 그리고 성과 데이터를 프로필에 피드백하여 지속적으로 개선할 수 있습니다.

lixiaoxiao9888-create/manju-laoli-skill

AI 에이전트를 위한 산업용 AIGC 생성 규칙 베이스로, 'Asset-First' 파이프라인을 통해 스크립트를 일관성 있고 모델에 즉시 적용 가능한 비디오 프롬프트로 변환합니다.

basketikun/infinite-canvas

무한 캔버스, 다중 모달 AI 생성, 에이전트 기반 캔버스 조작을 하나의 워크스페이스에 통합한 오픈소스 AI 이미지 생성 워크벤치.

nilbuild/page-mascot

스프라이트 시트를 사용하여 웹사이트에 인터랙티브한 커서 추적 마스코트를 추가하기 위한 React 컴포넌트 및 AI 기반 도구 세트.

OpenSenseNova/SenseNova-U1

OpenSenseNova의 SenseNova‑U1 시리즈는 NEO‑unify 아키텍처 기반의 오픈소스이며, 네이티브로 통합된 멀티모달 모델(텍스트 + 이미지)입니다. 고품질 4K 이미지 생성, 밀집 텍스트 인포그래픽 생성, 이미지 편집, VQA, 교차 텍스트-이미지 튜토리얼 생성을 지원합니다. 리포지토리에는 학습 코드, 사전 학습된 8 B 파라미터 체크포인트(커뮤니티 양자화 GGUF 파일 포함), 예제 추론 스크립트, 배포 가이드가 모두 Apache 2.0 라이선스 하에 제공됩니다.

Devin-AXIS/deepseek-design

DeepSeek Harness용 네이티브 시각 디자인 시스템으로 AI가 편집 가능한 웹사이트, 프레젠테이션, 비디오를 생성하고 수동으로 세부 조정할 수 있도록 합니다.

chatfire-AI/huobao-drama

대본 생성, 캐릭터 디자인부터 최종 비디오 합성까지 숏폼 드라마 제작을 간소화하는 AI 기반 자동화 제작 플랫폼.

HBAI-Ltd/Toonflow-app

스크립트 작성, 스토리보드 생성에서 최종 영상 생성에 이르기까지 작업 흐름을 자동화하는 AI 기반 워크벤치로, 단편 드라마 제작을 지원합니다.

zenstory-ai/drama-skills

시각적 일관성을 중시하며 아이디어나 소설을 스크립트, 스토리보드, 영상 프롬프트로 변환하는 11개의 에이전트 스킬로 구성된 AI 기반 단편 드라마 제작 워크플로우

alesha-pro/tools

MiniMax H3 비디오-오디오 생성을 위한 최적화된 멀티 GPU 워크플로우와 AI 에이전트를 위한 특수 애니메이션 스킬을 갖춘 로컬 AI 도구 모음입니다.

v-modal/vmodal_sdk_flutter

동영상과 이미지 라이브러리 간에 의미, 발화 또는 이미지 기반의 다중 모달 의미 검색을 통합할 수 있는 Flutter SDK로, 사용자는 의미, 음성 또는 이미지로 순간을 검색할 수 있습니다.

omnigent-ai/omnigent

Omnigent은 Claude Code, Codex, Cursor 등 여러 LLM 코드 에이전트를 하나의 CLI와 웹 UI로 통합하는 오픈소스 메타 하네스로, 장치와 클라우드 사전 환경 간에 에이전트를 실행, 결합, 관리할 수 있으며 내장된 협업 및 정책 기능을 제공합니다.

darkzOGx/youtube-automation-agent

트렌드 조사 및 스크립트 작성부터 비디오 제작, 발행, 그리고 분석 기반 최적화에 이르기까지 YouTube 채널의 전체 라이프사이클을 자동화하는 오픈 소스 AI 에이전트 시스템.

ningzimu/codex-ppt-skill

기사, 보고서, 논문을 이미지 기반 PowerPoint 프레젠테이션으로 변환하는 AI 에이전트 스킬로, 개요를 계획하고 스타일이 적용된 슬라이드를 이미지로 생성한 후 .pptx 파일로 조립합니다.

EverettFish/holo-card-studio

텍스트 또는 이미지를 파라라aks 효과가 있는 인터랙티브한 3D 헬로그래픽 카드로 변환하는 Codex 스킬. Three.js 웹 뷰어와 편집 가능한 Blender 프로젝트를 제공합니다.

xuanyustudio/LocalMiniDrama

스크립트 생성에서 최종 영상 합성까지 다양한 AI API를 사용해 제작 프로세스를 자동화하는 오픈소스이며 로컬 우선의 AI 짧은 드라마 생성기입니다.

alchaincyf/huashu-design

AI 에이전트를 위한 디자인 자동화 기술로, 텍스트 프롬프트를 입력하면 전문적인 인터랙티브 프로토타입, 모션 그래픽, 편집 가능한 프레젠테이션 덱을 생성합니다.

waooAI/waoowaoo

브레인스토밍 어시스턴트와 AI 생성 자산의 정리 및 정제를 위한 시각 캔버스를 결합한 이미지 및 비디오용 AI 크리에이티브 워크스페이스입니다.

Merserk/dlss5-visual-enhancer

NVIDIA RTX GPU용 Windows 애플리케이션으로, DLSS 5 및 RTX Video 기술을 사용하여 이미지, 비디오, 라이브 스트림을 업스케일, 향상, 프레임 보간합니다.

Open-LLM-VTuber/Open-LLM-VTuber

오픈소스 음성 인터랙티브 AI 동반자로, Live2D 아바타와 시각 인식을 갖추고 있으며 완전 오프라인으로 실행되어 사적인 실시간 대화를 가능하게 합니다.

Swayingleaves/novanova-studio

창작 맥락을 유지하기 위해 이미지 및 비디오 생성을 무한 캔버스에 통합한 AI 에이전트 기반의 시각 창작 워크벤치입니다.

yejy53/Editable-Design

Editable Visual Design은 LLM(Codex “Skills” 경유)이 자연어 디자인 요구사항을 독립적인 텍스트, 이미지 및 레이아웃 레이어를 갖춘 완전히 편집 가능한 그래픽(HTML 페이지 또는 PowerPoint 파일)으로 변환할 수 있게 해주는 오픈 소스 툴킷입니다. 연구용 다이어그램을 위한 `paper-fig`, 포스터/인포그래픽을 위한 `editable-design`, HTML을 PPTX로 변환하는 `html-to-pptx` 등 세 가지 스킬을 제공합니다. 이 시스템은 LLM의 디자인 단계를 기록(Agent Design Replay)하고 비주얼 에디터를 제공하여 로컬에서 편집 가능한 AI 생성 초안을 신속하게 제작할 수 있도록 합니다.

ningzimu/image-to-editable-ppt-skill

이미지, PDF, 이미지 기반 슬라이드를 텍스트, 도형, 에셋을 재구성하여 편집 가능한 PowerPoint 프레젠테이션으로 변환하는 멀티 에이전트 AI 기술입니다.

QwenLM/Qwen-MM-Plugins

Qwen 모델용 멀티모달 플러그인 모음으로, AI 에이전트가 이미지, 동영상, 오디오, 3D 파일을 네이티브로 처리하고 Blender 및 FreeCAD 같은 소프트웨어를 제어할 수 있도록 합니다.

techjarves/Portable-Local-Studio

Stable Diffusion, LLM, Whisper, Kokoro TTS를 하나의 하드웨어 가속 데스크톱 인터페이스에 통합한 제로 설정, 오프라인 AI 스튜디오입니다.

bytedance/UI-TARS-desktop

시각적 인식과 정밀한 GUI 상호작용을 통해 데스크톱 애플리케이션 및 웹 브라우저를 자연어로 제어할 수 있게 해주는 멀티모달 AI 에이전트 스택입니다.

buxuku/SmartSub

SmartSub(묘막)은 오픈소스이며 크로스플랫폼 대응 데스크톱 앱으로, 비디오를 다운로드하고 로컬 또는 클라우드 음성 인식(ASR)을 실행하며, 다양한 서비스를 통해 자막을 번역하고, 편집/교정하며, 음성 합성(제로샷 음성 클론 포함)을 수행한 후 최종적으로 자막을 비디오에 하드버닝하거나 마스킹합니다. 오프라인으로 작동하며 GPU 가속도 선택 사항이며, 완전히 무료로 사용할 수 있습니다.

xpzouying/xiaohongshu-mcp

자체 호스팅 가능한 MCP 서버로, AI 어시스턴트가 소홍서에 로그인하고 게시물(이미지 또는 동영상)을 게시하며, 피드 검색, 좋아요/즐겨찾기, 댓글 달기, 사용자 또는 게시물 세부 정보를 가져올 수 있습니다. 바이너리, Docker 이미지, 소스 빌드 중 하나로 사용 가능하며, Claude Code, Cursor, VS Code, Open Code, Cline 등과 통합됩니다.

PurpleDoubleD/locally-uncensored

채팅, 이미지 및 비디오 생성, 코딩 에이전트를 하나의 쉽게 설치할 수 있는 애플리케이션으로 통합한 포괄적인 로컬 AI 스튜디오입니다.

lightningpixel/modly

사용자의 GPU에서 실행되는 AI 모델을 사용하여 사진을 3D 메시로 변환하는 로컬, 오픈소스 데스크톱 애플리케이션입니다.

Tencent/WeMM-Embedding

WeMM‑Embedding는 텍스트, 이미지, 동영상, 시각 문서를 하나의 L2 정규화 벡터로 변환하는 텐센트의 오픈소스 다중 모달 임베딩 세트(2B/4B/9B 파라미터)입니다. "마트료시카" 자르기 기법을 통해 다양한 출력 차원을 지원하며, 🤗 Transformers 및 Sentence‑Transformers용 즉시 사용 가능한 추론 스크립트를 제공하고, vLLM 및 SGLang용 서빙 래퍼도 포함합니다. MMEB‑v2/v3 벤치마크에서 이미지, 동영상, 문서, 텍스트, 에이전트 작업에서 최고 수준의 성능을 기록했습니다. 모델은 Hugging Face에 호스팅되며 Apache 2.0 라이선스로 공개됩니다.