YouMind-OpenLab/awesome-seedance-2-prompts
CC-BY-4.0 라이선스 하에 6,405개의 커뮤니티 제출 프롬프트를 모은 ByteDance의 Seedance 2.0 다중 모달 동영상 생성 모델용 큐레이된 컬렉션. 피처드 예시, 검색 가능한 웹 갤러리, 기여 가이드 포함.
niedev/RTranslator
Whisper와 NLLB와 같은 기기 내 AI 모델을 사용하는 안드로이드용 오프라인 실시간 번역 앱으로, 개인 정보 보호와 인터넷 없이 대화가 가능합니다.
HUANGCHIHHUNGLeo/claude-real-video
LLM을 위해 의미 있는 키프레임과 스크립트를 추출하는 로컬 비디오 처리 파이프라인으로, 고정 간격 샘플링 대신 지능적인 장면 전환 감지를 사용합니다.
op7418/guizang-yingzao-skill
건축 및 문화 사진을 중국어 타이포그래피와 공간 인식이 통합된 아트 디렉팅된 에디토리얼 포스터로 변환하는 AI 기반 디자인 스킬입니다.
fengshao1227/ccg-workflow
CCG-Workflow는 Node.js CLI로 Claude Code를 여러 코드 생성 모델(Codex, Gemini 등)의 중심 오케스트레이터로 만듭니다. JavaScript 훅을 삽입해 컨텍스트를 유지하고, 지속 가능한 작업 폴더를 생성하며, 내장 전략(예: full-collaborate)을 실행하고, 보안/품질 게이트를 적용하며, Baota 패널에 배포할 수도 있습니다. `npx ccg-workflow`로 설치(풀 모드)하거나, 재사용 가능한 기술만을 위한 Claude 플러그인으로 설치할 수 있습니다.
hgmzhn/manga-translator-ui
AI 모델과 시각적 에디터를 활용해 텍스트 검출, OCR, 번역, 타이포그래피를 자동화하는 종합적인 만화 번역 도구입니다.
jingyaogong/minimind-o
MiniMind‑O는 진정한 오픈소스이며, 초소형(약 0.1 B)의 엔드투엔드 옴니 모델로, 텍스트, 음성, 이미지를 입력으로 받아 텍스트 및 스트리밍 음성 출력을 생성합니다. PyTorch 코드, 훈련 스크립트, 미니/풀 데이터셋, 사전학습된 가중치, 보이스 클로닝 프롬프트, 데모 인터페이스(CLI, Gradio, 휴대폰 모드 UI)를 모두 제공합니다. 리포지토리는 명확히 AI/ML 프로젝트이며, 관련 없는 목록이 아닙니다.
xberg-io/xberg
Xberg는 107개 포맷에서 정제된 구조화된 텍스트(OCR, 테이블, 코드 구조, 선택적 LLM 기반 풍부화 포함)를 추출하는 오픈소스이자 Rust 기반 문서 지능 엔진입니다. 15개 언어의 바인딩, CLI, Docker 이미지, REST API, AI 코딩 어시스턴트용 MCP 서버를 제공합니다.
GMGNAI/gmgn-skills
GMGN Skills는 CLI 명령을 통해 AI 에이전트에게 실시간 멀티체인 온체인 데이터와 밈 토큰 거래 기능을 제공하여, 스크레이핑 없이 자동화된 리서치, 분석 및 실행을 가능하게 합니다.
ooboqoo/interview-coder-cn
화면 공유 소프트웨어에는 보이지 않은 채로 화면 상의 질문을 실시간으로 분석하여 답변을 제공하는 AI 기반 스크린샷 어시스턴트입니다.
taoufik123-collab/claude-watch
Claude가 URL 또는 로컬 파일에서 동영상을 "보는" 능력을 제공하는 기능. 핵심 프레임과 자막을 추출하여 다중 모달 분석을 가능하게 합니다.
zilliztech/memsearch
memsearch는 AI 코딩 어시스턴트 대화를 Markdown으로 기록하고, 하이브리드(BM25 + 밀집) Milvus 인덱스를 구축하는 Python 라이브러리 및 CLI입니다. Claude Code, Codex, DeepSeek Harness, OpenClaw, OpenCode 등 여러 플랫폼에서 플러그인을 통해 크로스플랫폼 검색을 지원합니다. 로컬 ONNX 임베딩을 지원하며, 선택적 Zilliz Cloud 백엔드, 백그라운드 프로젝트/사용자 메모, 자동 스킬 증류 기능도 제공합니다.
argosopentech/argos-translate
Argos Translate는 오프라인 신경망 기계 번역을 위한 오픈 소스 Python 라이브러리입니다. 사전 학습된 OpenNMT 모델을 ".argosmodel" 파일로 다운로드하며, 중간 언어를 통한 피보팅을 지원하고 CTranslate2를 통한 GPU 가속을 제공합니다. Python API, CLI 또는 별도의 데스크톱 GUI를 통해 사용할 수 있습니다. 이 프로젝트는 LibreTranslate 웹/API 서비스의 기반이 됩니다.
nyldn/claude-octopus
Claude Octopus는 Claude Code용 플러그인으로, 다중 LLM 오케스트레이션 계층을 추가합니다. `/octo:*` 명령을 실행할 때까지 대기하다가, 이후 최대 12개의 외부 제공자(Codex, Copilot, Ollama 등)를 호출하여 합의 게이트 리뷰, 적대적 의회, 또는 완전한 '사양에서 소프트웨어' 파이프라인을 실행할 수 있습니다. 수십 개의 페르소나, 슬래시 명령어, 메서드 인식 워크플로우를 포함하며, 지속적 메모리 도구와 통합되어 있으며, Claude Code, Codex CLI, Cursor IDE(MCP 서버를 통해), OpenCode에서 작동합니다.
open-multi-agent/open-multi-agent
Open Multi‑Agent (OMA)는 Node.js 애플리케이션 내에서 동적 LLM 에이전트 팀을 오케스트레이션할 수 있는 TypeScript 프레임워크입니다. 고수준 목표에서 실행 시점에 작업 DAG를 생성하고, 인간의 승인을 선택적으로 실행하며, 전체 추적을 기록하여 검토 또는 재실행이 가능하며, 어떤 LLM 제공자든 지원하고, 도구 게이팅, 예산, OpenTelemetry 통합을 지원합니다.
Ch921-cell/Remember-R1
Remember-R1은 장기간 추론 중 시각 정보를 잊지 않도록 설계된 강화학습 프레임워크입니다.
llm-as-a-verifier/llm-as-a-verifier
llm-as-a-verifier는 AI 에이전트 출력을 위한 세밀하고 확률적인 검증기로 LLM을 전환하는 Python 프레임워크입니다. 후보 경로를 스코어링하고, 효율적인 확률적 피봇 토너먼트를 통해 best-of-N를 선택하며, 단계별로 진행 상황을 추적하고, 다중 모달(이미지) 입력을 지원합니다. 여러 에이전트 벤치마크에서 최첨단 성능을 달성하며, 재현 가능한 평가 스크립트, 캐시 최적화 토큰 사용량 추적기, 그리고 Claude Code 플러그인(TurboAgent)을 통한 원활한 통합을 포함합니다.
jingyaogong/minimind-v
단일 소비자용 GPU에서 단 2시간 만에 65M 파라미터 멀티모달 모델을 학습할 수 있는 Vision Language Model (VLM)의 최소 구현체.
50kg/image-to-slice
AI 기반의 UI 분해 도구로, 평면적인 UI 이미지를 지능적으로 자산을 슬라이싱하고 배경을 인페인팅하여 편집 가능한 Figma 레이어와 HTML/CSS 코드로 변환합니다.
halcyon-video/halcyon-video
Jellyfin, Plex, Emby 등의 미디어 라이브러리용 걷기 가능한 3D 비디오 스토어 인터페이스로, 디지털 카탈로그를 몰입형 물리적 탐색 경험으로 전환합니다.
Blizaine/Maestro
LLM 주도 워크플로우를 사용하여 뮤직 비디오와 단편 영화 제작을 자동화하는 로컬 AI 크리에이티브 스튜디오 및 비디오 편집기입니다.
hero8152/Infinite-Canvas
다양한 AI API와 로컬 ComfyUI 워크플로우를 통합한 시각적이고 무한 캔버스 기반의 공동 생성형 AI 콘텐츠 제작 환경입니다.
JohnKinyanjui/sprite-maker
정체성 유지 AI 애니메이션과 결정론적 Rust 기반 리깅 엔진을 갖춘 로컬 우선 AI 워크벤치. 2D 게임 아트의 생성, 애니메이션화, 내보내기가 가능합니다.
shootthesound/Fizgig
소비자 GPU에서 AI 이미지 및 비디오 모델의 편집 및 복구가 가능한 LoRA 훈련 및 개선 스튜디오입니다.
Adam-CAD/CADAM
AI를 사용해 자연어와 이미지를 OpenSCAD 파라메트릭 3D 모델로 변환하는 오픈소스 텍스트‑to‑CAD 웹 앱입니다.
tover0314-w/opentypeless
macOS, Windows, Linux용 오픈소스 AI 음성 입력 도구로, 앱 인식 음성 인식, 음성 기반 질문-응답, 텍스트 재작성 기능을 제공합니다.
MCPJam/inspector
MCPJam Inspector는 ChatGPT, Claude, Cursor, Copilot 등 챗 기반 AI 제품에서 사용하는 Model‑Chat‑Protocol (MCP)을 구현한 서버를 위한 오픈소스 테스트 및 평가 플랫폼입니다. 웹 플레이그라운드, OAuth 디버거, 서버 디버깅 도구, 재사용 가능한 "스킬", 공유 워크스페이스, 평가 테스트 케이스 실행기, CLI, SDK, CI/CD 통합을 제공하여 16개의 클라이언트 구성과 170개 이상의 LLM 모델에서 레그레션을 포착할 수 있습니다.
csyqlz/VOZEB-PRO
텍스트, 이미지, 비디오, 오디오 생성을 통합한 하나의 상용 준비 완료 SaaS 애플리케이션으로서의 풀스택 AI 콘텐츠 생성 플랫폼.
AgnesAI-Labs/AgnesAI-Models
텍스트, 이미지, 비디오 생성을 위한 고성능 다중 모달 기반 모델에 접근할 수 있는 통합적이고 OpenAI 호환 API 게이트웨이.
penecho/penecho
PenEcho는 Model-Canvas-Protocol (MCP)을 통해 LLM 에이전트와 통합되는 시각적 캔버스 앱입니다. 그림, 주석, 위젯 삽입, AI 에이전트가 캔버스를 읽고 편집하며 피드백을 주고받는 과정을 통해 대화와 시각 작업 간의 밀접한 피드백 루프를 만듭니다. 데스크톱 앱 또는 npm 패키지로 제공되며, 로컬 및 클라우드 호스팅 모델을 지원하고, 버전 관리된 프로젝트, 공유 기능, 내장 어시스턴트를 제공합니다.
oomol-lab/pdf-craft
OCR 및 LLM 기반 번역 기능을 사용하여 스캔된 PDF를 편집 가능한 Markdown 또는 EPUB 파일로 변환하는 Python 라이브러리입니다.
digitalsamba/claude-code-video-toolkit
Claude Code와 통합된 AI 네이티브 비디오 제작 워크스페이스로, 스크립트 작성, 자산 생성, 렌더링을 자동화하여 저비용으로 전문적인 설명형 비디오를 제작합니다.
NomaDamas/CozyClay
AI 비디오 생성을 위한 고정밀 참조 자산을 만들기 위해 장면 블로킹과 캐릭터 포즈를 수행할 수 있는 브라우저 기반 프리비지 스튜디오입니다.
modstart-lib/aigcpanel
리프싱크, 보이스 클로닝, 오디오비주얼 도구를 통합한 AI 디지털 인간용 원스톱 데스크톱 애플리케이션.
Blaizzy/mlx-vlm
MLX‑VLM은 Apple Silicon을 통해 MLX 런타임을 이용해 시각-언어(다중모달) 모델의 추론, 미세조정, 서빙을 가능하게 하는 Python 라이브러리입니다. CLI, FastAPI 서버, Gradio 채팅 UI, 그리고 추측적 디코딩(DFlash, Gemma‑4 MTP, EAGLE‑3)과 같은 고급 가속 기술을 제공합니다. 수십 종의 사전 래핑된 모델, 저비트 양자화, 사고 예산 제어, 그리고 개발을 용이하게 하는 에이전트 스킬 번들을 지원합니다.
QwenLM/Qwen3.8-Flash-Next
Qwen4의 아키텍처 사전 시연으로, 코딩 및 사무 업무에서 높은 효율성을 제공하며 훨씬 낮은 학습 및 추론 비용을 실현하는 멀티모달 MoE 모델입니다.
NVIDIA-NeMo/Nemotron
에이전트 AI를 위한 오픈소스이며 고효율적인 멀티모달 모델과 트레이닝 레시피 패밀리로, 데이터 커리레이션에서 배포에 이르기까지 전체 라이프사이클을 지원합니다.
jordanrendric/claude-video-vision
로컬 또는 클라우드 백엔드를 통해 프레임 추출 및 오디오 트랜스크립트를 수행하여 동영상 이해를 가능하게 하는 Claude Code 플러그인입니다.
Tencent-Hunyuan/HY-World-2.0
텍스트, 이미지 또는 동영상을 입력으로 받아 게임 엔진에서 사용할 수 있는 편집 가능한 3D 자산(메시 및 Gaussian Splattings)을 생성하고 재구성하는 멀티모달 월드 모델 프레임워크입니다.
rome-os/rome
Rome는 인간과 AI 에이전트가 지속적이고 자체 호스팅 가능한 환경에서 협업할 수 있는 오픈소스 '에이전트 OS'입니다. **Rome Apps** — git 추적된 패키지로, 액션, 에이전트, 스킬, UI, 데이터를 포함하여 단일 채팅을 넘어서는 기능을 유지합니다. Docker/Electron을 통해 로컬에서 실행하거나 프리뷰용 Rome Cloud를 사용하고, 제공된 SDK로 앱을 개발하며 앱 스토어를 통해 공유할 수 있습니다. 플랫폼은 단순한 모델 프롬프트를 넘어서 조합 가능하고 재사용 가능한 소프트웨어에 초점을 맞추며, 지속적 에이전트 서비스와 개인용 소프트웨어 플랫폼 사이의 위치를 차지합니다.
ahujasid/camera-to-blender
AI를 사용하여 현실 세계의 물체를 사진으로 찍어 3D 모델로 변환하고 Blender에 자동으로 가져오기하는 도구입니다.
WecoAI/aideml
AIDE ML은 머신러닝 파이프라인을 자동으로 작성, 디버깅 및 최적화하기 위해 LLM 가이드 트리 탐색 에이전트를 구현한 오픈 소스 Python 라이브러리입니다. 사용자는 자연어로 데이터셋, 목표 및 평가 메트릭을를 설명합니다. 에이전트는 코드를 반복적으로 생성, 평가 및 메트리를 최대화할 때까지 탐색 트리를 가지치기합니다. 이 패키지는 CLI, Streamlit UI, HTML 시각화 및 모든 OpenAI 호환 LLM(로컬 Ollama 모델 포함)과 작동합니다.
mizorewww/course2md
음성 인식을 사용하여 YouTube, Bilibili 및 로컬 비디오를 그림이 첨부된 Markdown 또는 HTML 노트로 변환하는 도구.
GenielabsOpenSource/spine-animation-ai
Spine 2D용 AI 기반 도구 세트로, 캐릭터 리깅, 자산 배치, 원시 이미지에서의 애니메이션 생성을 자동화합니다.
alibaba/lumenx
스크립트 분석, 자산 생성, 구성까지 통합된 파이프라인을 통해 스크립트를 완성된 영상으로 변환하는 AI 네이티브 모션 만화 및 영상 제작 플랫폼입니다.
anymouschina/TapCanvas
스크립트, 자산, 스토리보드를 추적 가능한 워크플로우에 통합하는 에이전트 네이티브 무한 캔버스로 AI 영화 및 멀티모달 콘텐츠 제작을 가능하게 합니다.
raojiacui/prompt-lens
기존 동영상을 역설계하여 프롬프트와 스크립트를 추출해 성공적인 AI 동영상 스타일을 재현하고 반복 개선할 수 있도록 도와주는 AI 동영상 분석 도구입니다.
laravel/mcp
Laravel MCP는 AI 클라이언트가 표준 프로토콜을 통해 Laravel 앱의 데이터와 로직에 접근할 수 있도록 해주는, 미리 준비된 Model Context Protocol (MCP) 서버를 제공하는 Laravel 패키지입니다.