livekit/agents
보는 것, 듣는 것, 이해하는 능력을 갖춘 실시간 다중 모달 음성 에이전트를 구축하기 위한 프레임워크로, 작업 스케줄링과 유연한 모델 통합 기능을 내장하고 있습니다.
Pinvou/pinvou-agent
Pinvou Agent는 LLM을 사용하여 작업, 디자인, 코딩을 위한 편집 가능한 산출물을 만드는 크로스 플랫폼 데스크톱 AI 어시스턴트입니다.
zcbacxc/movie-narrator
단일 프롬프트에서 AI 기반 스크립트, 내레이션, 자막 및 렌더링된 비디오를 자동 생성하는 오픈소스 툴킷입니다.
mengxi-ream/read-frog
Read Frog은 LLM과 AI TTS를 사용해 웹 콘텐츠를 번역, 설명, 플래시카드로 변환하는 오픈소스 브라우저 확장 프로그램입니다. 이중 언어 보기, 문맥 인식 번역, 자막 번역, 사용자 정의 AI 작업, 20개 이상의 AI 공급자 지원 기능을 제공합니다.
sbroenne/mcp-server-excel
ExcelMcp는 Windows 전용 서버 및 CLI로, LLM 에이전트가 COM API를 통해 실시간 Microsoft Excel 인스턴스를 제어할 수 있게 하며, Power Query, 피벗테이블, VBA, Python 등 326개의 작업을 실시간 스프레드시트 자동화에 제공합니다.
chengyi-ai/native-subtitle-quote-image
AI 에이전트가 원본 버너 인 자막 또는 사용자 정의 스크립트 기반 오버레이를 사용하여 동영상 프레임을 전문적인 3:4 소셜 미디어 인용 이미지로 변환하는 도구입니다.
mattt/iMCP
iMCP는 macOS 앱(내장 `imcp‑server` CLI 포함)으로 Model Context Protocol을 구현하여 캘린더, 연락처, 위치, 지도, 메시지, 미리 알림 및 날씨를 Claude Desktop, Claude Code, Cursor 및 Amp와 같은 AI 클라이언트를 위한 JSON‑LD 도구로 노출합니다. 사용자는 macOS 권한 대화상자를 통해 서비스를 활성화하고, AI 클라이언트를 연결한 다음 자연어로 질문하면 AI가 로컬에서 실제 개인 데이터를 가져와 요청을 처리합니다. 이 프로젝트에는 Swift SDK 통합, iMessage 데이터베이스를 읽기 위한 사용자 정의 Swift 패키지 및 디버깅 도구(MCP Inspector, Companion)가 포함되어 있습니다.
open-pencil/open-pencil
네이티브로 .fig 파일을 읽고, AI 기반 디자인 자동화 및 커스텀 에디터 개발을 위한 프로그래머블 툴킷을 제공하는 오픈소스 디자인 에디터입니다.
Forget-C/Jellyfish
스크립트 분석부터 에셋 일관성 관리, 비디오 생성에 이르기까지 숏폼 드라마의 전체 파이프라인을 관리하는 엔드 투 엔드 AI 제작 워크스페이스입니다.
tigerowo/infinite-canvas
이미지, 비디오, 오디오 생성을 노드 기반 무한 캔버스에 통합한 오픈소스 다중 모달 AI 워크벤치로, 반복적인 시각적 제작을 가능하게 합니다.
gastownhall/gastown
Gas Town은 여러 Git 프로젝트에서 Claude, Copilot, Codex, Gemini 등 다양한 AI 코드 보조자를 실행할 수 있는 오픈소스 Go 기반 워크스페이스 매니저로, 모든 단계를 Git 기반의 원장에 지속적으로 저장합니다. 중앙 AI 조율자(*Mayor*)가 *convoys*(작업 항목 집합)를 생성하고 워커 에이전트(*Polecats*)에 할당하며, *Witness*, *Deacon*, *Dogs*와 같은 감시 서비스가 시스템의 건강을 유지합니다. 완료된 작업은 Bors 스타일 큐(*Refinery*)를 통해 병합되며, 선택적 연합 레이어(*Wasteland*)를 통해 다른 설치 간에 작업을 공유할 수 있습니다. Homebrew, `go install`, 또는 Docker로 설치 가능하며, `gt` CLI를 통해 rigs, crews, convoys 생성 및 진행 상황 모니터링이 가능합니다.
tandpfun/wardrobe
AI 기반 도구로 사진에서 개별 의류를 추출하여 디지털 워드로브를 만들고, 의상의 모델링된 편집 프리뷰를 생성합니다.
HRuiCcc/RuiC-card-skill
웹을 위해 텍스트 프롬프트나 이미지를 깊이감과 시점 이동 반짝임을 갖춘 인터랙티브 3D 홀로그래픽 카드로 변환하는 자동화 파이프라인.
mnemosyne-oss/mnemosyne
Mnemosyne은 로컬 우선, SQLite 기반의 AI 에이전트용 기억 계층입니다. 세 가지 계층 구조(작업 기억, 에피소드 기억, 시간적 지식 그래프)를 통해 세션 간 지속적 기억을 제공하며, 의미/키워드 하이브리드 검색, 강력한 벡터 압축, Python SDK, CLI, 내장된 MCP 서버를 제공합니다. 개인정보 보호에 중점을 두어, 트래킹 없이 로컬 기반으로 작동하며, 클라이언트 측 암호화된 동기화 기능도 제공합니다.
homeassistant-ai/ha-mcp
ha‑mcp는 Claude, ChatGPT, Gemini 등 LLM 어시스턴트가 Home Assistant 인스턴스를 완전히 읽고 제어하며 구성할 수 있도록 해주는 비공식 Home Assistant Model Context Protocol 서버입니다. HA‑MCP 커스텀 컴포넌트(HACS) 또는 Home Assistant 애드온/Docker/PyPI 서버로 설치하고, 비밀 웹훅 URL을 얻어 AI 클라이언트에 연결하세요. 장치 제어, 자동화/스크립트 생성, 대시보드 편집, 백업, 로그, 보안 정책을 포함한 총 87개의 도구를 제공하여 스마트홈 전체를 자연어로 관리할 수 있습니다.
linyqh/NarratoAI
스크립트 작성, 비디오 편집, 음성 생성 및 자막을 하나의 워크플로우에서 처리하는 영화 및 TV 해설 영상 제작용 자동화 AI 기반 도구.
jjyaoao/HelloAgents
HelloAgents는 다중 에이전트 AI 애플리케이션을 구축하기 위한 프로덕션 수준의 프레임워크를 제공하는 Python 라이브러리입니다. OpenAI 호환, Anthropic, Gemini LLM을 래핑하며, 파일 I/O, 작업 위임, TODO 추적 등의 내장 도구를 제공하고, 컨텍스트 관리, 세션 지속성, 서킷 브레이커, 옵티미스틱 잠금, 관측성, SSE 스트리밍, 비동기 라이프사이클 등의 엔지니어링 기능을 포함합니다. `pip install hello-agents`로 설치하고, `.env` 파일에 API 자격 증명을 설정한 후, 등록된 도구 세트로 `ReActAgent`와 같은 에이전트를 시작할 수 있습니다.
OpenMOSS/MOSS-VL
실시간 및 오프라인 비디오 이해를 위한 오픈웨이트 11B 파라미터 모델 시리즈로, 중단 가능한 스트리밍 상호작용을 지원하는 크로스 어텐션 아키텍처를 특징으로 합니다.
lipku/LiveTalking
LLM과 TTS로 구동되는 실시간 상호작용 스트리밍 엔진으로, 실제와 같은 가상 아바타의 음성과 영상을 동기화합니다.
jianchang512/pyvideotrans
음성 인식, 자막 번역, AI 더빙을 자동화하며 음성 클론과 다중 역할 합성을 지원하는 오픈소스 동영상 번역 도구입니다.
xushengfeng/eSearch
스크린샷, 오프라인 OCR, 번역 및 이미지 검색을 통합하여 화면 정보를 추출하고 활용할 수 있는 크로스 플랫폼 화면 검색 도구입니다.
thesysdev/appless
사용자 요청에 따라 실시간으로 생성되는 라이브 스트리밍 네이티브 모바일 인터페이스를 제공하는 실험적 생성형 UI 운영체제로, 전통적인 앱을 대체합니다.
tisfeng/Easydict
Easydict은 빠른 단어 검색, 번역, OCR을 위한 네이티브 macOS 앱입니다. 언어를 자동 감지하고, 단축키 기반의 여러 입력 모드를 제공하며, 20개 이상의 서비스(전통적인 사전, 클라우드 번역기, OpenAI, Gemini, Claude, Ollama와 같은 LLM 포함)에서 결과를 집계합니다. Homebrew(`brew install --cask easydict`) 또는 수동 다운로드를 통해 설치할 수 있습니다. 오픈소스(GPL-3.0)이며 커뮤니티 기여를 환영합니다.
wiltodelta/remove-ai-watermarks
AI 생성 이미지 및 비디오에서 가시적 라벨, 비가시적 픽셀 워터마크, AI 출처 메타데이터를 제거하는 라이브러리 및 CLI 도구.
vibe-motion/skills
vibe-motion/skills는 AI 에이전트(예: Claude Code)가 다양한 애니메이션 시각 자산—예: 정규자형 프로그레스 바, 피시아이 비디오 효과, 브랜드 런칭 클립, 3D 지구 경로, 레코드 플레이어 애니메이션 등—을 생성할 수 있도록 해주는 플러그인 라이브러리입니다. 전용 렌더링 프로젝트를 복제하고 실행함으로써 가능합니다. `npx skills add vibe-motion/skills`로 설치하고, 스킬을 선택하고 파라미터를 제공하면 GIF/MP4/HTML 출력을 받을 수 있습니다.
umlx5h/LLPlayer
LLPlayer는 Windows 전용 C# 미디어 플레이어로, AI 기반 자막 생성(Whisper ASR), 실시간 번역(클라우드 또는 로컬 LLM), 비트맵 자막용 OCR, 이중 자막 표시, 단어 검색, 온라인 동영상 지원 기능을 제공합니다. 언어 학습자를 대상으로 하며, GPL-3.0 라이선스 하에 오픈소스입니다.
tsunehimatoi/psd2live
레이어드 PSD 파일을 완전히 리깅된 Live2D 모델로 변환하는 자동화된 파이프라인과 데스크톱 앱. 적응형 메시 생성, 자동 디포머 설정, AI 에이전트 통합 기능을 갖춤.
MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark
vLLM을 사용하고 메모리 매핑된 PLE 테이블 및 예측 디코딩을 갖춘, 단일 DGX Spark에서 Qwen3.8-Flash-Next 시각-언어 모델을 배포하는 데스크탑 레시피.
Pan-Chera/Multi-Agent-CAD
자연어로부터 편집 가능한 CAD 부품과 멀티 파트 어셈블리를 생성하는 멀티 에이전트 프레임워크로, 자동 코드 수리와 시뮬레이션 준비된 내보내기를 특징으로 합니다.
ddcat-ai/open-ai-canvas
Open‑AI‑Canvas (영찰)은 오픈소스이고 자체 호스팅 가능한 웹 워크벤치로, 창작자가 텍스트 기반의 개요를 바탕으로 스토리보드, 캐릭터/스타일 라이브러리, AI 생성 이미지, 동영상 및 오디오를 포함한 완전한 영화 자산을 통합된 캔버스, 비동기 작업 큐 및 로컬 AI 에이전트 시스템을 통해 생성할 수 있게 해줍니다.
nolangz/pixel2motion
라스터 로고를 정밀하게 맞춤하고 HTML 기반 모션 전달에 중점을 둔, 깨끗하고 애니메이션화된 SVG 로고로 변환하는 AI 지원 워크플로 및 툴셋.
funstory-ai/BabelDOC
BabelDOC은 LLM(OpenAI 호환 모델)을 사용하여 PDF 과학 논문을 번역하고 이중 언어 PDF를 출력하는 오픈소스 Python 도구입니다. CLI, Python API, 풍부한 PDF 처리 옵션, 용어집 지원, 오프라인 자산 패키징, 로컬 또는 호스팅된 베타 서비스에서 실행 가능합니다.
OSideMedia/higgsfield-ai-prompt-skill
Higgsfield AI용 포괄적인 프롬프트 엔지니어링 라이브러리로 자연어를 프로덕션 준비된 영화적 동영상 및 이미지 프롬프트로 변환합니다.
OpenDCAI/GameFactory-3A
UE5, Unity, Godot, Blender, three.js용 생산 준비 완료된 자산과 엔진별 코드를 코드 에이전트를 사용해 게임 요구사항에서 변환하는 오픈소스 프레임워크입니다.
666ghj/BettaFish
BettaFish(위예)는 오픈소스이자 파이썬 기반의 다중 에이전트 플랫폼으로, 수십 개의 소셜미디어 소스에서 공공 여론을 자동 크롤링, 분석, 보고합니다. 사용자는 채팅형 UI에서 질문을 입력하면, 세 가지 전문 에이전트(Query, Media, Insight)가 데이터를 수집하고, LLM 모더레이터가 지도하는 포럼 엔진에서 논의를 진행하며, 리포트 엔진이 인터랙티브 HTML(또는 PDF/Markdown) 보고서를 생성합니다. 시스템에는 24시간 365일 작동하는 크롤러(MindSpider), 다중 모달 영상/이미지 처리, 파인튜닝된 감성 모델, 사내 데이터 통합 기능이 포함되어 있으며, Docker Compose, Flask 프론트엔드, Streamlit 데모를 제공하며 다른 도메인으로도 확장 가능합니다.
ZSeven-W/openpencil
자연어 프롬프트로 UI 레이아웃을 생성하고 이를 프로덕션 코드로 내보낼 수 있는 오픈소스 AI 네이티브 벡터 디자인 도구입니다.
xinnan-tech/xiaozhi-esp32-server
xiaozhi-esp32 프로젝트를 위한 백엔드 서버로, ESP32 장치가 음성, 시각 및 스마트 홈 제어 기능을 갖춘 AI 어시스턴트가 될 수 있도록 합니다.
OpenBMB/ChatDev
ChatDev 2.0 (DevAll)은 시각적 웹 콘솔 또는 작은 Python SDK를 통해 YAML로 에이전트와 연결을 정의하고, 복수의 LLM 기반 에이전트 워크플로우를 설계하고 실행할 수 있는 오픈소스, 코드 없는 플랫폼입니다. 데이터 시각화, 3D 생성, 게임 개발, 연구 등 사전 구성된 템플릿을 활용할 수 있습니다. 백엔드는 FastAPI, 프론트엔드는 Vue 3이며, Docker/Makefile 지원, 확장 가능한 Python 도구, 연구용 오케스트레이터(Puppeteer, MacNet)를 포함합니다.
HKUDS/RAG-Anything
RAG‑Anything은 다중 모달 검색 증강 생성 시스템을 구축하는 Python 라이브러리입니다. MinerU를 사용해 PDF, Office 파일, 이미지, 표, 수식을 파싱하고, 크로스 모달 지식 그래프를 생성한 후 하이브리드 벡터-그래프 검색으로 관련 정보를 검색한 뒤 LLM에 전달하여 답변을 생성합니다. `pip install raganything`으로 설치하고, `RAGAnythingConfig`로 설정한 후 문서를 인제스트하고 자연어로 질의할 수 있습니다.
modelcontextprotocol/python-sdk
Model Context Protocol(LLM과 도구 간의 통신을 위한 표준화된 API)을 따르는 서버를 구축하고 소비할 수 있는 Python SDK입니다. 함수를 LLM이 사용할 수 있는 도구/리소스로 노출출하는 데코레이터를 제공하며, stdio/HTTP/SSE 전송 방식을 지원하며, CLI를 포함하고 py.sdk.modelcontextprotocol.io에서 문서를 제공합니다.
ant-research/4DAnyone
4DAnyone은 사람의 단일 카메라 영상을 수십 개의 동기화되고 시점 일관성 있는 영상(6~24~48 시점)으로 변환하는 연구용 신경망 모델로, 하류 4D 가우시안 스플래터링 재구성에 사용됩니다. 소비자용 GPU(≤24GB VRAM)에서 작동하며, 빠른 디스틸된 Turbo 버전(5.6배 속도 향상)을 제공하고, 즉시 사용 가능한 추론 스크립트와 nerfstudio 통합도 포함합니다.
antirez/h3.c
Apple Silicon용 MiniMax-H3를 위한 네이티브 Metal 추론 엔진으로, 고급 메모리 및 성능 최적화를 통해 로컬 텍스트-비디오 및 텍스트-오디오 생성을 지원합니다.
snapotter-hq/SnapOtter
로컬 AI를 활용해 이미지, 동영상, 오디오, PDF의 변환, 압축, 처리를 수행하는 200개 이상의 도구를 제공하는 자체 호스팅 파일 처리 스위트로, 개인정보 보호를 우선시합니다.
leejet/stable-diffusion.cpp
이미지 및 비디오 확산 모델을 로컬에서 실행하기 위한 경량의 순수 C/C++ 구현으로, 다양한 하드웨어 백엔드와 모델 아키텍처를 지원합니다.
WEIFENG2333/VideoCaptioner
LLM을 활용해 음성 인식, 자막 최적화, 번역을 수행하는 동영상 자막 처리의 종합 도구입니다.
OpenSenseNova/SenseNova-Skills
SenseNova‑Skills는 오픈소스 기반의 에이전트 기술 모음으로, SenseNova LLM에 이미지 생성, 인포그래픽 제작, 엑셀 분석, 심층 연구, 파워포인트 생성 등의 사무자동화 기능을 추가합니다. OpenClaw 또는 hermes‑agent 런타임에 기술 폴더를 추가하고 SenseNova API를 구성하면, 사용자는 간단한 자연어 요청만으로도 정교한 데이터 기반 보고서와 프레젠테이션을 생성할 수 있습니다.
MoonshotAI/Kimi-K3
Kimi K3는 장기적인 코딩, 심층 연구 및 복잡한 에이전트 지식 작업을 위해 설계된 2.8T 파라미터의 오픈 웨이트 네이티브 멀티모달 MoE 모델입니다.
modelscope/DiffSynth-Studio
소비자용 GPU에서 이미지, 동영상, 음성 생성 모델의 고성능 추론 및 훈련을 가능하게 하는 오픈소스 확산 모델 엔진입니다.