ruvnet/ruflo
Ruflo는 Claude Code/Codex 주변에 완전한 에이전트 실행 계층을 추가하는 오픈소스 프레임워크입니다. 100개 이상의 전문 에이전트, 스웜 조율, 지속적 벡터 메모리, 자기학습 루프, 제로트러스트 페더레이션, 플러그인 마켓플레이스, 멀티모델 채팅용 웹 UI를 제공하며, `npx ruflo init`으로(풀 스택) 또는 Claude Code 플러그인으로(라이트) 설치 가능합니다.
nexu-io/open-design
브랜드의 디자인 시스템을 기반으로 코드 에이전트가 웹 프로토타입, 프레젠테이션, 모션 그래픽을 생성하고 렌더링할 수 있는 오픈소스이며 로컬 우선의 디자인 플랫폼입니다.
ApodexAI/FrontierAgent
FrontierAgent는 자율적인 ReAct 에이전트 또는 병렬 에이전트 팀 워크플로우를 실행할 수 있는 오픈소스 터미널 기반 런타임입니다. 사전 파일 시스템, 실시간 TUI 작업 보드, 비동기 사용자 개입, 연구용 장기 작업을 위한 내장 벤치마크 허브를 제공합니다. `uv`로 설치하고, 어떤 OpenAI 호환 모델 엔드포인트(무료 Apodex-1.1 서비스 포함)를 지정한 후 `--mode react`로 단일 에이전트 또는 `--mode agent_team`로 병렬 에이전트를 실행할 수 있습니다. 프로젝트는 Apache-2.0 라이선스입니다.
EverettFish/holo-card-studio
텍스트 또는 이미지를 파라라aks 효과가 있는 인터랙티브한 3D 헬로그래픽 카드로 변환하는 Codex 스킬. Three.js 웹 뷰어와 편집 가능한 Blender 프로젝트를 제공합니다.
Comfy-Org/ComfyUI
정밀한 파라미터 제어를 통해 이미지, 동영상, 오디오, 3D 모델 생성을 위한 복잡한 워크플로우를 구축할 수 있는 모듈식 노드 기반 AI 엔진.
Anil-matcha/Open-Generative-AI
콘텐츠 필터나 구독료 없이 400개 이상의 모델을 사용하여 이미지, 비디오 및 오디오를 생성하는 무제한 오픈소스 AI 스튜디오입니다.
dramaclaw/dramaclaw
노드 기반 캔버스와 구조화된 제작 파이프라인이라는 듀얼 모드 워크플로우를 사용하여 대본을 완성된 영화로 변환하는 소스 공개 AI 드라마 제작 파이프라인.
ahujasid/camera-to-blender
AI를 사용하여 현실 세계의 물체를 사진으로 찍어 3D 모델로 변환하고 Blender에 자동으로 가져오기하는 도구입니다.
yejy53/Editable-Design
프롬프트를 편집 가능한 구조화된 시각적 디자인으로 변환하는 코딩 에이전트 기반 프레임워크로, 평면 이미지가 아닌 HTML과 시맨틱 레이어를 사용합니다.
OpenDCAI/GameFactory-3A
다수의 게임 엔진을 대상으로 코드 에이전트를 사용하여 게임 요구사항을 생산 준비 완료된 자산과 엔진 호환 코드로 변환하는 오픈소스 프레임워크입니다.
OpenSenseNova/SenseNova-U1
SenseNova‑U는 텍스트에서 이미지 생성, 이미지 편집, VQA, 번갈아 생성을 내장형으로 처리하는 오픈소스 8 B 파라미터 통합 다중모달 모델 가족(기본 U1 및 U1.5)입니다. NEO‑unify 아키텍처 기반으로 별도의 시각적 인코더/VAE를 제거하여 고해상도 4K 생성, 강력한 인포그래픽 렌더링, 효율적인 추론(LoRA 및 커뮤니티 제공 8비트 GGUF 양자화 포함)을 제공합니다. 저장소에는 학습 코드, 추론 스크립트, 벤치마크, 배포 가이드가 모두 포함되어 있으며, Apache 2.0 라이선스 하에 배포됩니다.
Tencent/WeMM-Embedding
텍스트, 이미지, 비디오, 시각 문서를 통합된 표현으로 수학적 벡터(임베딩)로 제공하는 유니버설 멀티모달 임베딩 모델 패밀리로, 고성능 크로스모달 검색을 가능하게 합니다.
Merserk/dlss5-visual-enhancer
로컬 Gradio 인터페이스를 통해 이미지와 비디오에 NVIDIA DLSS 5 신경망 렌더링 및 프레임 생성을 적용하는 Windows 애플리케이션.
basketikun/infinite-canvas
무한 캔버스에서 생성, 편집, 프롬프트 라이브러리를 통합한 AI 이미지 생성을 위한 오픈소스 노드 기반 워크벤치입니다.
HBAI-Ltd/Toonflow-app
스크립트 작성, 스토리보드 생성에서 최종 영상 생성에 이르기까지 작업 흐름을 자동화하는 AI 기반 워크벤치로, 단편 드라마 제작을 지원합니다.
snapotter-hq/SnapOtter
이미지, 동영상, 오디오, PDF, 문서에 대한 200개 이상의 도구를 제공하는 자체 호스팅 파일 처리 스위트로, OCR 및 음성 인식과 같은 로컬 AI 기능을 포함.
moeru-ai/airi
채팅, 게임 플레이, 여러 플랫폼에서의 상호작용이 가능한 인터랙티브한 AI 가상 캐릭터 및 VTuber를 만들 수 있는 오픈소스 프레임워크입니다.
halcyon-video/halcyon-video
Jellyfin 및 Plex를 위한 3D 몰입형 비디오 스토어 인터페이스로, 미디어 라이브러리를 걸어 다닐 수 있는 1990년대 대여점으로 바꿔줍니다.
NoizAI/HelixWorld
HelixWorld 1.0은 사용자가 가상 카메라를 움직일 때 비디오와 공간 오디오를 동시에 생성하는 예정된 실시간 모델입니다. 1인칭 비디오/오디오 및 게임 엔진 캡처 데이터로 학습되어, 인과적으로 다음 프레임과 음장을 예측한 후 인터랙티브 속도에 맞게 파이프라인을 증류합니다. 코드, 가중치 및 기술 보고서는 곧 공개될 예정이며, 이 프로젝트는 Apache-2.0 라이선스로 제공됩니다.
pipecat-ai/pipecat
다중 에이전트 조율과 저지연 전송을 지원하는 오픈소스 파이썬 프레임워크로, 실시간 음성 및 다중 모달 AI 에이전트를 구축할 수 있습니다.
Pinvou/pinvou-agent
Pinvou Agent는 LLM을 사용하여 작업, 디자인, 코딩을 위한 편집 가능한 산출물을 만드는 크로스 플랫폼 데스크톱 AI 어시스턴트입니다.
ningzimu/codex-ppt-skill
AI 에이전트 기술로서 기사, 보고서, 논문 등을 개요 계획과 시각 스타일 생성을 자동화하여 전문적인 이미지 기반 PowerPoint 프레젠테이션으로 변환합니다.
Devin-AXIS/deepseek-design
DeepSeek Harness용 네이티브 시각 디자인 시스템으로 AI가 편집 가능한 웹사이트, 프레젠테이션, 비디오를 생성하고 수동으로 세부 조정할 수 있도록 합니다.
oil-oil/oil-motion
스크롤, 마우스 이동, 터치에 반응하는 상호작용 가능한 웹 애니메이션으로 AI 생성 지속 운동을 변환하는 에이전트 기반 애니메이션 기술
zenstory-ai/drama-skills
모듈식 에이전트 기술을 사용하여 아이디어나 소설을 스크립트, 스토리보드, 프로덕션 프롬프트로 변환하는 AI 기반 단편 드라마 제작 워크플로우입니다.
chatfire-AI/huobao-drama
대본 생성, 캐릭터 디자인부터 최종 비디오 합성까지 숏폼 드라마 제작을 간소화하는 AI 기반 자동화 제작 플랫폼.
techjarves/Uncensored-Local-Studio
하드웨어 가속을 지원하는 Stable Diffusion, LLM, Whisper, Kokoro TTS를 하나의 개인용 데스크톱 인터페이스에 통합한 제로 구성 오프라인 AI 스튜디오입니다.
OpenSenseNova/SenseNova-Skills
SenseNova‑Skills는 오픈소스 기반의 에이전트 기술 모음으로, SenseNova LLM에 이미지 생성, 인포그래픽 제작, 엑셀 분석, 심층 연구, 파워포인트 생성 등의 사무자동화 기능을 추가합니다. OpenClaw 또는 hermes‑agent 런타임에 기술 폴더를 추가하고 SenseNova API를 구성하면, 사용자는 간단한 자연어 요청만으로도 정교한 데이터 기반 보고서와 프레젠테이션을 생성할 수 있습니다.
darkzOGx/youtube-automation-agent
트렌드 조사 및 스크립트 작성부터 비디오 제작, 발행, 그리고 분석 기반 최적화에 이르기까지 YouTube 채널의 전체 라이프사이클을 자동화하는 오픈 소스 AI 에이전트 시스템.
buxuku/SmartSub
SmartSub(묘막)은 오픈소스이며 크로스플랫폼 대응 데스크톱 앱으로, 비디오를 다운로드하고 로컬 또는 클라우드 음성 인식(ASR)을 실행하며, 다양한 서비스를 통해 자막을 번역하고, 편집/교정하며, 음성 합성(제로샷 음성 클론 포함)을 수행한 후 최종적으로 자막을 비디오에 하드버닝하거나 마스킹합니다. 오프라인으로 작동하며 GPU 가속도 선택 사항이며, 완전히 무료로 사용할 수 있습니다.
alchaincyf/huashu-design
AI 에이전트를 위한 디자인 자동화 기술로, 텍스트 프롬프트를 입력하면 전문적인 인터랙티브 프로토타입, 모션 그래픽, 편집 가능한 프레젠테이션 덱을 생성합니다.
wide-trace/open-higgsfield
32개의 다른 AI 모델을 통일된 프롬프트 인터페이스와 사용자 제공 API 키를 통해 이용할 수 있는 오픈소스이며 자체 호스팅 가능한 스튜디오입니다.
PurpleDoubleD/locally-uncensored
Windows 및 Linux용 즉시 사용 가능한 로컬 AI 스튜디오로, 검열되지 않은 채팅, 이미지 및 동영상 생성, 코드 에이전트를 하나의 클라우드 없는 데스크톱 애플리케이션에 통합합니다.
ljquan/opentu
Opentu는 지속적인 AI 작업 실행을 위해 다중 모델 생성과 도구 관리를 하나의 워크스페이스에 통합하는 캔버스 기반 AI 애플리케이션 플랫폼입니다.
HKUDS/RAG-Anything
텍스트, 이미지, 표, 수학식이 혼합된 문서를 원활하게 처리하고 질의할 수 있는 종합적인 다모달 RAG 프레임워크입니다.
google-deepmind/alphagenome
DNA 서열의 규제 코드를 해독하기 위한 통합 모델과 API. 유전자 발현, 스플라이싱, 크로마틴 특성을 예측합니다.
mengxi-ream/read-frog
Read Frog는 오픈소스 브라우저 확장 프로그램으로, 모든 웹 페이지에 AI 기반 번역, 설명, 텍스트‑투‑스피치, 자막 번역, 플래시카드 생성 및 맞춤형 AI 액션을 추가합니다. Chrome, Edge, Firefox에서 동작하며 20개 이상의 LLM 제공자를 지원하고, 요청을 배치 처리해 비용을 절감하며, 어휘 학습을 위한 간격 반복 시스템을 포함합니다.
SegFault42/HeliosGen
무한한 노드 기반 캔버스에서 AI 이미지 및 비디오 생성 모델을 연결하는 무료이고 오픈소스의 시각적 워크플로우 빌더입니다.
llm-as-a-verifier/llm-as-a-verifier
llm-as-a-verifier는 AI 에이전트 출력을 위한 세밀하고 확률적인 검증기로 LLM을 전환하는 Python 프레임워크입니다. 후보 경로를 스코어링하고, 효율적인 확률적 피봇 토너먼트를 통해 best-of-N를 선택하며, 단계별로 진행 상황을 추적하고, 다중 모달(이미지) 입력을 지원합니다. 여러 에이전트 벤치마크에서 최첨단 성능을 달성하며, 재현 가능한 평가 스크립트, 캐시 최적화 토큰 사용량 추적기, 그리고 Claude Code 플러그인(TurboAgent)을 통한 원활한 통합을 포함합니다.
Blizaine/Maestro
LLM을 활용하여 뮤직 비디오와 단편 영화를 자동으로 기획하고 생성하는 디렉터 모드를 갖춘 원클릭 AI 비디오, 이미지 및 오디오 스튜디오입니다.
flatkey-ai/flatkey-cli
단일 API 키와 크레딧 잔액을 통해 이미지, 비디오, 오디오 및 텍스트를 생성할 수 있는 통합 멀티모달 AI 생성용 명령줄 인터페이스.
ant-research/4DAnyone
4DAnyone은 사람의 단일 카메라 영상을 수십 개의 동기화되고 시점 일관성 있는 영상(6~24~48 시점)으로 변환하는 연구용 신경망 모델로, 하류 4D 가우시안 스플래터링 재구성에 사용됩니다. 소비자용 GPU(≤24GB VRAM)에서 작동하며, 빠른 디스틸된 Turbo 버전(5.6배 속도 향상)을 제공하고, 즉시 사용 가능한 추론 스크립트와 nerfstudio 통합도 포함합니다.
jtydhr88/ComfyTV
이미지, 동영상, 오디오, 음악, 3D 자산을 위한 AI 생성과 프로페셔널 편집 도구를 통합한 ComfyUI용 캔버스 기반 미디어 워크벤치입니다.
livekit/agents
보는 것, 듣는 것, 이해하는 능력을 갖춘 실시간 다중 모달 음성 에이전트를 구축하기 위한 프레임워크로, 작업 스케줄링과 유연한 모델 통합 기능을 내장하고 있습니다.
ningzimu/image-to-editable-ppt-skill
이미지, PDF, 이미지 기반 슬라이드를 텍스트, 도형, 에셋을 재구성하여 편집 가능한 PowerPoint 프레젠테이션으로 변환하는 멀티 에이전트 AI 기술입니다.
mnemosyne-oss/mnemosyne
Mnemosyne은 로컬 우선, SQLite 기반의 AI 에이전트용 기억 계층입니다. 세 가지 계층 구조(작업 기억, 에피소드 기억, 시간적 지식 그래프)를 통해 세션 간 지속적 기억을 제공하며, 의미/키워드 하이브리드 검색, 강력한 벡터 압축, Python SDK, CLI, 내장된 MCP 서버를 제공합니다. 개인정보 보호에 중점을 두어, 트래킹 없이 로컬 기반으로 작동하며, 클라이언트 측 암호화된 동기화 기능도 제공합니다.
wiltodelta/remove-ai-watermarks
AI 생성 이미지 및 비디오에서 가시적 라벨, 비가시적 픽셀 워터마크, AI 출처 메타데이터를 제거하는 라이브러리 및 CLI 도구.
NomaDamas/CozyClay
Model Context Protocol를 통한 직접적인 AI 제어를 갖춘, 장면 블로킹과 AI 생성 모션 시퀀싱에 특화된 브라우저 기반 3D 스테이징 스튜디오입니다.