AaronFeng753/Waifu2x-Extension-GUI

다양한 하드웨어와 신경망 모델을 지원하는 AI 기반 이미지 및 동영상 확대 및 프레임 보간용 그래픽 사용자 인터페이스.

JuneYaooo/gpt-image2-ppt-skills

gpt-image2-ppt-skills는 OpenAI의 gpt‑image‑2 모델을 사용하여 고품질의 16:9 슬라이드 이미지를 생성하고, 이를 .pptx 파일로 패키지화하는 Python 스킬입니다. 시각 우선 모드와 선택적 편집 가능 모드(네이티브 PowerPoint 객체로 재구성)를 지원합니다. 사용자는 자연어 프롬프트를 통해 새 데크를 생성하거나, 기존 .pptx 템플릿을 복제하거나, 특정 슬라이드 요소를 편집할 수 있습니다. 설치는 지원되는 에이전트에게 스킬을 설치하거나 제공된 스크립트를 실행하여 수행합니다. OpenAI API 키와 로컬 PowerPoint/Keynote/LibreOffice 렌더러가 필요합니다. 프로젝트는 Apache-2.0 라이선스입니다.

kleinlee/DH_live

GPU가 필요 없이 모바일 브라우저와 저전력 장치에서 실시간 애니메이션과 대화가 가능한 가벼운 2D 디지털 인간 엔진입니다.

open-compass/VLMEvalKit

70개 이상의 벤치마크와 200개 이상의 모델에 대해 원클릭 평가를 가능하게 하는 대규모 시각-언어 모델용 오픈소스 평가 툴킷.

SeemSeam/claude_codex_bridge

CCB(Claude‑Codex‑Bridge)는 크로스 플랫폼 터미널 UI로, 많은 LLM 기반 CLI 에이전트(Codex, Claude, Gemini 등)를 가시적인 패널에서 함께 실행하고, 협업 그래프를 정의하고, 프로젝트 전체 메모리 파일을 공유하며, Android 앱에서 워크스페이스를 제어할 수도 있습니다. npm으로 설치하고, 내장 UI로 구성하고, 명령줄에서 프로바이더, 역할, 리치 미디어 터미널을 관리합니다.

JimLiu/baocut

AI 코딩 에이전트가 자연어로 BaoCut을 제어하여 자동으로 비디오 음성 인식, 자막 번역 및 타임라인 편집을 수행할 수 있도록 하는 에이전트 스킬입니다.

PhiloLabs/fable51-worlds

AI 에이전트 스웜을 사용하여 텍스트, 이미지 또는 비디오로부터 보행 가능한 3D 월드를 생성하고, 이를 브라우저 기반의 Three.js 애플리케이션으로 렌더링하는 시스템입니다.

QwenLM/Qwen3.8-Flash-Next

Qwen4의 아키텍처 사전 시연으로, 코딩 및 사무 업무에서 높은 효율성을 제공하며 훨씬 낮은 학습 및 추론 비용을 실현하는 멀티모달 MoE 모델입니다.

amitshekhariitbhu/build-your-own-x-machine-learning

순수 Python으로 처음부터 구현한 고전 머신러닝 알고리즘, 딥러닝 모델 및 응용 프로젝트(추천 시스템, 컴퓨터 비전 앱, NLP 등)의 컬렉션입니다. 머신러닝 기술의 내부 작동 방식을 이해하고자 하는 모든 사람을 위한 실습 학습 자료로 설계되었습니다.

DrEAmSs59/CS2-insight-agent

CS2용 하나의 툴로 데모 분석, OBS를 통한 하이라이트 녹화, AI 기반 해설이 포함된 영상 편집을 자동화하는 종합적인 콘텐츠 제작 솔루션입니다.

redai-studio/Relax

Relax는 다중 모달 대규모 언어 모델을 위한 오픈소스, Ray‑Serve 기반 강화학습 프레임워크입니다. TransferQueue를 통해 롤아웃과 훈련을 분리하고, GPU 클러스터에서 완전 비동기 또는 하이브리드 실행을 지원하며, PPO, GRPO, M2‑PO, RLOO, REINFORCE++ 등 풍부한 온폴리시 알고리즘과 플러그인 보상을 제공합니다. Megatron‑LM 훈련 백엔드와 SGLang 추론을 통합해 텍스트, 시각, 비디오, 오디오를 단일 파이프라인에서 처리합니다. 공식 Docker 이미지, 이중 언어 문서, 프로덕션 수준의 운영 기능(헬스 매니저, 메트릭스, 탄력적 롤아웃 스케일링)을 갖추고 있어 Qwen‑3‑Omni와 같은 모델의 연구 및 대규모 파인튜닝에 즉시 활용 가능합니다.

apple-aiml-research/ml-mobileclip

MobileCLIP(및 MobileCLIP2)은 모바일 기기에 최적화된 소형, 고속 이미지-텍스트 모델로, 제로샷 분류 및 캡션 생성을 지원합니다. 이 저장소는 사전 학습된 체크포인트, 훈련/평가 스크립트(OpenCLIP 기반), iOS 데모, CoCa 캡션 모델을 제공하며, 모두 MIT / Apple research 라이선스 하에 있습니다.

xr843/insect-world

외부 3D 에셋 대신 파라메트릭 TypeScript 코드로 완전히 생성된 63종을 수록한 인터랙티브 3D 곤충 백과사전.

morettt/my-neuro

사용자 정의 가능한 목소리, 성격, Live2D 시각 효과를 갖춘 개인 맞춤형 인간처럼 느껴지는 AI 동반자를 만들 수 있는 포괄적인 워크벤치입니다.

nexu-io/codex-slides

Codex 코딩 에이전트를 위한 오픈 소스 AI 슬라이드 스튜디오로, 프롬프트, 리포지토리 또는 파일을 제어 가능하고 실시간 편집이 가능한 워크플로우를 통해 전문적인 프레젠테이션으로 변환합니다.

ArcInstitute/state

세포의 섭동에 대한 반응을 예측하고 세포 임베딩(embeddings)을 생성하여 생물학적 상태 전이를 모델링하기 위한 프레임워크입니다.

HisMax/RedInk

단 한 문장으로 아웃라인, 카피라이팅, 시각적으로 일관된 이미지를 포함한 완전한 멀티 페이지 소셜 미디어 게시물을 생성하는 AI 기반 도구.

GetStream/Vision-Agents

실시간 비디오 스트리밍과 LLM, 컴퓨터 비전 모델을 결합하여 인터랙티브한 시각 경험을 제공하는 저지연·멀티모달 AI 에이전트 구축 프레임워크.

TEN-framework/ten-framework

저지연 음성, 텍스트, 시각 기능을 갖춘 실시간 다중 모달 대화형 AI 에이전트를 구축하기 위한 오픈소스 프레임워크입니다.

SakuraMathcraft/LaTeXSnipper

OCR을 사용하여 스크린샷, 이미지, PDF를 편집 가능한 LaTeX 수식과 텍스트로 변환하는 데스크톱 애플리케이션.

microsoft/mcp-gateway

MCP Gateway는 Model Context Protocol (MCP) 서버를 위한 오픈 소스 Kubernetes-native 역방향 프록시 및 관리 계층입니다. REST control-plane을 통해 MCP adapters와 tools를 생성, 업데이트 및 모니터링할 수 있으며, session-aware routing, Azure Entra ID RBAC, 내장 React 포털, 그리고 선택적 LLM 기반 에이전트를 제공합니다. Docker/K8s를 사용하여 로컬에서 배포하거나 원클릭 Azure 템플릿으로 배포할 수 있습니다.

KangLiao929/Puffin

카메라 중심의 공간 지능과 물리, 기하학, 외관의 네이티브 3D 세계 상태를 사용하여 카메라 중심의 3D 세계 생성 및 공간 지능을 가능하게 하는 3D 세계 모델링을 위한 일련의 통합형 멀티모달 모델입니다.

nv-tlabs/lyra

단일 이미지 또는 비디오에서 3D 및 4D 장면을 생성하는 NVIDIA의 일련의 오픈 생성형 3D 월드 모델입니다.

dmMaze/BallonsTranslator

딥러닝 기반의 만화 번역 도구로, 만화 및 만화의 텍스트 검출, OCR, 보정, 번역을 자동화합니다.

google-deepmind/gemma

Gemini 연구 기반 오픈웨이트 대규모 언어 모델인 Gemma 패밀리의 배포 및 미세조정을 위한 JAX 라이브러리로, 멀티모달 대화 및 여러 하드웨어 백엔드를 지원합니다.

EvolvingLMMs-Lab/lmms-eval

LMMs‑Eval은 시각/음성 기능을 갖춘 대규모 언어 모델을 평가하기 위한 오픈소스 파이썬 툴킷입니다. 이미지, 동영상, 오디오를 포함한 100개 이상의 멀티모달 벤치마크 작업을 통합하고, 결정론적이고 통계적으로 신뢰할 수 있는 결과를 제공합니다. vLLM, SGLang, OpenAI 호환 API를 통해 30개 이상의 모델 패밀리를 지원하며, 웹 UI, HTTP 평가 서버, 확장 가능한 모델/작업 인터페이스를 포함합니다.

Lynpoint/CyberVerse

음성 상호작용, 페르소나 메모리, 단일 사진의 비디오 애니메이션을 결합한 실시간 디지털 휴먼 에이전트를 구축하기 위한 오픈소스 프레임워크입니다.

duixcom/Duix-Mobile

모바일 및 임베디드 기기에서 저지연 및 온디바이스 실행을 통해 실시간 대화형 AI 아바타를 배포할 수 있는 오픈 소스 SDK.

momori777/Artemis

완전히 로컬에서 작동하고 검열되지 않은 AI 컴패니언 시스템으로, LLM, TTS, 이미지 생성 및 Live2D 애니메이션을 통합하여 사적이고 캐릭터 중심의 가상 파트너를 만듭니다.

chatfire-AI/huobao-canvas

Huobao Canvas는 오픈소스, 노드 기반 비주얼 에디터로, 11개 제공업체의 텍스트, 이미지, 비디오 AI 모델을 무한 캔버스에서 연결할 수 있습니다. 영속성과 비동기 실행 큐를 위한 경량 Node 서버, Docker 및 Electron 배포 옵션, Huobao를 통한 원키 설정을 제공합니다. 코드를 작성하지 않고 멀티모달 창의적 파이프라인을 구축하는 데 이상적입니다.

MirroS-Lab/Code-as-World

Code-as-World는 반복적 시뮬레이션을 통해 세계 표현을 탐색함으로써, AI 모델이 정량적 물리적 추론을 수행할 수 있도록 하는 프레임워크로, 물리 세계를 실행 가능한 코드로 표현합니다.

IBM/AssetOpsBench

AssetOpsBench는 센서, 작업 지시, 고장 모드 등 산업 자산 관리 데이터를 다루는 LLM 기반 AI 에이전트의 구축, 오케스트레이션, 평가를 위한 오픈소스 벤치마크/프레임워크입니다. 도메인 특화 MCP 도구 서버, 여러 ReAct 스타일 에이전트 백엔드, 141개 이상의 현실적인 시나리오, KDD/AAAI/NeurIPS 경진대회에서 사용된 다차원 평가 파이프라인을 제공합니다.

Kiri-Innovation/3dgs-render-blender-addon

고해상도 3D 캡처를 표준 3D 제작 워크플로우에 통합하기 위한 Blender 애드온. 3D 가우시안 스플래터의 가져오기, 편집, 애니메이션, 렌더링을 지원합니다.

Runfusion/Fusion

Fusion은 일반 언어로 작성된 작업 설명을 완전히 검토되고 병합 가능한 코드로 변환하는 오픈소스 AI 기반 소프트웨어 공장입니다. LLM 기반 에이전트 팀을 조율하고, 각 작업을 별도의 Git worktree에서 실행하며, 구성 가능한 워크플로우와 인간의 감시를 갖춘 시각적 대시보드로 전체 프로세스를 제공합니다.

ArtificialAnalysis/Stirrup

Stirrup는 LLM 기반 에이전트를 구축하기 위한 경량 Python 프레임워크입니다. 코드 실행, 웹 검색, 파일 I/O, 멀티모달 처리와 같은 준비된 도구와 유연한 `Tool`/`ToolProvider` 시스템을 제공하며, 컨텍스트 제한 및 세션 라이프사이클을 자동으로 관리합니다. `pip install stirrup`(Docker, 브라우저 등을 위한 옵션 확장 포함)를 통해 설치하고, 클라이언트(OpenRouter, LiteLLM 또는 모든 OpenAI 호환 API)를 생성한 다음, `Agent`를 인스턴스화하여 모델이 작업을 해결하기 위해 도구를 호출할 수 있는 세션을 실행합니다. 커스텀 도구 및 프로바이더를 쉽게 추가할 수 있어, 신속한 프로토타이핑, 도메인 특화 어시스턴트 및 도구 사용 에이전트 연구에 적합합니다.

zyddnys/manga-image-translator

만화 및 코믹스의 텍스트를 감지, 제거 및 교체하는 AI 기반 이미지 번역기로, 다국어 지원 및 자동 타이포그래피 기능을 제공합니다.

DavidVentura/offline-translator

디바이스 내부 모델을 사용하여 텍스트, PDF/ODT 문서, 이미지 번역을 완전히 오프라인으로 수행하는 Android 번역 앱입니다.

P1kaj1uu/ChattyPlay-Agent

ChattyPlay‑Agent는 AI 채팅 어시스턴트(ChatGPT/DeepSeek)와 일상적인 도구들 — 음악 스트리밍, 동영상 파싱, 금 가격 차트, 학술 논문 브라우징, LaTeX/마크다운 에디터, 마인드맵, 만화 라이브러리, Xianyu 마켓플레이스 도우미, 텍스트에서 이미지 생성 — 을 통합한 풀스택 웹 앱입니다. React + TypeScript 프론트엔드와 Python/Java 백엔드로 구축되어 Docker를 통해 실행되며, 온라인 데모도 제공됩니다. 이 리포지토리는 AI 어시스턴트 분야의 진정한 소프트웨어 프로젝트입니다.

RunMaestro/Maestro

Maestro는 Git 워크트리 지원, 플레이북 자동화, 키보드 우선 UI, 원격 웹 제어, 분석 기능을 갖춘 크로스플랫폼 데스크톱 앱으로, Claude Code, OpenAI Codex 등 여러 AI 코딩 에이전트를 병렬로 실행, 자동화, 모니터링할 수 있습니다. AGPL-3.0 라이선스 하에 제공됩니다.

Tencent-Hunyuan/UniRL

UniRL은 통합 강화학습 루프를 다양한 멀티모달 생성 모델(LLM, 비전-언어 모델, 이미지/비디오 확산, 하이브리드 AR-확산 모델)에 적용하는 오픈소스 Python 프레임워크입니다. 4개의 엔트리 포인트, Hydra 기반 구성, 플러그인 가능한 롤아웃 엔진, Ray 및 FSDP를 통한 분산 학습을 제공합니다. 리포지토리에는 표준 RL 알고리즘과 팀이 제안한 3가지 새로운 방법(Flow-DPPO, DRPO, CPPO)의 튜토리얼이 포함되어 있습니다. 지원 모델에는 Stable Diffusion 3, FLUX.2-Klein, Qwen-3, HunyuanVideo 등이 있습니다. 문서, 예제 레시피, WeChat 커뮤니티가 제공됩니다. Apache-2.0 라이선스.

liyue-aigc/female-outfit-director

AI 에이전트를 위한 프롬프트 지향 워크플로우로, 구조화된 제작 계획과 캐릭터 일관성 있는 옷 갈아입기 영상 생성 프롬프트를 생성합니다.

mlfoundations/open_clip

OpenCLIP은 OpenAI의 CLIP 및 많은 새로운 멀티모달 모델(SigLIP, CoCa, MaMMUT, CLAP, NaFlex 지원 비전/오디오, 최신 텍스트 타워)을 구현하는 오픈소스 PyTorch 라이브러리입니다. 사전 학습된 체크포인트, 분산/FSDP2 지원을 갖춘 유연한 훈련 스택, 혼합 정밀도 및 torch.compile 가속, 제로샷 추론 및 생성형 캡셔닝을 위한 유틸리티를 제공합니다.

YGYOOO/WorldX

WorldX는 단일 텍스트 프롬프트에서 자율적 에이전트, 지도, 그리고 에머전트 내러티브를 포함한 완전한 가상 세계를 생성하는 AI 기반 시뮬레이션 엔진입니다.

huangserva/3DCellForge

여러 AI 제공업체를 활용하여 이미지를 인터랙티브한 3D 모델로 변환하고, 전문적인 검사 및 프레젠테이션 환경을 제공하는 AI 기반 3D 모델 스튜디오입니다.

nv-tlabs/3dgrut

가우시안 레스터라이제이션과 레이 트레이싱을 결합하여 왜곡된 카메라와 반사, 그림자와 같은 복잡한 조명 효과를 지원하는 하이브리드 3D 렌더링 프레임워크입니다.

Scottcjn/bottube

AI 에이전트와 인간이 짧은 형식의 동영상을 공동으로 생성하고 공유하는 AI 네이티브 동영상 플랫폼. Proof of Physical AI를 통해 하드웨어 검증된 프로바넌스를 제공합니다.

microsoft/DebugMCP

DebugMCP는 Microsoft에서 제공하는 VS Code 확장 프로그램으로, 로컬에 MCP 서버를 실행하여 디버깅 작업(시작/중지, 단계 실행, 브레이크포인트 설정, 변수 검사, 표현식 평가 등)을 도구로 노출합니다. 이는 Copilot, Cursor, Codex 등 모든 MCP 호환 AI 보조 도구가 호출할 수 있습니다. 다양한 언어에서 즉시 사용 가능하며, 포트 3001에서 완전히 로컬로 작동하며, 루프백 전용 바인딩, 호스트 검증, 비밀 정보 마스킹 등의 보안 검사를 포함합니다. 보조 기능인 *debug‑live* 기술은 고수준 디버깅 워크플로우를 제공하여 AI 에이전트가 VS Code 내에서 자율적으로 코드를 디버깅할 수 있도록 합니다.

ganbo-gab/open-storyboard-canvas

Open Storyboard Canvas는 오픈소스이며 크로스플랫폼 대응하는 데스크톱 앱(Tauri + React + Rust)으로, AI 생성 이미지, 비디오, 3D 스토리보드 장면용 시각적 노드 캔버스를 제공합니다. 채팅 기반 Canvas Agent(베타)를 포함하여 생성 작업의 생성, 편집, 추적이 가능하며, OpenAI 호환, Claude, Dreamina CLI 등 여러 프로바이더를 지원하고, 디렉터 스튜디오 도구, 프롬프트 라이브러리, 대량 임포트, 상세 로그를 제공합니다. MIT 라이선스, Storyboard-Copilot 상류 프로젝트 기반입니다.