LYL1015/JarvisHub

편집 가능한 캔버스를 공유 프로젝트 상태로 사용하는 캔버스 기반의 오픈 하네스로, 장기적인 창작 작업을 관리합니다.

NVIDIA-AI-IOT/live-vlm-webui

라이브 웹캠 또는 IP 카메라 스트림을 사용하여 Vision Language Model(VLM)과 실시간으로 상호작용하고 벤치마킹할 수 있는 범용 웹 인터페이스입니다.

dnhkng/GLaDOS

시각, 장기 기억, 저지연 응답 파이프라인을 갖춘 능동적인 다중 모달 AI 페르소나 프레임워크.

Everless321/dYm

Douyin 콘텐츠를 위해 워터마크 없는 비디오 다운로드와 AI 기반 콘텐츠 분석을 결합하여 비디오를 자동으로 태그하고 요약하는 데스크톱 애플리케이션입니다.

meangrinch/MangaTranslator

Gradio 기반 웹 애플리케이션으로, 대화 버블 감지, 원본 텍스트 정리, AI 기반 번역 텍스트 렌더링을 통해 만화 및 만화 번역을 자동화합니다.

OpenTSLM/OpenTSLM

OpenTSLM은 Llama 3.2 및 Gemma LLM에 네이티브 시계열 처리 기능을 추가하는 오픈소스 라이브러리로, ECG, EEG, 가속도계 등 의료 신호에 대한 자연어 프롬프트 및 추론을 가능하게 합니다. 사전 학습된 체크포인트, 간단한 `OpenTSLM` Python API, 여러 벤치마크 작업을 위한 데모 스크립트, MCQ, 캡션 생성, 체인 오브 써드 추론 단계를 포함하는 커리큘럼 학습 트레이닝 파이프라인을 제공합니다. `pip install opentslm`로 설치하고, Hugging-Face에서 모델을 로드한 후 제공된 스크립트로 미세 조정 또는 평가가 가능합니다. MIT 라이선스.

livekit/agents-js

STT, LLM, TTS의 플러그인 기반 아키텍처를 사용하여 시각, 청각, 이해가 가능한 실시간 멀티모달 음성 AI 에이전트를 구축할 수 있는 Node.js 프레임워크입니다.

uezo/aiavatarkit

통합된 VAD, STT, LLM, TTS 파이프라인을 통해 여러 채널에서 저지연 대화형 AI 아바타를 구축하기 위한 모듈식 프레임워크.

Nanako0129/pilotfish

pilotfish는 Claude Code를 위한 정책 기반 오케스트레이션 레이어로, 저비용 코딩 작업을 Claude의 저렴한 모델(Haiku, Sonnet)에 자동으로 위임하고, 고수준의 계획 및 최종 판단은 메인 Opus 세션에서 유지합니다. macOS/Linux 플러그인 또는 legacy global 설정으로 설치하며, 마크다운으로 역할 에이전트를 정의하고, 상호작용 형태와 위험도에 따라 작업을 라우팅하는 디스패치 흐름을 사용합니다. 이 프로젝트는 문서화, 벤치마크, MIT 라이선스를 포함합니다.

IvanWng97/pixtuoid

pixtuoid는 Rust 기반 터미널 UI로, 여러 AI 코드 에이전트를 다층 사무실 내 애니메이션 픽셀 아트 동료로 시각화합니다. Claude Code, Codex 등 많은 에이전트 CLI를 지원하며, 토큰 사용량, 도구 활동을 표시하고, 테마, 날씨, 애완동물, 로피 사운드트랙을 제공합니다. 모든 기능은 로컬에서 작동하며, 텔레메트리 없이 완전히 개인 정보 보호됩니다.

Djdefrag/QualityScaler

DirectX12 호환 GPU를 사용하여 로컬에서 이미지와 동영상을 향상시키고 해상도를 늘리며 노이즈를 제거하는 Windows용 AI 업스케일러입니다.

pipecat-ai/pipecat-examples

Pipecat 프레임워크를 사용하여 음성 및 멀티모달 AI 에이전트를 구축하기 위한 중급 및 고급 예제 애플리케이션 모음입니다.

Tencent-Hunyuan/HY-Motion-1.0

Diffusion Transformers와 Flow Matching을 사용하여 텍스트 프롬프트로부터 골격 기반 애니메이션을 생성하는 일련의 10억 파라미터 규모의 Text-to-3D 인체 동작 생성 모델입니다.

huohua325/Memslides

MemSlides는 개인화된 슬라이드 제작을 지원하고 다회차, 국소적 수정을 지원하는 오픈 소스 계층형 메모리 LLM 에이전트 프레임워크입니다. 사용자 프로필, 작업 메모리, 도구 메모리를 유지하여 선호도를 일관되게 유지하고 작업의 중복을 방지하며, CLI와 Docker 이미지를 제공하여 실험을 용이하게 합니다.

AHEKOT/ComfyUI_VNCCS_Utils

3D Gaussian Splatting, 무한 캔버스 이미지 편집 및 전문적인 3D 캐릭터 포징과 라이팅을 위한 고급 ComfyUI 유틸리티 노드 모음.

AnubhavChaturvedi-GitHub/jarvis-ai-assistant

음성 인식, LLM 추론, 이미지 생성 및 시스템 자동화를 결합하여 핸즈프리로 컴퓨터를 제어할 수 있는 모듈형 음성 인식 AI 데스크톱 어시스턴트입니다.

yangjian102621/geekai

텍스트, 이미지, 오디오, 비디오 생성 도구를 상용 준비 워크스페이스로 통합한 원스톱 AI 멀티모달 콘텐츠 제작 플랫폼.

timmyy123/LLM-Hub

Android 및 iOS를 위한 오픈 소스 모바일 앱으로, 하드웨어 가속을 사용하여 기기 내에서 프라이빗한 LLM 채팅, 이미지 생성 및 비디오 생성을 가능하게 합니다.

resend/resend-mcp

Resend MCP Server는 AI 에이전트(Claude, Cursor, Copilot 등)가 완전한 Resend 이메일 플랫폼을 제어할 수 있도록 하는 오픈소스 Node.js 패키지입니다. 호스팅된 원격 서버 또는 로컬에서 실행되는 stdio/HTTP 서버를 통해 이메일 전송, 연락처 관리, 템플릿, 브로드캐스트, 도메인, 웹훅 등을 수행할 수 있습니다.

NickPittas/DirectorsConsole

이미지 및 비디오 생성에서 프롬프트를 실제 카메라, 렌즈, 조명 제약 조건에 근거하여 영화 촬영 정확성을 보장하는 통합 AI VFX 제작 파이프라인입니다.

tensorforger/FluxRT

FLUX.2를 위한 실시간 스트림 편집 파이프라인으로, 소비자용 GPU에서 저지연 및 대화형 프롬프트 업데이트를 통해 웹캠 또는 비디오 피드를 변환합니다.

OpenGVLab/Ask-Anything

채팅 중심의 비디오 및 이미지 이해를 위해 설계된 멀티모달 대규모 언어 모델 제품군으로, 시각적 콘텐츠에 대한 자연어 대화를 가능하게 합니다.

web-infra-dev/midscene-skills

스크린샷을 사용하여 웹, 데스크톱 및 모바일 플랫폼 전반에 걸친 UI의 자연어 제어를 가능하게 하는 비전 기반 자동화 라이브러리.

ZJUI-AI4H/Hulu-Med

Hulu‑Med는 텍스트, 2D 이미지, 3D 스캔, 비디오를 처리하는 오픈소스 멀티모달 의료 비전-언어 모델입니다. 여러 모델 크기(4 B~235 B), 전체 학습 코드를 제공하며, 수십 개의 의료 벤치마크에서 최첨단 결과를 달성합니다. 저장소는 쉬운 설치, HuggingFace 호환 로딩, 고처리량 추론을 위한 선택적 vLLM 서빙을 제공합니다.

pytorch/benchmark

PyTorch Benchmarks 는 BERT, ResNet, Stable Diffusion 등 인기 있는 딥러닝 모델의 표준화되고 가벼운 버전 모음으로, 다양한 PyTorch 빌드, CUDA 버전, 백엔드의 성능을 측정하기 위해 실행할 수 있습니다. 일관된 API, 설치 스크립트, 여러 러너(간단한 테스트, pytest-benchmark, 사용자 정의 사용자 벤치마크)와 함께 AWS g4dn.metal 인스턴스에서 낮은 노이즈 튜닝을 위한 유틸리티도 제공합니다.

agentuniverse-ai/agentUniverse

agentUniverse는 Apache-2.0 라이선스의 파이썬 프레임워크로, LLM 기반의 다중 에이전트 애플리케이션을 구축하고 오케스트레이션할 수 있게 해줍니다. 즉시 사용 가능한 협업 패턴(PEER, DOE), 수십 개의 LLM 제공업체 지원, 도메인 지식 주입 도구, OpenTelemetry 기반의 관찰성, 시각적 워크플로우 UI를 제공합니다. 아ント 그룹의 실제 금융 제품에서 사용되며, GitHub/Discord에 풍부한 문서, 샘플 앱, 커뮤니티가 있습니다.

landing-ai/ade-cli

복잡한 문서를 검증 가능한 페이지 및 박스 증거를 포함한 근거 있는 Markdown과 구조화된 데이터로 변환하는 에이전트 기반 문서 추출을 위한 명령줄 도구입니다.

meme-search/meme-search

AI 비전 모델을 사용하여 콘텐츠와 텍스트 기반으로 이미지를 인덱싱하고 의미적 및 키워드 검색을 가능하게 하는 자체 호스팅 미모 검색 엔진입니다.

tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark

DGX Spark 클러스터에서 DeepSeek-V4-Flash-Vision-Exp를 실행하기 위한 배포 레시피로, 네이티브 비전 지원, 100만 토큰 컨텍스트, 그리고 vLLM 기반 고처리량 사전 추론을 제공합니다.

hawk86104/three-vue-tres

Three.js와 Vue 3를 기반으로 한 AI 협업형 웹 3D 엔지니어링 생태계로, 프로덕션 준비 완료 디지털 트윈과 산업 시각화를 구축할 수 있습니다.

pengchujin/jzsub

여러 플랫폼에서 고화질 동영상을 다운로드하고 GPT를 사용해 이중 언어 자막을 생성 및 내장하는 자동화 도구.

thanhkeke97/RSTGameTranslation

OCR과 LLM을 사용하여 화면의 텍스트와 오디오를 사용자의 언어로 번역하는 Windows 게임용 실시간 화면 번역 도구입니다.

OpenGVLab/InternVideo

멀티모달 비디오 이해, 긴 문맥 모델링 및 문맥 추론을 위해 설계된 일련의 비디오 파운데이션 모델 및 대규모 데이터셋.

horang-labs/tessera

Tessera는 여러 Claude Code, Codex 또는 OpenCode AI 코딩 에이전트를 병렬로 실행할 수 있는 로컬 데스크톱/웹 앱입니다. 각 에이전트는 자체 격리된 Git 워크트리에서 실행됩니다. Kanban 보드, 분할 창 UI, 터미널용 채팅 보기, 전체 Git 통합, 모바일 원격 액세스를 제공하며, 머신에 이미 설치된 공급자 CLI를 사용합니다.

apple-aiml-research/ml-4m

토큰화와 마스크 모델링을 활용해 수십 가지 모달리티와 작업에 걸쳐 임의의 모달리티 간 멀티모달 기반 모델의 확장성을 제공하는 프레임워크.

inclusionAI/UI-Venus

폐쇄 루프 형태의 지각-추론-행동 시스템을 통해 모바일, 웹, 데스크톱 상호작용을 통합하는 범용 기반 GUI 에이전트.

google/spatial-media

몰입형 미디어가 올바르게 인식되고 재생되도록 보장하기 위한 360도 비디오 및 공간 음향용 사양 및 도구 모음입니다.

yincongcyincong/MuseBot

MuseBot은 Telegram, Discord, Slack, Lark, DingTalk, Enterprise WeChat, QQ, WeChat를 OpenAI, DeepSeek, Gemini, OpenRouter 등 다양한 LLM API와 연결하는 오픈소스 Go 봇입니다. AI 응답을 스트리밍으로 전송하고, 이미지/음성 입력, 함수 호출, RAG, 관리자 UI, 메트릭스 및 크론 작업을 지원하며, 로컬 또는 Docker로 실행할 수 있습니다.

strnad/CrewAI-Studio

CrewAI Studio는 Conda, 가상 환경, Docker 또는 원클릭 배포를 통해 쉽게 설치할 수 있는 Streamlit 기반 GUI입니다. CrewAI 프레임워크를 기반으로 한 다중 에이전트 AI 크루를 설계, 실행, 내보낼 수 있으며, 여러 LLM 제공업체와 사용자 정의 도구를 지원합니다.

facebookresearch/brain2qwerty

비침습적 뇌 기록에서 자연스러운 문장을 복원하는 시스템으로, 타이핑 중인 뇌 활동에서 텍스트를 재구성할 수 있게 한다.

redis/mcp-redis

Redis MCP Server는 Python 기반의 Docker 호환 서버로, AI 에이전트가 자연어 명령어로 Redis와 상호작용할 수 있게 해줍니다. Model Content Protocol을 구현하여 문자열, 해시, 리스트, 세트, 스트림, JSON, 벡터 인덱스, pub/sub 등 모든 Redis 데이터 유형에 대한 도구를 노출하고, Azure Entra ID 인증도 지원합니다. PyPI 또는 Docker에서 설치 가능하며, CLI 플래그나 환경 변수로 구성할 수 있으며, Claude Desktop, OpenAI Agents SDK 또는 어떤 MCP 클라이언트에도 연결할 수 있습니다.

wjq-learning/CBraMod

임상 및 뇌-컴퓨터 인터페이스(BCI) 응용 분야를 위한 EEG 복원을 위한 기초 모델로, 사전 훈련 및 미세 조정 파이프라인을 통해 구현됩니다.

awwaiid/ghostwriter

손글씨 입력을 스크린샷으로 캡처하고, 화면에 직접 그림이나 텍스트로 응답하는 reMarkable 태블릿용 AI 어시스턴트입니다.

nvidia-cosmos/cosmos-transfer2.5

물리적 AI를 위한 다중 컨트롤넷 플랫폼으로, 깊이 및 세그멘테이션과 같은 영상 모달리티를 로봇 및 자율주행차의 고해상도 훈련 데이터로 변환합니다.

bytedance/Lance

Lance는 이미지 및 동영상 이해, 생성, 편집을 하나의 프레임워크에 통합한 30억 파라미터의 통합 다중 모달 모델입니다.

bytedance/Sa2VA

Sa2VA는 SAM-2 세그멘테이션과 멀티모달 LLM(InternVL, Qwen-VL)을 결합하여 이미지와 비디오에 대한 픽셀 수준의 근거 기반 이해를 제공하는 ByteDance의 연구용 코드베이스입니다. 핵심 Sa2VA 모델, VRT 추론 벤치마크, SAMTok 마스크-토큰 인터페이스, SaSaSa2VA와 같은 확장 모델을 포함합니다. 이 저장소는 재현 가능한 환경을 위해 `uv` 패키지 관리자를 사용하며, 설정 스크립트를 제공하고 논문, 모델 쥬, 데이터셋 링크를 제공합니다.

fikrikarim/parlor

Gemma 4와 Kokoro TTS를 사용하여 저지연 음성 및 비전 상호작용을 가능하게 하는 완전 온디바이스 실시간 멀티모달 AI 어시스턴트입니다.

MaximeVandegar/Papers-in-100-Lines-of-Code

초기 딥러닝의 주요 성과부터 최신의 신경 렌더링 및 확산 모델에 이르기까지, 약 64개의 초소형(약 100줄) 구현을 큐레이션한 세트입니다. 학습 및 프로토타이핑용으로 설계되었으며, 각 논문에 대해 MIT 라이선스 하에 최소한의 실행 가능한 코드를 제공합니다.