xszyou/Fay

LLM, ASR, TTS를 통합하여 앱, 웹사이트 및 임베디드 장치용 대화형 가상 아바타를 구동하는 포괄적인 디지털 휴먼 프레임워크입니다.

lycohana/BiliSum

BiliSum은 Bilibili, YouTube 및 로컬 영상을 전사, 시각적 노트, 그리고 로컬 RAG 기반 지식 베이스로 변환하는 영상-지식 변환 도구입니다.

death34018-hue/AionsHome

다중 모달 채팅, 스마트 카메라 모니터링, RAG 기반 메모리를 통합한 로컬 호스팅 AI 보조 시스템으로, 능동적인 개인 보조를 구현합니다.

google-labs-code/stitch-sdk

텍스트 프롬프트에서 UI 스크린을 생성하고 편집할 수 있는 TypeScript SDK로, 빠른 프로토타이핑과 AI 에이전트 통합을 위한 HTML과 스크린샷을 제공합니다.

omicverse/omicverse

OmicVerse는 배치 RNA-Seq, 단일세포, 공간 전사체학 분석을 통합하는 Python 라이브러리입니다. 수십 가지 확립된 생물정보학 도구를 통합하고, anndata/mudata 데이터 구조를 표준화하며, AI 지원 에이전트(J.A.R.V.I.S.)와 MCP 서버를 추가하여 자연어 명령어나 LLM 통합을 통해 파이프라인을 실행할 수 있게 합니다. 선택적 확장 기능으로 합성 생물학 모델링과 GPU 가속 분자 역학 워크플로우를 제공합니다.

xandergos/terrain-diffusion

확산 모델을 사용해 무한하고 결정적이며 랜덤 액세스가 가능한 실시간 지형 및 기후 데이터를 생성하는 학습된 Perlin 노이즈의 후계자.

oil-oil/wolfcha

Wolfcha는 한 명의 인간이 AI 제어된 성격으로 가득 찬 테이블과 울프 게임을 플레이할 수 있는 웹 게임입니다. AI는 과거 대화를 기억하고 의도를 가지고 행동하며, 실시간으로 발화(선택적 음성 포함)를 생성하여 다른 인간 플레이어가 필요 없는 혼란스러운 사회 추론 경험을 재현합니다.

PunithVT/ai-avatar-system

실시간 리프싱크, 제로샷 음성 클론, 다중 LLM 지원을 갖춘 프로덕션 준비 완료된 사실적인 AI 아바타 구축 플랫폼.

LC044/TrailSnap

AI 기반 자체 호스팅 사진 앨범으로, 티켓 OCR, 얼굴 인식, 지리적 발자국 매핑을 통해 여행 추억을 자동으로 정리합니다.

ashuoAI/SHUO-Canvas

SHUO Canvas는 데스크톱 기반의 노드 기반 캔버스로, 텍스트, 이미지, 비디오, 오디오를 AI 생성(OpenAI 호환, RunningHub, ComfyUI 등)과 결합하여 스크립트, 스토리보드, 캐릭터 교체 영상, 360° 패노라마, 음성 오버레이, 3D 장면 등을 하나의 시각적 워크플로우 내에서 구축할 수 있습니다.

MashiroSaber03/Saber-Translator

텍스트 감지, OCR, 번역, 이미지 인페인팅을 자동화하는 AI 기반 만화 번역 및 관리 툴. RAG 기반 스토리 분석 엔진을 탑재.

jipraks/yt-short-clipper

LLM을 사용해 YouTube 동영상의 하이라이트를 식별하고, 자동으로 캡션이 포함된 9:16 세로형 클립으로 변환하는 Windows 데스크톱 앱입니다.

vanloctech/youwee

1,800개 이상의 사이트에서 동영상을 다운로드할 수 있는 오픈소스 GUI로, 통합된 AI 동영상 요약, 자연어 편집, AI 기반 자막 생성 기능을 제공합니다.

openstory-so/openstory

일관된 캐릭터와 시각 스타일을 갖춘 스크립트를 스타일링된 영상 시퀀스로 변환하는 AI 기반 영상 제작 플랫폼입니다.

Softeria/ms-365-mcp-server

LLM을 위해 Microsoft 365 Graph API를 MCP 도구로 노출하는 Node.js 서버. 개인 및 조직 계정, 멀티 계정 사용, 권한 필터링, 그리고 실험적인 토큰 절약형 TOON 출력 형식을 지원합니다.

google-deepmind/alphagenome_research

AlphaGenome은 유전자 발현, 스플라이싱, 크로마틴 특성에서 조절 유전적 변이의 영향을 단일 염기 쌍 해상도로 예측하는 통합 DNA 서열 모델입니다.

facebookresearch/eb_jepa

이미지와 동영상 간의 예측 및 계획을 위한 표현을 학습하기 위해 에너지 기반 공동 임베딩 예측 아키텍처를 사용하는 가벼운 라이브러리입니다.

huangjunsen0406/py-xiaozhi

py‑xiaozhi는 듣기, 말하기, 보기 및 하드웨어 제어가 가능한 멀티모달 AI 어시스턴트를 구축하기 위한 비동기 우선 Python 프레임워크입니다.

NVlabs/FastGen

이미지와 비디오 생성을 위해 다양한 증류 및 가속 기법을 활용해 확산 모델을 빠르게 만드는 PyTorch 기반 프레임워크.

ogkalu2/comic-translate

LLM, OCR 및 inpainting을 사용하여 원래의 시각적 레이아웃을 유지하면서 여러 언어의 만화와 망가를 번역하는 자동 만화 번역기입니다.

microsoft/skills-for-copilot-studio

Skills for Copilot Studio는 Claude Code, GitHub Copilot CLI, VS Code용 플러그인으로, Microsoft Copilot Studio "표준" 에이전트를 YAML 파일로 생성, 편집, 동기화, 테스트, 설계 조언을 받을 수 있습니다. 모두 터미널이나 편집기에서 가능합니다.

NVIDIA/TransformerEngine

NVIDIA Transformer Engine은 FP8/MXFP8/NVFP4 혼합 정밀도 지원, fused kernels 및 PyTorch와 JAX를 위한 간단한 autocast API를 제공하는 GPU 중심 라이브러리로, 대규모 언어 모델 및 MoE 모델의 더 빠른 학습과 낮은 메모리 사용량의 추론을 가능하게 합니다.

Alos21750/UAV-Downloader

UAV Downloader는 JableTV, MissAV, SupJav, Hanime1에 대한 Windows 중심의 비디오 다운로더로, 로컬 음성 인식(ReazonSpeech K2 v2 또는 Whisper) 및 번역 모델(FuguMT, OPUS-MT)을 사용해 일본어, 영어, 번체 중국어 자막을 자동 생성할 수 있습니다. 인터랙티브 GUI(UAV Browser), 비대면 스케줄러(UAV Watcher), 헤드리스 Docker/CLI 버전의 세 가지 운영 모드를 제공하며, 프록시 지원, 병렬 다운로드, 선택적 LLM 기반 번역 기능을 갖추고 있습니다. 프로젝트는 Apache 2.0 라이선스로 배포되며 기본적으로 오프라인에서 작동합니다.

tianjiangqiji/nova-image-studio

사용자가 자체 모델을 가져오고 플러그인 시스템을 통해 기능을 확장할 수 있는 자체 호스팅형 AI 이미지 및 동영상 생성 워크벤치입니다.

wassermanproductions/motion-previs-studio

영화 제작자를 위한 데스크톱 앱으로, 참조 영상에서 자세, 깊이, 카메라 움직임을 추출하여 AI 영상 생성 파이프라인용 제어 번들을 생성합니다.

FlowElement-xinliuyuansu/m_flow

M-flow는 지식 그래프에서 증거 경로를 점수화하여 정보를 검색함으로써 AI 에이전트를 위한 기억 시스템으로 작동하며, 유사도 검색에만 의존하는 것이 아니라 인지적 기억 시스템처럼 동작합니다.

visualbruno/ComfyUI-Trellis2

ComfyUI‑Trellis2는 시각 프로그래밍 UI인 ComfyUI에 마이크로소프트의 TRELLIS.2 3D 확산 모델을 통합하는 사용자 정의 노드 팩입니다. 단일 또는 다중 이미지(또는 동영상)에서 메시 생성, 정교화, 텍스처 부여, 렌더링까지 수십 개의 노드로 구현 가능합니다. Windows, Python 3.11, PyTorch 2.7/2.8 + CUDA, Facebook DINOv3 체크포인트가 필요합니다. 네이티브 확장용 사전 빌드된 웨일이 포함되며 예제 워크플로우도 제공됩니다. 진정한 AI/ML 프로젝트로 3D 생성에 특화되어 있습니다.

Asad-Ismail/MoneyPrinterTurbo-Extended

스크립트 생성, 로컬 음성 클로닝을 통한 음성 합성, 그리고 동기화된 단어 수준 자막이 포함된 관련 영상 클립 매칭을 수행하는 자동 영상 생성 도구.

opentokenz/mcpx

MCPX는 Go 기반의 로컬 서버로, MCP 프로토콜을 구현하여 ChatGPT, Claude 등 LLM 에이전트가 등록된 로컬 워크스페이스에서 파일, 명령어, 계획, 아티팩트를 안전하게 읽고, 편집하고, 실행하고, 관리할 수 있도록 합니다. 지속 가능한 원격 세션, 세밀한 보안 정책, SQLite에 저장된 감사 로그, 그리고 스킬과 사용자 정의 도구를 통한 확장성을 제공합니다.

jangles-byte/Pythia

40개 이상의 실시간 데이터 피드를 융합해 3D 인텔리전스 지구를 만들어 세계 사건을 예측하는 로컬, 군집지능 기반 글로벌 예측 시스템

NVIDIA-BioNeMo/Proteina-Complexa

원자 수준의 단백질 결합체 설계를 위한 생성 모델로, 생성 모델링과 환각을 통합하여 단백질 및 소분자 리간드에 대한 결합체를 생성합니다.

aurekaresearch/OpenDDE

모든 원자 생체 분자 기반 모델로, 약물 개발에서 구조 예측, 설계, 최적화를 위한 공접합을 수행합니다.

OpenBMB/MiniCPM-o-Demo

MiniCPM-o 4.5용 데모 시스템으로, AI가 동시에 시각 인식, 청각 인식, 음성 출력을 실시간으로 수행할 수 있는 양방향 오미모달 상호작용을 가능하게 합니다.

mynaparrot/plugNmeet-server

LiveKit 기반의 확장 가능하고 오픈소스 웹 회의 시스템으로, AI 기반의 음성 인식 및 요약 기능을 제공하는 자체 호스팅 비디오 회의를 구현합니다.

bytedance/SALMONN

일반적인 청취 능력과 통합된 음성-시각 인식을 제공하는 고급 다모달 LLM의 세트입니다.

mcp-router/mcp-router

MCP Router는 폐기된 오픈소스 데스크톱 앱(Windows/macOS)으로, 로컬에서 Model Context Protocol (MCP) 서버를 관리합니다. 사용자는 서버를 프로젝트와 워크스페이스에 그룹화하고, 개별 도구를 전환하며, 요청 로그와 기본 분석 데이터를 확인할 수 있습니다. 인기 있는 AI 프론트엔드와 통합 가능합니다. 모든 데이터는 사용자 기기에서만 유지됩니다. 마지막 릴리스 버전은 v0.6.4(지원 종료일: 2026년 9월)입니다.

NVIDIA-NeMo/Megatron-Bridge

NeMo Megatron Bridge는 Hugging Face 모델 체크포인트와 NVIDIA의 Megatron‑Core 훈련 엔진을 연결하는 PyTorch 네이티브 라이브러리입니다. 양방향 체크포인트 변환, 검증, 고처리량 훈련(텐서/파이프라인 병렬, FP8/BF16/FP4)을 제공합니다. 저장소에는 수십 개의 LLM, VLM, 확산 모델(예: Llama 3.2, Nemotron‑3 Ultra, K‑EXAONE‑2)을 위한 기성 레시피가 포함되어 있으며 SFT/LoRA 미세 조정을 지원합니다. 공식 NeMo Docker 컨테이너 또는 소스에서 설치하고 제공된 빠른 시작 스크립트를 사용하여 모델을 변환, 훈련 또는 내보낼 수 있습니다.

tl2012tl/TE_MAN

TE MAN은 무한 캔버스 워크플로우, 자산 라이브러리, 오디오/비디오/이미지 노드, 3D 디렉터, 배치 프롬프트 도구, 통합 AI 어시스턴트 채팅 패널을 추가하는 ComfyUI 플러그인으로, 이미지, 비디오, 멀티모달 생성을 위한 로컬 모델 추론과 원격 API 사용을 모두 가능하게 합니다.

nagadomi/nunif

이미지 초해상도, VR용 2D에서 3D 비디오 변환, 데이터셋 필터링을 위한 이미지 품질 평가를 위한 PyTorch 기반 도구 모음.

ysr666/dsh-vision-router

DeepSeek Harness용 비전 라우팅 플러그인으로, 에이전트가 도구 호출을 통해 이미지 픽셀과 상호작용하고 내장된 키 없이 무료로 사용 가능한 비전 폴백을 제공합니다.

tracel-ai/cubecl

CubeCL은 Rust 프로시저 매크로 기반 언어로, 단일 컴퓨트 커널을 Rust로 작성하고 CUDA, HIP, Metal, WebGPU(WGSL/SPIR-V) 또는 CPU SIMD로 JIT 컴파일할 수 있습니다. 병렬성을 4축(벡터, 플레인, 큐브 차원, 큐브 수)으로 모델링하고, 컴파일 타임 특수화, 자동 벡터화, 런타임 오토튜닝을 지원하며, Rust 딥러닝 프레임워크 Burn과 커널 라이브러리 cubek의 저수준 기반을 형성합니다.

nicolasvonluetzow/GaussianGPT

GaussianGPT는 다음 토큰 예측을 통해 3D 가우스 장면을 생성하는 트랜스포머 기반 모델로, 제어 가능한 3D 장면 생성, 보완 및 아웃페인팅을 지원합니다.

MiniMax-AI/MiniMax-MCP

Claude 및 Cursor와 같은 AI 클라이언트가 MiniMax API를 사용하여 음성을 생성하고, 목소리를 복제하며, 이미지와 비디오를 생성할 수 있도록 지원하는 공식 Model Context Protocol (MCP) 서버입니다.

InternLM/Intern-S1

화학 및 생물학과 같은 복잡한 과학 분야에 걸친 추론이 가능하며, 과학적 지능 및 장기 에이전트를 위해 최적화된 일련의 멀티모달 기반 모델.

ZeroTang05/cyber-doctor

RAG, 지식 그래프, 음성 상호작용을 활용하여 질병 진단과 의료 기록 분석을 수행하는 다중 모달 AI 건강 보조 시스템.

ACEsuit/mace

MACE는 등변 그래프 신경망 원자간 포텐셜을 위한 오픈소스 PyTorch 라이브러리입니다. 빠른 학습/평가, 멀티 GPU 및 Apple-Silicon 지원, 선택적 CUDA 가속, 재료 및 유기 화학용 사전 학습된 기초 모델 카탈로그를 제공합니다. `pip install mace-torch`로 설치하고, `mace_run_train` CLI(또는 YAML 설정)로 학습, `mace_eval_configs`로 평가할 수 있습니다. 문서, Colab 튜토리얼, Weights & Biases 통합이 포함되어 있습니다. v0.3 라인은 안정적이며, 대규모 v1.0 리팩터링이 진행 중입니다.

danilo-znamerovszkij/draw-your-font

로컬 처리와 선택적 AI 비전을 사용해 손글씨 사진을 설치 가능한 TTF/WOFF 폰트로 변환하는 오픈소스 도구입니다.

tracefinity/tracefinity

AI 기반 실루엣 추적 및 스케일 보정을 사용하여 도구 사진으로부터 맞춤형 Gridfinity 3D 프린팅 빈을 생성하는 도구입니다.