microsoft/bioemu
아미노산 서열에서 단백질 모노머 구조의 평형 분포를 샘플링하는 생성 모델로, 물리적 타당성을 보장하기 위한 스테어링 시스템을 갖추고 있습니다.
OpenSenseNova/SenseNova-Vision
SenseNova-Vision은 다양한 컴퓨터 비전 작업을 생성 문제로 취급하는 통합 멀티모달 모델로, 단일 모델이 텍스트 및 이미지 출력을 통해 감지, 분할 및 기하학적 예측을 수행할 수 있도록 합니다.
dc-ai-projects/DC-Gen
확산 모델을 위한 가속 프레임워크로, 사전 학습된 모델을 고도로 압축된 잠재 공간으로 전송하여 품질 손실 없이 최대 53.8배 빠른 추론 속도를 달성합니다.
LYiHub/pub-local-jarvis
Windows용 로컬 멀티모달 데스크톱 어시스턴트로, 화면과 시스템 오디오를 인식하여 실시간 게임 동반자, 강의 노트, 문맥 기반 AI 상호작용을 제공합니다.
IamCreateAI/NeoVerse
NeoVerse는 단안 비디오에서 3D 장면을 재구성하여 새로운 카메라 경로를 따라 고품질 비디오 생성을 가능하게 하는 4D 월드 모델입니다.
Wakals/CoVT
CoVT는 시각-언어 모델이 연속적 시각 토큰을 사용해 추론할 수 있도록 하는 프레임워크로, 의미적 사고를 지각적 신호에 기반시켜 공간적 추론과 기하학적 인식을 향상시킵니다.
Visionary-Laboratory/holi-spatial
비디오 스트림을 3D Gaussian Splatting 지오메트리 및 공간 QA 쌍을 포함하여 주석이 달린 3D 공간 지능 데이터셋으로 변환하는 데이터 큐레이션 파이프라인입니다.
Alibaba-NLP/VRAG
텍스트, 이미지, 비디오 전반에 걸쳐 VLM이 추론하고 정보를 검색할 수 있도록 에이전트 강화 학습을 활용한 멀티턴 멀티모달 RAG 프레임워크입니다.
PiSugar/whisplay-ai-chatbot
Raspberry Pi 기반의 휴대용 AI 챗봇으로 음성 대화, 이미지 생성, 로컬 AI 가속을 지원합니다.
bakrianoo/mazinger
음성 인식, 번역, 음성 클론, 오디오 조립을 하나의 워크플로우로 통합하는 엔드투엔드 동영상 더빙 파이프라인입니다.
facebookresearch/seamless_communication
음성 및 텍스트 모달리티를 지원하며, 100개에 가까운 언어에 대해 고품질의 표현력 있는 실시간 번역을 제공하는 멀티모달 AI 모델 제품군입니다.
octimot/StoryToolkitAI
비디오 푸티지를 텍스트로 변환하고 인덱싱하며 검색하는 AI 기반 영화 편집 어시스턴트입니다. 편집자는 LLM을 사용하여 편집 소프트웨어로 내보낼 스토리 셀렉션을 자동으로 생성할 수 있습니다.
MMMU-Benchmark/MMMU
30개의 다양한 과목에 걸친 대학 수준의 전문 지식과 복잡한 추론을 바탕으로 멀티모달 AI 모델을 평가하기 위한 대규모 다학제 벤치마크입니다.
GPTomics/bioSkills
bioSkills는 시퀀스 I/O에서 싱글셀, 변이 호출, 구조 생물학, 화학 정보학, 워크플로우 관리에 이르기까지 생물정보학 분석을 수행하는 데 사용할 수 있는 사전 준비된 코드 템플릿("스킬")의 라이브러리입니다. Claude Code, Codex, Gemini/Antigravity, OpenCode, OpenClaw에 대한 가벼운 스크립트로 설치 가능하며, 최선의 실천 명령줄 플래그, 예제 스크립트 및 사용 가이드를 제공하여 AI 생성 생물정보학 코드의 정확성을 향상시킵니다.
Jane-xiaoer/paper-collage-ad-codex
OpenAI Codex용의 포괄적인 워크플로우 스킬로, 창의적 스크립팅부터 최종 MP4 렌더링까지 종이 접기 스타일 광고를 자동화하여 생산합니다.
xeronsh/openOii
LangGraph를 사용하여 스토리 아이디어에서 최종 영상 합성까지의 전 과정을 오케스트레이션하는 AI 만화 영상 생성 프로젝트
shang-zhu/violin
원어민처럼 들리는 AI 음성으로 비디오를 33개 언어로 전사, 번역 및 더빙하는 오픈 소스 비디오 번역 도구입니다.
livekit-examples/python-agents-examples
LiveKit Agents 프레임워크를 사용하여 음성, 영상, 전화 AI 에이전트를 구축하기 위한 실행 가능한 Python 예제와 풀스택 애플리케이션의 모음입니다.
Voine/ChatWaifu_Mobile
ChatGPT, 로컬 VITS 음성 합성, 그리고 Live2D 애니메이션을 통합하여 몰입형 캐릭터 기반 AI 동반자를 만드는 Android 애플리케이션입니다.
microsoft/psi
장소 기반 지능(\psi) 플랫폼은 Microsoft가 오픈소스로 제공하는 .NET 프레임워크로, 로봇, 믹스드 리얼리티 어시스턴트, 스마트 스페이스 시스템 등 실시간 다중 모달 AI 애플리케이션을 구축하기 위해 고성능 스트리밍 인프라, 시각화 도구(PsiStudio), 센서/AI 컴포넌트 라이브러리를 제공합니다. Windows 및 Linux에서 동작하며, MIT 라이선스의 NuGet 패키지로 배포되며, 튜토리얼, 샘플, 활발한 커뮤니티를 갖추고 있습니다.
ChaitanyaEswarRajeshJakki/gemini-youtube-automation
Gemini 2.5 Flash를 사용해 인간 개입 없이 매일 교육용 YouTube 동영상 및 Shorts를 작성·생산·업로드하는 자율 AI 봇.
hassancs91/claude-youtube-editor
AI 생성 비주얼, 오디오 클리닝, 자동 업로드를 통해 원본 토킹헤드 녹화 영상을 세련된 영상으로 변환하여 YouTube 영상 편집을 자동화하는 오픈 소스 파이프라인입니다.
suki0dayo/AI_film_studio
프롬프팅을 위한 LLM과 이미지 및 비디오 생성을 위한 ComfyUI 간의 워크플로우를 자동화하여 AI 영화 제작을 간소화하는 노드 기반 시각 편집기.
Anionex/dsh-vision-toolkit
UI 복원, 긴 스크린샷 OCR, GUI 자동화와 같은 작업을 위해 텍스트 전용 모델에 시각적 기능을 부여하는 DeepSeek Harness용 비전 툴킷.
NVIDIAGameWorks/kaolin
NVIDIA에서 제공하는 PyTorch 라이브러리로, 3D 딥러닝을 위한 GPU 최적화 모듈을 제공하며, 미분 가능한 렌더링, 물리 시뮬레이션, 3D 가우시안 스플래트 지원을 포함합니다.
ParisNeo/lollms-webui
텍스트, 이미지, 비디오, 음악 생성을 위한 수백 개의 LLM 및 다중 모달 AI 모델에 접근할 수 있는 통합형 로컬 웹 인터페이스.
GoogleCloudPlatform/vertex-ai-creative-studio
이미지, 동영상, 음악, 음성 생성 및 창작 워크플로우를 통합한 인터페이스를 제공하는 Google Cloud의 생성형 미디어 모델을 탐색하기 위한 웹 애플리케이션입니다.
Stonesjtu/pytorch_memlab
pytorch_memlab는 PyTorch 코드의 각 줄별 CUDA 메모리 사용량을 프로파일링하고, 활성 텐서를 목록으로 보여주며, 일시적으로 GPU 데이터를 CPU로 이동할 수 있는 Python 라이브러리입니다. IPython/Jupyter와의 통합을 통해 PyTorch 모델에서의 메모리 부족 오류 디버깅을 지원합니다.
pnnx/pnnx
pnnx는 PyTorch 모델을 최적화하고 경량이며 종속성 없는 형식(PNNX)과 ncnn/ONNX-zero 파일로 내보내는 오픈소스 도구로, 엣지 디바이스에서 빠른 추론을 가능하게 합니다.
ljquan/opentu
Opentu는 지속적인 AI 작업 실행을 위해 다중 모델 생성과 도구 관리를 하나의 워크스페이스에 통합하는 캔버스 기반 AI 애플리케이션 플랫폼입니다.
OpenSQZ/MiniCPM-V-CookBook
텍스트, 시각, 음성 기능을 지원하는 MiniCPM 시리즈 다중 모달 모델의 배포 및 파인튜닝을 위한 포괄적인 레시피북. 다양한 하드웨어에서 작동 가능.
Cjbuilds/Codex-Orchestration
Codex Orchestration은 Codex 플러그인으로, 다른 LLM(Claude Fable 5, Opus 5, OpenRouter 모델 등)을 작업에 연결하고 각 모델에 특정 역할(기획자, 자문가, 디자이너, 실행자)을 할당할 수 있게 해줍니다. Codex는 최상위 오케스트레이터로서 계획 반복, 검토, 필요 시 UX 아티팩트 설계, 최종 코드 실행을 수행합니다. 플러그인은 Codex 마켓플레이스에서 설치되며, Codex 채팅 내에서 스킬 프롬프트로 구성되며, 역할별 작업 수준을 지원합니다. 계획 품질 향상, 병렬 작업 가능화, 프리미엄 모델 사용량 감소를 목표로 합니다. MIT 라이선스.
dromara/wgai
WGAI는 Spring-Boot + Vue 기반의 웹 플랫폼으로, 비전(OpenCV, YOLO, OCR, 얼굴 인식), 오디오(음성-텍스트 변환, ChatGPT 스타일 대화), 디지털 인간 아바타, AGV 내비게이션을 오프라인 우선, 산업용 수준의 AI 관리 시스템으로 통합합니다. 온라인 데이터 어노테이션, 모델 학습, 실시간 영상/오디오 분석, 시스템 모니터링을 제공하며, 설정용 UI와 공개 데모 인스턴스도 포함됩니다. 코드는 AGPL-3.0이며, 지원은 주로 유료 중국어 커뮤니티를 통해 제공됩니다.
visualbruno/ComfyUI-Hunyuan3d-2-1
Tencent의 Hunyuan3D-2.1 모델을 위한 ComfyUI 래퍼로, 시각적인 노드 기반 워크플로우 내에서 텍스처가 포함된 3D 모델을 생성할 수 있습니다.
zai-org/GLM-V
다중 모달 추론을 강화하고, 네이티브 함수 호출, 시각적 지문, 복잡한 문서 이해를 지원하는 시각-언어 모델(VLM) 시리즈입니다.
PaddlePaddle/ERNIE
텍스트 및 시각 언어 이해에서 최첨단 성능을 제공하는 대규모 멀티모달 MoE 모델 및 개발 툴킷 제품군입니다.
cambrian-mllm/cambrian-s
영상 이해에서 공간 추론 및 "공간 초감지"를 강화하도록 설계된 멀티모달 LLM 및 데이터셋 모음입니다.
qualcomm/aimet
AIMET는 PyTorch/ONNX 모델을 양자화하고 압축하는 Qualcomm의 오픈 소스 툴킷으로, 정확도 손실을 최소화하면서 엣지 디바이스에서 빠르고 메모리 사용량이 적은 추론을 가능하게 합니다.
SamurAIGPT/AI-Influencer-Generator
Stable Diffusion, gTTS, SadTalker를 사용하여 소셜 미디어용 일관된 가상 AI 인플루언서를 만들고 애니메이션화하는 오픈소스 파이프라인입니다.
volcengine/rtc-aigc-demo
실시간 음성 기반 AI 상호작용을 위한 RTC, ASR, LLM, TTS를 통합한 인터랙티브 AIGC 파이프라인을 보여주는 데모 프로젝트입니다.
ShayneP/local-voice-ai
음성 인식, LLM, 음성 생성 모델을 사용하여 로컬에서 실행되는 사생활 보호형 저지연 음성 보조자입니다.
sympozium-ai/sympozium
Sympozium은 멀티 에이전트 AI 시스템을 조정하는 오픈소스 Kubernetes 네이티브 플랫폼입니다. CRD 기반 정책, 공유 SQLite 메모리, 사이드카 격리 스킬, 비주얼 워크플로 캔버스를 제공하여 거버넌스와 관찰 가능성을 내장하면서 팀이 에이전트를 대규모로 오케스트레이션할 수 있게 합니다.
nv-tlabs/Gamma-World
Gamma-World는 여러 독립적으로 제어 가능한 에이전트가 공유 환경에서 동시에 상호작용하는 생성형 다중 에이전트 월드 모델로, 24 FPS에서 실시간 인터랙티브 비디오 생성을 지원합니다.
kandinskylab/kandinsky-5
텍스트 또는 이미지에서 고품질 비디오와 이미지를 생성하는 확산 모델 패밀리이며, Pro와 Lite 버전을 제공하고 영어와 러시아어 지원이 강력합니다.
OliBomby/Mapperatorinator
오디오 스펙트로그램으로 완전한 osu! 비트맵을 생성하고, 매핑 불일치를 감지하는 AI 기반 모딩 도구를 제공하는 멀티 모델 AI 프레임워크.
IBM/terramind
지구 관측을 위한 임의의 입력-출력 생성 기초 모델로, 다중 모달 공간 데이터 생성과 환경 모니터링을 가능하게 합니다.
AvaLovelace1/BrickGPT
BrickGPT는 Llama-3.2 모델을 미세 조정하여 텍스트 프롬프트로부터 물리적으로 안정적이고 조립 가능한 장난감 블록 모델을 생성하는 AI 시스템입니다.
johnson7788/MultiUserClaw
MultiUserClaw는 Docker 기반의 SaaS 프레임워크로, 여러 사용자를 위한 격리된 AI 어시스턴트(Hermes 에이전트)를 실행할 수 있습니다. React 프론트엔드, 인증 및 컨테이너 관리, LLM 프록시용 FastAPI 게이트웨이, 사용자별 Hermes 컨테이너, PostgreSQL 스토리지, 지식 기반, 스킬 스토어, cron 작업, 다중 채널 봇, 다중 모델 지원 등의 기능을 포함합니다.