worm128/AI-YinMei
LLM, 스트리밍 TTS, 가상 아바타를 통합한 원스톱 AI 라이브 스트리밍 플랫폼으로, 여러 스트리밍 플랫폼용 상호작용 가능한 AI 봇을 생성합니다.
talesofai/neta-skills
Neta Art API를 위한 AI 에이전트용 스킬 및 CLI 도구 모음으로, 에이전트가 멀티미디어 생성, 캐릭터 관리 및 인터랙티브 스토리 어드벤처를 실행할 수 있도록 합니다.
facebookresearch/tuna-2
Tuna-2는 복잡한 비전 인코더와 VAE를 직접적인 픽셀 임베딩으로 대체하여 이미지 이해와 생성을 모두 향상시키는 통합 멀티모달 모델입니다.
aimclub/FEDOT
FEDOT는 진화 알고리즘을 사용하여 머신러닝 파이프라인(전처리, 특징 공학 및 모델 포함)을 자동으로 설계하고 최적화하는 오픈 소스 Python AutoML 프레임워크입니다. 분류, 회귀, 클러스터링, 시계열 예측을 지원하며, 인기 있는 ML 라이브러리와 통합되고, 간단한 고수준 API와 재현 가능한 파이프라인 내보내기를 제공합니다.
LucasAlegre/morl-baselines
MORL‑Baselines는 신뢰할 수 있는 다목적 강화학습 알고리즘(싱글 및 멀티 정책, SER/ESR)을 포함하는 PyTorch 라이브러리입니다. MO‑Gymnasium API를 따르며, 유틸리티, 자동 W&B 로깅, Open RL Benchmark와의 통합을 통해 재현 가능한 실험을 지원합니다.
zrt-ai-lab/ViNote
YouTube, Bilibili 및 로컬 파일의 비디오를 구조화된 노트, 마인드맵 및 검색 가능한 지식 자산으로 변환하는 AI 기반 도구입니다.
BlockRunAI/blockrun-mcp
BlockRun MCP는 오픈소스 MCP 서버로, AI 에이전트(Claude, Codex 등)가 실시간 시장 데이터, 웹 검색, 미디어 생성, 체인 내 쿼리, 그리고 Polymarket에서 실제 USDC로 베팅할 수 있는 19개의 도구에 접근할 수 있게 합니다. 에이전트는 자체 보관 USDC 지갑(사용자 지갑 서명 또는 x402 마이크로결제 프로토콜을 통해) 또는 사전 결제된 API 키를 통해 호출당 지불합니다. 서버는 단일 `npx` 명령어로 설치되며, 여러 MCP 호환 클라이언트와 호환되며, 사람의 개입을 통한 지출 승인을 지원하여 자율 에이전트가 실시간 데이터에 접근하고 실제 행동을 수행할 수 있는 실용적인 다리 역할을 합니다.
guochengqian/Magic123
2D와 3D 확산 사전 모델을 결합하고, 거친 단계에서 세밀한 단계로 진행하는 파이프라인을 통해 단일 2D 이미지에서 고품질 3D 객체를 생성하는 시스템.
pykale/pykale
멀티모달 및 전이 학습을 위한 PyTorch 기반 라이브러리로, 지속 가능하고 재사용 가능한 AI 워크플로우를 만들기 위한 표준화된 파이프라인 기반 API를 제공합니다.
rockbenben/img-prompt
5,000개 이상의 이중 언어 태그를 갖춘 시각적이고 다국어 지원 프롬프트 빌더로, 사용자가 큐레이션된 태그 라이브러리와 미리보기 이미지를 활용해 고품질 영어 프롬프트를 구성할 수 있도록 돕습니다.
huggingface/finetrainers
메모리 효율적인 텍스트‑투‑비디오 및 텍스트‑투‑이미지 생성을 중심으로, 확산 모델의 접근 가능한 학습 및 파인튜닝을 위한 라이브러리입니다.
laminlabs/lamindb
LaminDB는 특히 다중 모달 생명과학 데이터를 위한 오픈소스이며 Git 스타일의 데이터 관리 시스템입니다. 파일, 테이블, 배열 형식을 버전 관리하고, 코드 및 환경의 프로반스를 추적하며, 브랜치/머지 기능을 지원하고, SQLite/Postgres에 ACID 안전한 메타데이터를 저장합니다. Python/R 도구(Polars, DuckDB), 생물학적 온톨로지, 워크플로우 매니저와 통합되어 연구 및 바이오텍 분야의 추적 가능하고 FAIR 준수 데이터셋을 제공합니다.
Woolverine94/biniou
8GB RAM 정도의 기본적인 하드웨어에서도 텍스트, 이미지, 오디오, 비디오, 3D 생성을 지원하는 다양한 생성형 AI 모델을 로컬에서 실행할 수 있는 자체 호스팅 웹 인터페이스입니다.
hoanganh8389/bizcity-twin-ai
Bizcity Twin AI는 사이트를 기업용 통합 AI "뇌"로 전환하는 오픈소스 WordPress 플러그인입니다. 다양한 채널에서 오는 메시지를 표준화하고, 증거를 포함한 단일 지식 그래프(KG)를 구축하며, 관리형 제어 플레인(MCP)을 통해 LLM(Claude, ChatGPT 등)에 데이터를 노출합니다. 핵심 서비스(아이덴티티, KG, 추론, 자동화, 로깅, 권한)는 불변이며, 개발자는 가벼운 플러그인(act, channel, view)을 통해 도메인 특화 기능을 추가할 수 있습니다. 프로젝트는 CLI 스크래핑 도구, 진단 기능, 라이브 데모를 제공하며, GPL-2.0-or-later 라이선스로 배포됩니다.
Minidoracat/mcp-feedback-enhanced
MCP Feedback Enhanced 는 장시간 AI 작업 중 인간의 피드백을 위한 웹 기반(선택적 Tauri 데스크톱) UI를 제공하는 보안 강화형 MCP 서버입니다. 로컬, SSH, WSL 환경에서 작동하며, 세션 추적, 이미지, 마크다운, 다국어 UI를 지원하며, 원본 interactive-feedback-mcp 프로젝트의 포크로 유지되고 있습니다.
cyx2333hhh/talk-type
실시간 음성 인식, 로컬 Whisper 폴백, AI 기반 텍스트 정제를 결합한 macOS용 음성 입력 도구로, 애플리케이션 간 원활한 이중 언어 입력을 제공합니다.
Blacktrupersist/hailuo-ai-pulse
Hailuo AI Pulse는 Windows용으로 최적화된 간결한 AI 워크스페이스로, 콘텐츠 생성, 분석, 창의적 자동화 기능을 제공합니다.
backblaze-labs/genblaze
해시 검증된 출처 매니페스트가 내장된 생성형 비디오, 오디오 및 이미지 워크플로우 오케스트레이션을 위한 AI 파이프라인 SDK.
AvalancheAlbatross/midjourney-lab
Midjourney Lab은 텍스트, 이미지, 오디오, 비디오의 다중 모달 생성 및 처리를 지원하는 Windows 기반 기계학습 플랫폼입니다.
ling-kong-ran/pisper
Pisper는 브랜치 생성, 병렬화 및 LLM 대화를 자동화할 수 있는 크로스 플랫폼 멀티 에이전트 채팅 및 워크플로우 도구입니다. 오픈 소스인 Pi Coding Agent를 기반으로 구축되었으며, 데스크톱, 터미널, 모바일 클라이언트를 제공하고, 온디맨드 플러그인, 보안 로컬 전용 데이터 저장소, 그리고 선택적인 LAN/P2P 원격 연결 기능을 제공합니다.
matterantmill/kling-ai-pulse
콘텐츠 생성, 분석 및 창의적 자동화를 위한 경량 Windows AI 워크스페이스입니다.
v-modal/vmodal_sdk_android
비디오 및 이미지 라이브러리에 멀티모달 의미 검색을 추가하는 Android SDK로, 사용자가 의미에 따라 특정 순간을 찾을 수 있도록 합니다.
GangTailorUpgrade/undress-service
옷장을 디지털화하고 생성형 AI를 사용하여 날씨, 상황, 스타일에 따라 의상을 추천하고 시각화하는 셀프 호스팅 AI 패션 플랫폼입니다.
AutoArk/TinyEngram
LLM 및 Stable Diffusion에 Engram 기반 메모리 주입을 탐구하여 파라미터 효율적인 지식 업데이트를 파괴적 망각 없이 가능하게 하는 오픈 리서치 프로젝트.
AutoArk/EVA-OS
실시간 다중 모달 애플리케이션과 스마트 하드웨어를 위한 AIOS로, AI 네이티브 코딩에서 온디바이스 추론에 이르기까지 통합된 개발 경험을 제공합니다.
flatkey-ai/flatkey-cli
단일 API 키와 크레딧 잔액을 통해 이미지, 비디오, 오디오 및 텍스트를 생성할 수 있는 통합 멀티모달 AI 생성용 명령줄 인터페이스.
hezo-ai/hezo
Hezo는 샌드박스 컨테이너 내에서 AI 에이전트의 조직화된 팀(CEO, 캡틴, 엔지니어, 디자이너 등)을 구축하고 실행할 수 있는 오픈소스 서버 + 웹 UI입니다. 자체 LLM 공급자 키를 제공하고 토큰 및 컨테이너 시간 예산을 설정하면 플랫폼이 비밀 보호, Git 통합, 다양한 모델 런타임을 정규화하는 통합 "메타 하네스"를 처리합니다. 단일 바이너리로 설치하고, 자체 호스팅하거나 Hezo Cloud를 사용하며, 조직도 스타일 UI로 프로젝트를 관리합니다.
dreamers-laboratory/image-to-3d-pipeline
사용자가 여러 오픈소스 재구성 모델을 실행하고 비교하여 최적의 출력물을 찾을 수 있도록 하는, 이미지를 3D 메시로 변환하는 파이프라인입니다.
AkshitIreddy/Interactive-LLM-Powered-NPCs
기존 오픈월드 게임의 소스 코드를 수정하지 않고도 NPC에 동적이고 LLM 기반의 음성 대화와 동기화된 얼굴 애니메이션을 추가하는 시스템입니다.
Hchen1218/heytea-style
시각적 요소를 추출하여 일관된 캐릭터를 생성함으로써 사진을 손그림 포스터와 인터랙티브 데스크톱 펫으로 변환하는 창의적 도구 키트
chflame163/ComfyUI_LayerStyle_Advance
고품질 이미지 캡셔닝, VLM 추론, 그리고 로컬 모델 및 외부 API를 사용한 복잡한 이미지 합성을 위한 고급 ComfyUI 노드 모음입니다.
dexhunter/seedance2-skill
Seedance 2.0(ByteDance의 멀티모달 모델)을 위한 올바른 비디오 생성 프롬프트를 작성하는 방법을 안내하는 Claude 호환 '스킬'입니다. Markdown 파일을 ~/.claude/skills 에 복사하거나 npx skills add 를 통해 설치할 수 있습니다. 이 가이드는 제약 사항, 참조 구문, 카메라 언어, 프롬프트 구조, 그리고 광고, 드라마, 뮤직비디오, 교육용 영상 등을 위한 템플릿을 포함하며, ByteDance 공식 문서를 기반으로 합니다. MIT 라이선스.
11273/mooc-work-answer
크로스플랫폼 Python 도구로 중국 MOOC 서비스(지혜직교, AI 우커, 자원庫)에서 학습 진도 추적, 디스커션 게시, AI 지원 과제 힌트를 자동화합니다. 공식 API와 통신하며, 선택적으로 DeepSeek을 호출해 참조 답변(60–100% 관련성)을 생성합니다. 사전 빌드된 실행 파일 또는 소스 코드에서 실행 가능하며, 인간의 사용을 모방하기 위한 안전한 지연 시간을 포함합니다.
taruma/SceneFlow
AI 영화 제작자가 프롬프트 준수도를 분석하고 AI 영상 모델이 스크립트 지시사항을 어떻게 시각화했는지 평가할 수 있도록 도와주는 스크립트-투-스크린 동기화 도구입니다.
geometric-kernels/GeometricKernels
GeometricKernels는 비유클리드 도메인(다양체, 그래프, 메쉬)을 위한 열 커널 및 Matérn 커널을 제공하는 Python 라이브러리입니다. 가우스 과정 모델을 이러한 공간에서 실행할 수 있게 하며, TensorFlow (GPflow), PyTorch (GPyTorch), JAX (GPJax)용 어댑터를 제공합니다. `pip install geometric_kernels`로 설치하고 필요한 백엔드를 추가하여 사용하세요. 저장소에는 방대한 노트북, JMLR 논문 인용, 명확한 기여 워크플로우가 포함되어 있습니다.
JuliaDiff/ReverseDiff.jl
ReverseDiff.jl은 빠르고 테이프 기반의 역방향 자동 미분을 구현하는 Julia 라이브러리로, 네이티브 Julia 코드의 기울기, 야코비안, 헤시안 및 고차 미분을 계산할 수 있습니다. 테이프 재사용, 비할당 선형대수 최적화, ForwardDiff와의 혼합 모드 호환성 등을 제공하며, 기계학습 또는 과학계산 프로젝트에서 효율적인 기울기 계산을 필요로 하는 백엔드로 적합합니다.
mir-group/flare
FLARE(Fast Learning of Atomistic Rare Events)는 스파스 가우시안 프로세스 회귀와 ACE 유형 기술자를 사용하여 베이지안 원자간 힘장을 구축하는 Python 라이브러리입니다. 불확실성 인식 분자역학, 실시간 활성 학습, LAMMPS 페어 스타일 구현을 제공하여 재료 및 희귀 사건의 빠르고 정확한 시뮬레이션을 가능하게 합니다.
BINE022/EEGPT
EEGPT는 이중 자기지도 학습 방식을 사용하여 낮은 신호 대 잡음비(SNR) 문제를 극복하기 위한 일반적인 EEG 특징 추출을 위한 사전 학습된 트랜스포머 모델입니다.
IBM/materials
IBM/materials는 화학 및 재료 과학을 위한 진정한 오픈소스 대규모 기초 모델 세트입니다. SMILES, SELFIES, 그래프, 3차원 구조 등의 단일 모달 모델과 다모달 융합 도구를 모두 통합된 Python 래퍼(FM4M‑Kit) 또는 Hugging Face 웹 UI를 통해 접근할 수 있습니다. 리포지토리에는 설치 지침, 예제 노트북, Hugging Face에서 호스팅된 모델 링크가 포함되어 있습니다.
hankcs/HanLP
HanLP는 오픈 소스 다국어 NLP 툴킷(Python 코어, Java/Go 클라이언트)으로, 토큰화, 품사 태깅, 개체명 인식(NER), 구문 분석, 의미역 결정(SRL), AMR, 요약, 감성 분석, 언어 감지 등을 위한 프로덕션급 사전 학습 모델을 제공합니다. 경량 RESTful 서비스(GPU 불필요)와 PyTorch/TensorFlow 기반의 네이티브 Python 라이브러리라는 두 가지 API를 제공합니다. 130개 언어를 지원하며, 속도 중심의 다중 작업 공동 모델과 고정밀 단일 작업 모델을 모두 갖추고 있습니다. 설치는 `pip install hanlp`(네이티브) 또는 `pip install hanlp_restful`(REST)로 간단히 수행할 수 있습니다. 이 라이브러리는 일관된 JSON 출력을 반환하며, 시각화 도구, 사용자 정의 사전 지원 및 방대한 문서를 포함합니다.
Dooy/chatgpt-web-midjourney-proxy
ChatGPT와 Midjourney, 그리고 수십 개의 생성형 AI 백엔드(이미지, 비디오, 음악, 댄스, 얼굴 교체)를 통합한 웹 UI입니다. Docker, Vercel 또는 사전 빌드된 바이너리를 통해 배포하며, 환경 변수를 통해 구성합니다. 음성 입력, GPT-4-vision을 위한 이미지 업로드, 실시간 채팅, 모델 엔드포인트를 교체할 수 있는 'GPT-Store'를 지원합니다.
Relaxed-System-Lab/Flash-Sparse-Attention
Flash‑Sparse‑Attention (FSA)은 Native Sparse Attention의 최적화 버전을 구현한 Triton 기반 PyTorch 모듈입니다. 루프 재정렬과 3개의 특수 커널로 작업을 분할하여 메모리 트래픽을 줄이고 원자적 가산(atomic add)을 제거함으로써, 최신 NVIDIA GPU에서 긴 시퀀스 LLM 학습 및 추론 속도를 2‑3배 향상시킵니다. PyTorch ≥ 2.4, transformers ≥ 4.45와 호환되며 Ampere/Hopper 하드웨어에서 fp16/bf16을 지원합니다.
fcakyon/phd-skills
Claude Code용의 제로의존 플러그인으로, 연구용 가드레일, 자동 트리거 스킬, 백그라운드 에이전트를 추가하여 논문 재현, 실험 디버깅, 트레이닝 시작 시 AI 어시스턴트의 고비용 실수(잘못된 설정, 검증되지 않은 주장, 파괴적 명령어)를 방지하는 데 도움을 줍니다.
jmiao24/Paper2Agent
Paper2Agent는 연구 논문(및 해당 코드)을 자동으로 실행 가능한 MCP 서버로 변환하여 논문의 방법론을 AI가 호출할 수 있는 도구로 노출하는 멀티 에이전트 Python 시스템입니다. 사용자는 'paper2agent' 스킬을 코딩 어시스턴트(Claude Code, Codex, Gemini CLI)에 설치한 다음, 어시스턴트에게 논문 URL을 '에이전트화'하도록 프롬프트를 보냅니다. 이 시스템은 전문 하위 에이전트를 생성하여 논문을 파싱하고, 격리된 환경을 설정하며, 원본 코드를 래핑하고, 검증 테스트를 실행한 후, 사용 지침과 함께 모든 것을 ZIP 파일로 번들링합니다. 생성된 서버는 로컬에서 실행하거나 Hugging Face에 호스팅할 수 있으며, 이후 코딩 어시스턴트에 다시 연결하여 대화형 과학 쿼리를 수행할 수 있습니다.
huggingface/meshgen
AI 에이전트를 사용하여 자연어로 3D 모델링을 제어할 수 있게 해주는 Blender 애드온으로, 로컬 및 원격 LLM 백엔드를 모두 지원합니다.
marcellodebernardi/loss-landscapes
`loss‑landscapes`는 모델의 파라미터 공간의 저차원 슬라이스에서 스칼라 메트릭(손실, 기울기 노름, 곡률, 기대 수익 등)을 샘플링하여 손실면 시각화를 쉽게 만드는 PyTorch 라이브러리입니다. 유연한 `Metric` 추상화, 부분공간 생성기(선, 평면 등), 그리고 표준 모델과 RL 에이전트 모두를 지원하는 `ModelWrapper`를 제공합니다. 원래 2019년 릴리스는 손상되어 있으며, API가 변경될 수 있으므로 현재 재작성이 진행 중입니다.
20000419/fauxnix
fauxnix는 npm 기반 도구로, 선택된 bash 명령어 하위 집합을 PowerShell로 변환하여 LLM 에이전트가 가상 머신 없이 Windows에서 익숙한 Linux 스타일 명령어를 실행할 수 있게 합니다. 결정론적 번역, MCP 서버 통합, 배치 실행, 광범위한 테스트를 제공하며, Windows 환경에서 AI 기반 코드 보조 도구의 신뢰성을 향상시키는 것을 목표로 합니다.
Aperivue/medsci-skills
MedSci Skills는 임상 연구의 전체 파이프라인(문헌 검색, 연구 설계, 데이터 정리, 통계 분석, 논문 작성, 규정 준수 확인, 그리고 AI 연구를 위한 재현 가능한 모델 스캐폴딩 및 검증)을 자동화하는 59개의 AI 에이전트 '스킬'의 오픈소스 컬렉션입니다. Claude Code, Copilot, Cursor 등을 위해 설계되었으며, npx, GitHub CLI 또는 Claude 플러그인을 통해 설치할 수 있습니다. 또한 논문, 도표, 가이드라인 준수 감사 보고서를 출력하는 엔드투엔드 데모(진단 정확도, 메타 분석, 역학, CNN 세그멘테이션, 외부 검증)를 제공합니다.