johnson7788/MultiUserClaw
MultiUserClaw는 Docker 기반의 SaaS 프레임워크로, 여러 사용자를 위한 격리된 AI 어시스턴트(Hermes 에이전트)를 실행할 수 있습니다. React 프론트엔드, 인증 및 컨테이너 관리, LLM 프록시용 FastAPI 게이트웨이, 사용자별 Hermes 컨테이너, PostgreSQL 스토리지, 지식 기반, 스킬 스토어, cron 작업, 다중 채널 봇, 다중 모델 지원 등의 기능을 포함합니다.
video-db/call.md
실시간으로 회의를 기록하고 음성 인식하며, 라이브 AI 코칭, 대화 메트릭, 자동 회의 후 요약을 제공하는 데스크톱 앱입니다.
new-sankaku/manga-editor-desu
전문적인 레이아웃 및 텍스트 도구를 결합하고, 선택적 AI 이미지 생성 및 LLM 프롬프트 지원을 제공하는 웹 기반 만화 제작 도구입니다.
EvolvingLMMs-Lab/NEO
NEO는 픽셀과 단어 처리를 통합하여 효율적인 멀티모달 이해를 구현하기 위해 인코더 프리(encoder-free) 밀집 아키텍처를 사용하는 일련의 네이티브 시각-언어 모델입니다.
TIGER-AI-Lab/VLM2Vec
텍스트, 이미지, 비디오, 오디오 및 시각적 문서에 대해 고정된 차원의 벡터를 생성하는 전 모달리티 임베딩 모델의 학습 및 평가를 위한 통합 프레임워크입니다.
roboflow/maestro
Florence-2, PaliGemma 2, Qwen2.5-VL과 같은 멀티모달 시각-언어 모델의 미세 조정(fine-tuning)을 가속화하기 위한 간소화된 도구입니다.
R3gm/SoniTranslate
SoniTranslate는 음성을 동기화하면서 동영상을 다른 언어로 번역할 수 있는 웹 애플리케이션으로, 전사, 번역, 음성 더빙을 하나의 인터페이스에서 통합합니다.
ailia-ai/ailia-models
비전, 오디오, 텍스트 등 다양한 도메인의 사전 학습된 AI 모델 419개 모음으로, 통합 CLI와 자동 가중치 다운로드로 모두 실행 가능합니다.
ohdearquant/lionagi
lionagi는 다중 에이전트 LLM 워크플로우를 구축, 실행, 관리하기 위한 Python 라이브러리 및 CLI입니다. 타입 지정된 지속 가능한 대화 상태를 제공하며, 병렬 팬아웃과 DAG 기반 흐름을 지원하고, 모델 전용 CLI 및 API 제공자 모두를 통합하며, 시각적 실행 관리를 위한 웹 UI(Lion Studio)를 포함합니다.
nikvdp/cco
cco는 Claude Code, Codex 등 AI 코드 에이전트를 격리된 환경에서 실행하는 보안 래퍼로, 프롬프트 인젝션과 실수로 인한 시스템 손상 위험을 방지하면서도 원활한 터미널 경험을 유지합니다.
Sportinger/MasterSelects
AI 코딩 에이전트가 창작 과정 중에 워크스페이스 내부에 직접 새로운 도구와 효과를 구축할 수 있는 브라우저 기반의 비디오, 오디오, 3D 미디어 에디터입니다.
OfficeDev/microsoft-365-agents-toolkit
Microsoft에서 제공하는 툴킷(VS Code/Visual Studio 확장 및 CLI)으로 Microsoft 365 Copilot, Teams, Office용 AI 기능을 갖춘 에이전트, 챗봇, 확장 기능의 스텁 생성, 디버깅, 배포가 가능합니다. 인증 헬퍼, Azure Functions 지원, 핫리로드 디버깅, CI/CD 파이프라인을 포함하며, JavaScript/TypeScript 및 .NET 개발자를 대상으로 합니다.
shrimbly/node-banana
이미지, 동영상, 오디오, 3D 콘텐츠에 대한 여러 제공자에 걸쳐 복잡한 AI 미디어 생성 파이프라인을 구축하기 위한 시각적 노드 기반 워크플로우 에디터입니다.
modelstudioai/cli
Aliyun Model Studio CLI (bailian‑cli)는 Alibaba Cloud AI 플랫폼용 터미널 도구로, 텍스트, 이미지, 동영상, 음성 생성, 자산 이해, 관리형 에이전트 오케스트레이션, 데이터셋 검증, 피니튜닝, 배포 및 계정 관리를 위한 명령어를 제공합니다. npm 또는 단일 줄 스크립트로 설치 가능하며, API 키 또는 OAuth로 인증한 후 `bl …` 명령어를 실행하거나, AI 에이전트가 자연어 프롬프트를 CLI 호출로 번역해주는 기능을 활용할 수 있습니다.
NetManAIOps/ChatTS
ChatTS는 다변량 시계열 데이터를 네이티브하게 이해하고 추론할 수 있도록 설계된 멀티모달 LLM으로, 사용자가 수치 데이터에 대해 대화형 질문-응답을 수행할 수 있게 합니다.
jimmysu0309/shinkansen
Shinkansen은 Google Gemini, Google Translate 또는 사용자 정의 OpenAI 호환 모델을 사용하여 웹 페이지, YouTube 자막, 문서(PDF, Word, EPUB 등)를 번역하는 실제 AI 기반 브라우저 확장 프로그램입니다. 원래 레이아웃과 타임스탬프를 유지하고, 이중 언어 출력을 제공하며, 프라이버시를 위해 파일을 로컬에서 처리합니다.
Graylab/IgFold
IgFold는 아미노산 서열에서 항체의 3D 구조를 예측하는 딥러닝 도구로, 신약 발견을 위한 빠르고 정확한 구조 모델링을 가능하게 합니다.
apple-aiml-research/ml-fastvlm
FastVLM은 고해상도 이미지 처리 시 응답 지연과 토큰 수를 극적으로 줄이는 효율적인 시각 인코딩 프레임워크로, 하이브리드 인코더인 FastViTHD를 사용합니다.
apple-aiml-research/ml-flextok
FlexTok은 이미지를 유연한 길이의 1차원 토큰 시퀀스로 재샘플링하는 시스템으로, 이미지를 자르더라도 이미지 재구성 가능하도록 표현할 수 있습니다.
merveenoyan/smol-vision
최신 시각 및 멀티모달 AI 모델을 효율성과 성능 향상을 위해 축소, 최적화, 맞춤화하는 레시피 모음입니다.
sign/translate
수어 영상을 말하는 언어의 텍스트와 음성으로, 말하는 언어를 아바타 또는 GAN을 통해 수어로 실시간으로 양방향으로 변환하는 시스템입니다.
Pangu-Immortal/MagicWX
ONNX, MediaPipe, MNN 등의 로컬 런타임을 사용하여 완전히 오프라인 상태에서 텍스트 채팅과 Stable Diffusion 이미지 생성을 가능하게 하는 Android 앱입니다.
AIFrontierLab/TorchUMM
단일 인터페이스를 통해 이미지 이해, 생성 및 편집을 지원하는 멀티모달 모델의 추론, 평가 및 사후 훈련을 위한 통합 프레임워크입니다.
aiqm/torchani
TorchANI 2.0은 PyTorch 라이브러리로, GPU 가속 에너지/힘 예측, 분자 동역학 및 ML/MM 시뮬레이션을 위한 도구를 제공하며 ANI 스타일의 뉴럴 네트워크 원자 간 포텐셜의 훈련과 사용을 지원합니다.
escalante-bio/mosaic
mosaic는 수십 가지 단백질 특성 및 구조 예측 모델을 통합한 JAX 기반 Python 라이브러리입니다. 사용자가 결합 친화도, 안정성, 용해성, 역폴딩 가능성 등 다양한 미분 가능한 손실 항을 조합하고 사용자 정의 최적화기로 연속 리라크세이션 설계를 실행할 수 있어, JIT 가속 프레임워크 내에서 다목적 단백질 공학이 가능합니다. 이 저장소에는 Boltz, AlphaFold, OpenFold‑3, Protenix, ProteinMPNN, ESM 등 최신 모델, 예제 노트북, 상세한 문서가 포함되어 있지만, 사용자는 하이퍼파라미터를 조정하고 GPU/TPU 호환 JAX 설치가 필요합니다.
PozzettiAndrea/ComfyUI-Sharp
Apple의 SHARP 모델용 ComfyUI 래퍼로, 단일 이미지에서 1초 미만으로 3D 가우시안 스플래터링을 가능하게 합니다.
2U1/Qwen-VL-Series-Finetune
Qwen-VL 시리즈 모델(Qwen2-VL, Qwen2.5-VL, Qwen3-VL, Qwen3.5)을 파인튜닝하기 위한 학습 툴킷으로, SFT, DPO, GRPO 및 멀티모달 데이터를 지원합니다.
tong-io/tongflow
TongFlow는 간단한 '추가', '변환', '결합' 노드를 연결하여 다중 모달 생성형 AI 파이프라인을 구축할 수 있는 오픈소스 시각적 스튜디오입니다. 텍스트, 이미지, 비디오, 오디오, 3D, 문서를 지원하며, 풍부한 플러그인 생태계(공식 API 플러그인, 라우터, GPU/CPU 계산 플러그인)를 갖추고 있으며, 가벼운 데스크톱 클라이언트 또는 자체 호스팅 백엔드로 사용 가능합니다. AGPL-3.0 라이선스.
Simbastack-hq/framedex
모든 파일에 대해 플레인 텍스트 AI 설명, 자막, 메타데이터 사이드카를 생성하는 동영상 및 사진 아카이브용 검색 가능한 지식 기반.
geekyutao/Inpaint-Anything
SAM과 생성형 인페인팅 모델을 결합한 통합 프레임워크로, 이미지, 동영상, 3D 장면에서 객체를 제거, 채우거나 대체할 수 있습니다.
dai-hongtao/InkTime
비전 모델을 사용하여 추억을 점수화하고 캡션을 달아, "역사 속의 오늘" 중 최고의 사진을 매일 보여주는 AI 기반 e-ink 사진 액자.
AlexGladkov/claude-in-mobile
`mcp-devices` (또는 `claude‑in‑mobile`)는 모듈식 Node/Rust 서버로, Claude 스타일 AI 에이전트가 안드로이드, iOS, 웹, 데스크톱, Aurora, HarmonyOS 장치를 제어할 수 있게 해줍니다. 기본 패키지(`npm i -g mcp-devices`)를 설치하고, 플랫폼 플러그인(예: `@mcp-devices/plugin-android`)을 추가해 활성화한 후, MCP 호환 클라이언트를 서버에 연결합니다. 스크린샷, 탭, UI 검사, 실시간 디버깅, 테스트 등의 기능을 제공하여 AI 기반 장치 자동화와 몸체화 에이전트 연구를 가능하게 합니다.
OTeam-AI4S/ODesign
특정 타겟에 결합하도록 설계된 단백질, 리간드, 핵산을 생성하는 모든 원자 기반 생성형 월드 모델.
qntx/ovo
Ovo는 삽입 가능한 다중 에이전트 런타임 커널을 제공하는 Rust 라이브러리입니다. 호스트 애플리케이션이 Rhai 스크립트를 실행하는 가벼운 에이전트(턴)를 생성할 수 있으며, macOS Seatbelt 또는 Linux Landlock을 활용한 선택적 OS 수준 샌드박스를 지원합니다. 이 라이브러리는 구성 가능한 승인 정책, 샌드박스 백엔드 트레이트, 그리고 격리된 파일시스템 액세스를 위한 선택적 툴킷 기능을 제공합니다. 현재 버전은 0.9.x로, 준비되지 않은 상태이며 MIT/Apache-2.0 이중 라이선스로 제공됩니다.
facebookresearch/MetaCLIP
영어 성능을 저하시키지 않고 고성능의 다언어 이미지-텍스트 정렬을 가능하게 하는 세계 규모로 확장 가능한 CLIP 레시피
skrub-data/skrub
skrub은 데이터프레임 중심의 정리, 인코딩 및 유사성 그룹화 도구를 제공하는 Python 라이브러리로, 모두 scikit-learn 호환 변환기로 래핑되어 표 형식 머신러닝 파이프라인의 전처리 단계를 간소화합니다.
liangnjupt/VisTouch
로봇 슬라이딩 접촉에서 얻은 영상, 음성, 촉각 힘 데이터의 대규모 동기화 데이터셋으로, 재료 인식과 크로스모달 학습에 사용됨.
livekit/rust-sdks
LiveKit을 위한 Rust 클라이언트 SDK로, 데스크톱 및 모바일 플랫폼에서 실시간 비디오/오디오/데이터 스트리밍, 룸 관리 및 하드웨어 가속 인코딩을 지원합니다.
pinellolab/DNA-Diffusion
200bp의 세포 유형 특이적 합성 조절 DNA 서열을 생성하기 위한 확산 기반 생성 모델입니다.
OpenMOSS/AnyGPT
AnyGPT는 이산 토큰화를 사용하여 텍스트, 음성, 이미지, 음악 등 모든 모달리티를 통합하는 오픈소스 다중 모달 LLM입니다. 베이스 및 채팅 체크포인트, 추론 스크립트, 그리고 학습 및 제로샷 다중 모달 작업용 AnyInstruct 데이터셋을 제공합니다.
MoonshotAI/Kimi-K2.5
Kimi K2.5는 1조 파라미터 MoE 아키텍처를 갖춘 오픈소스이자 네이티브 멀티모달 에이전트 모델로, 시각과 언어 이해를 통합하여 복잡한 작업 수행을 가능하게 합니다.
muthuishere/mcp-server-bash-sdk
MCP 2026-07-28의 순수 Bash 구현체로, AI 에이전트 도구 호출을 위한 오버헤드 없는 stdio 및 로컬 HTTP 바인딩을 제공합니다. `tool_*` 함수 자동 탐지, 공식 스키마 기반 JSON 검증, 완전한 테스트 세트, 사용자 정의 Bash 기반 MCP 서버 구축을 위한 단계별 문서를 포함합니다.
receptron/mulmocast-cli
JSON 기반 중간 언어인 MulmoScript를 사용해 동영상, 팟캐스트, 슬라이드 데크 등 다중 모달 콘텐츠를 생성하는 AI 네이티브 프레젠테이션 플랫폼입니다.
lupantech/MathVista
MathVista는 31개의 멀티모달 데이터셋에서 추출한 6,141개의 예제를 통합하여, 시각적 맥락에서 기초 모델의 수학적 추론 능력을 평가하는 벤치마크입니다.
jiaxiaogang/HE
he4o는 Helix 엔트로피 감소 이론을 기반으로 한 AGI 시스템으로, 사전 설계된 규칙과 동적 학습을 결합하여 신체적 지능과 생애 주기 학습을 달성합니다.
Yu-Yang-Li/StarWhisper
천체망원경 관측 자동화, 광도 곡선 및 펄서 분류, 천문학 연구에 특화된 스킬 팩을 제공하는 AI 프레임워크입니다.
gokayfem/ComfyUI_VLM_nodes
비전-언어 모델을 위한 생산용 ComfyUI 노드 세트로, 구조화된 탐지, 세그멘테이션, 적응형 비디오 추론을 VRAM 최적화로 제공합니다.
AlekPet/ComfyUI_Custom_Nodes_AlekPet
ComfyUI용 커스텀 노드 모음으로, 프롬프트 번역, AI 기반 콘텐츠 생성, 이미지 조작 도구를 추가합니다.