Mobile-Artificial-Intelligence/maid
Maid는 React Native로 제작된 오픈소스 안드로이드 앱으로, llama.cpp를 통해 GGUF LLM을 로컬에서 실행하고 다양한 원격 LLM API에 연결할 수 있습니다. 한 번의 탭으로 모델을 다운로드하고, 대화를 관리하며, 생성 설정을 조정하고, 선택적으로 클라우드 동기화를 사용할 수 있으며, 동반 TTS 앱(Maise)도 제공합니다. GitHub 릴리스 또는 구글 플레이 스토어에서 설치하거나, 직접 APK를 빌드할 수 있습니다.
raysonmeng/agent-bridge
AgentBridge는 Claude Code와 OpenAI Codex가 메시지를 주고받고, 작업을 분할하며, 서로의 코드를 자동으로 검토할 수 있도록 연결해주는 로컬 도구입니다. Bun 기반 데몬과 짧은 CLI(`abg`/`agentbridge`)를 실행하여 두 에이전트를 시작하고, 턴 조율, 할당량 이관, 노이즈 출력 필터링을 처리합니다. 수동 복사-붙여넣기 없이 두 LLM 코딩 어시스턴트가 협업하고 싶은 개발자를 위한 도구입니다.
ZiYang-xie/WorldGen
WorldGen은 텍스트 프롬프트나 이미지를 몇 초 만에 몰입형 3D 씬으로 생성하는 도구이며, Gaussian Splatting과 메쉬 출력 모두를 지원해 VR, 게임, 시뮬레이션에 활용할 수 있습니다.
bcurts/agentchattr
agentchattr는 여러 AI 코드 에이전트와 인간이 실시간으로 대화할 수 있는 크로스플랫폼 로컬 채팅 서버입니다. 웹 UI에서 에이전트를 @로 언급하면 서버가 MCP를 통해 프롬프트를 에이전트의 터미널에 주입하고, 에이전트는 자동으로 채팅을 읽고 응답합니다. 이를 통해 손을 떼고 조율할 수 있는 다중 에이전트 워크플로우, 작업, 규칙, 세션, 채널, 고정 메시지, 의사결정 카드, 스케줄링, 음성 입력 등 풍부한 UI 기능을 제공합니다.
sorker/ai-shotlive
AI ShotLive Director는 오픈소스로, React + Express(또는 Electron) 기반의 플랫폼으로 소설이나 스토리 개요를 단편 영상 또는 모션 코믹으로 전환합니다. 키프레임 기반 워크플로우(시작/끝 프레임 → 보간)를 사용하며, OpenAI, Anthropic, Google, AntSK 등 텍스트, 이미지, 영상, 오디오 모델을 자유롭게 연동할 수 있습니다. 소설 → 스크립트 변환, 자산 생성(캐릭터 룩북, 장면 개념), 그리드 기반 스토리보드 편집기, AI 자막 및 TTS 포함 멀티트랙 영상 편집, 완전한 백업/복원 기능을 제공합니다. Docker, 로컬 SQLite, 데스크톱 앱으로 배포 가능하며, CC BY‑NC‑SA 4.0 라이선스 하에 제공됩니다.
ChrisChen667788/wind-comic
단일 문장을 스크립트, 캐릭터 디자인, 음성 합성, 최종 MP4 내보내기까지 자동화하는 다에이전트 AI 스튜디오입니다.
NVIDIA-AI-Blueprints/video-search-and-summarization
자연어를 사용해 라이브 또는 기록된 비디오 스트림을 검색하고 요약하며 추론하는 GPU 가속 비전 에이전트를 위한 참조 아키텍처입니다.
saddam213/AmuseAI
다양한 오픈소스 파이프라인과 GPU 백엔드를 사용하여 이미지, 동영상, 오디오, 텍스트의 생성 및 편집을 수행하는 로컬 멀티모달 AI 애플리케이션입니다.
aaronyi97/image-story-video-wizard
Codex와 WorkBuddy를 위한 AI 영상 제작 워크플로우로, 주제 선택부터 스토리 기반 영상의 최종 렌더링까지 단계별로 사용자를 안내합니다.
Evianis/travel-photo-abstraction
사진의 형태와 공간적 리듬 같은 시각적 증거를 최소한의 추상적 표식으로 매핑하여 희소한 에디토리얼 추상화를 생성하는 Codex 스킬입니다.
lidge-jun/ima2-gen
다수의 AI 제공업체를 통합하여 이미지 및 동영상 생성을 제공하는 로컬 우선의 시각 생성 스튜디오로, 고급 반복 도구를 제공합니다.
scraed/LanPaint
확산 모델을 위한 학습이 필요 없는 통합 인페인팅 샘플러로, 'Think Mode'를 통해 이미지, 비디오, 오디오의 품질을 향상시킵니다.
facebookresearch/fairchem
fairchem은 Meta의 오픈소스 라이브러리로, 화학 및 재료 과학을 위한 기계학습 원자간 포텐셜(UMA 모델)을 제공합니다. pip 설치 가능한 `fairchem-core` 패키지, ASE 호환 계산기, 멀티 GPU 추론, 분자, 폴리머, 무기 결정, 촉매, MOFs 등에 대한 사전 학습된 모델을 제공하여 빠르고 양자 정밀도 시뮬레이션을 가능하게 합니다.
songlab-cal/gpn
정렬된 및 정렬되지 않은 게놈 서열을 사용하여 전체 게놈 변이의 기능적 영향을 예측하도록 설계된 게놈 언어 모델 세트입니다.
corvo007/MioSub
Gemini와 Whisper를 사용하여 음성 인식, 번역, 밀리초 단위 정밀 타임라인 동기화를 자동화하는 AI 기반 자막 편집기입니다.
anliyuan/Ultralight-Digital-Human
짧은 영상에서 개인화된 훈련을 통해 모바일 기기에서 실시간으로 말하는 헤드를 생성할 수 있는 경량 디지털 인간 모델.
NVIDIA/cudnn-frontend
NVIDIA의 cuDNN Frontend는 Hopper 및 Blackwell GPU에서 고성능 딥러닝 커널(어텐션, GEMM, 퓨즈드 오퍼) 구축을 단순화하는 오픈소스 헤더 전용 C++ API 및 Python 바인딩입니다. Flash-Attention, Mixture-of-Experts GEMM 퓨전, 스파스/선형 어텐션 등 준비된 JIT 컴파일 커널을 제공하며, 통합 Graph API 및 PyTorch 호환 오퍼를 통해 접근할 수 있습니다.
omnichar/OmniChar
휴대용 .char 형식을 사용하여 여러 이미지 및 비디오 생성 모델에서 작동하는 일관된 AI 캐릭터를 생성하기 위한 오픈소스 스튜디오.
kunchenguid/autopreso
발표자의 목소리에 따라 실시간으로 Excalidraw 화이트보드를 그리고 재배치하는 AI 에이전트를 사용하는 손을 떼고 발표할 수 있는 도구입니다.
safetensors/safetensors
safetensors는 Rust 기반의 Python 라이브러리로, pickle 코드 실행을 방지하는 안전한 작고 JSON 헤더가 있는 바이너리 형식을 정의합니다. 제로 코피, 지연 로딩, 최신 dtype(예: bfloat16, fp8) 지원을 제공하며, Hugging Face에서 대규모 모델 가중치를 배포하는 데 사용됩니다. `pip install safetensors`로 설치 가능합니다.
zhizinan1997/jimeng-free-api-all
Jimeng AI용 OpenAI 호환 API 서비스로, 다중 계정 회전과 관리 대시보드를 통해 프로그래밍 방식의 이미지 및 비디오 생성을 가능하게 합니다.
kyleskom/NBA-Machine-Learning-Sports-Betting
NBA 통계와 스포츠북 오즈를 수집하고, 매치업 특징을 생성하며, XGBoost와 TensorFlow 모델을 훈련하여 경기 승자와 오버/언더 총점을 예측하고, 기대값과 케리 기준에 따른 베팅 금액을 출력하는 파이썬 프로젝트입니다. 데이터 수집, 모델 훈련, 명령줄 예측 스크립트, 간단한 Flask 웹 UI를 포함합니다.
Mr-funny/hbg-classical-poem-silk-video
AI 이미지 생성, Gemini 기반 이미지→비디오 Docker 컨테이너, 붓자국 자막, 자동 QA를 활용해 중국 고전 시를 세로형(1080 × 1920) 중국화 스타일 애니메이션 영상으로 변환하는 에이전트 스킬
NVIDIA/cosmos-framework
언어, 시각, 오디오, 행동을 통합하는 Physical AI를 위한 엔드투엔드 프레임워크로, Cosmos 3 패밀리 포함 오미모달 월드 모델의 학습과 서비스를 가능하게 합니다.
xmarre/ComfyUI-Spectrum-MiniMax-H3
Spectrum의 ComfyUI 구현은 숨겨진 상태를 예측하여 고비용의 트랜스포머 평가를 건너뛰어 MiniMax H3 오디오-비디오 생성을 가속화합니다.
openxla/xprof
XProf는 현대 기계학습 워크로드를 위한 오픈소스이자 확장 가능한 프로파일러(텐서보드 플러그인 포함)입니다. 스텝 시간 분해, 연산 타임라인, 메모리 사용량 및 HLO 그래프를 시각화하며, 분산 처리를 지원하고 `pip install xprof`로 설치할 수 있습니다.
EvolvingLMMs-Lab/LLaVA-OneVision-2
코덱 정렬 비전 인코더를 사용하여 이미지, 장시간 비디오, 공간 이해를 통합하고 효율적인 장시간 비디오 추론을 가능하게 하는 완전히 오픈된 8B 멀티모달 모델.
facebookresearch/meshflow
MeshFlow는 MeshVAE와 flow-matching Diffusion Transformer를 사용하여 약 1초 만에 예술적인 메쉬를 생성하는 효율적인 3D 메쉬 생성 시스템입니다.
AlayaLab/WildWorld
AAA ARPG에서 추출한 명확한 상태 주석이 포함된 대규모 액션 조건부 월드 모델링 데이터셋으로, 생성형 게임 환경 학습을 위한 목적으로 설계되었습니다.
dineshsoudagar/local-llms-on-android
ONNX 및 LiteRT 백엔드를 사용하여 음성, 이미지, 카메라 입력을 지원하는 완전히 오프라인이고 프라이버시 보장되는 Android 앱입니다.
jedzqer/manga-translator-android
로컬 버블 검출과 OCR를 결합해 LLM 기반 번역을 사용해 원본 이미지 위에 번역된 텍스트를 오버레이하는 안드로이드 앱.
OneMoreGres/ScreenTranslator
온라인 번역 서비스를 사용하여 화면에 나타나는 텍스트를 스크린 캡처 및 OCR 기반으로 번역하는 도구입니다.
GalTransl/GalTransl
GalTransl은 GPT-4/Claude/DeepSeek 등으로 일본어 가르게 스크립트를 중국어로 자동 추출, 번역, 재삽입하는 데스크탑 GUI입니다. GPT 기반 사전, 캐시, 자막 지원 기능을 갖추고 있습니다.
Wing900/ManimCat
Manim과 matplotlib를 사용하여 자연어로 수학 애니메이션과 정적 시각 자료를 생성하는 AI 기반 워크스페이스입니다.
mll-lab-nu/VAGEN
VAGEN은 명시적인 시각적 상태 추론을 통해 내부 world model을 강화함으로써 성능을 향상시키는 멀티턴 VLM 에이전트 훈련용 강화 학습 프레임워크입니다.
tmustier/pi-for-excel
Pi for Excel은 Microsoft Excel 내부에 대화형 AI 에이전트를 통합하는 오픈소스 Office 애드인입니다. 사용자가 설정한 어떤 LLM(Anthropic, OpenAI, Google Gemini, GitHub Copilot, 또는 사용자 정의 OpenAI 호환 엔드포인트)을 사용해 스프레드시트를 읽고, 쓰고, 서식을 지정하며 분석할 수 있습니다. 16개의 내장 스프레드시트 도구, 세션 관리, 한 번의 클릭으로 복구 가능한 자동 체크포인트, 확장 가능한 사전 보호된 확장 기능을 제공합니다.
google-deepmind/tips
TIPS는 향상된 공간 인지 능력과 패치-텍스트 정렬을 특징으로 하는, 범용 컴퓨터 비전 및 멀티모달 AI를 위해 설계된 일련의 기초 이미지-텍스트 인코더입니다.
xikhar/persona
AI 어시스턴트의 음성 출력에 반응하는 실시간으로 표현력 있는 3D 캐릭터 아바타를 제공하는 크로스 플랫폼 데스크톱 애플리케이션.
vinhhien112/img2obj
구조화된 분석 및 검토 워크플로우를 통해 필요한 구축 코드를 생성함으로써 참조 이미지를 애니메이션 준비가 된 프로시저럴 Three.js 객체로 변환하는 Codex 플러그인입니다.
RareSense/Nova3D
Nova3D는 실행 가능한 Blender Python 스크립트로 자산을 생성하는 코드 기반 3D 생성 시스템으로, 이름이 지정된 부품을 갖춘 구조적이고 편집 가능하며 애니메이션 가능한 3D 모델의 생산을 가능하게 합니다.
OrRon/EpicInfographics
AI 에이전트를 위한 스킬로서, 일반적인 템플릿을 장면 기반 디자인과 수학적 정확성으로 대체하여 전문적인 스튜디오 수준의 인포그래픽 및 애니메이션 제작을 가능하게 합니다.
gradio-app/trackio
Trackio는 무료 경량 실험 추적 라이브러리(wandb 호환)로, 로그를 로컬 SQLite에 저장하고, 빠른 비차단 API, Gradio 스타일 대시보드, CLI/SQL 쿼리 도구, 알림, 선택적 Hugging Face Spaces 무료 호스팅 또는 자체 호스팅을 제공합니다.
nodetool-ai/nodetool
노드 기반 그래프 시스템과 통합된 AI 에이전트를 활용해 이미지, 동영상, 오디오, 텍스트 생성을 가능하게 하는 에이전트 중심의 창의적 작업 공간입니다.
ATH-MaaS/Ovis
Ovis는 시각적 임베딩과 텍스트 임베딩을 구조적으로 정렬하여 고해解像도 인지 및 반사적 추론을 가능하게 하는 멀티모달 대규모 언어 모델 (MLLM) 아키텍처입니다.
morsoli/aimangastudio
스크립트 생성, 스토리보드 작성, 캐릭터 스타일 제어까지를 종합적으로 제공하는 AI 기반 만화 제작 도구.
jeremychone/rust-genai
genai는 OpenAI, Anthropic, Gemini, Ollama, Bedrock 등 26개 이상의 제공업체에서 제공하는 200개 이상의 LLM 모델과 대화할 수 있는 단일하고 사용하기 쉬운 비동기 API를 제공하는 Rust 크레이트입니다. 올바른 네이티브 프로토콜을 자동으로 선택하고, 사용자 정의 OpenAI 호환 엔드포인트, 스트리밍, 도구 호출, 이미지 분석을 지원하며, ChatOptions를 통해 풍부한 설정이 가능합니다. 현재 v0.6가 릴리스되었고, v0.7 베타 버전이 곧 출시될 예정이며, 많은 예제와 문서를 포함하고 있습니다.
X-GenGroup/Flow-Factory
이미지, 동영상, 오디오-비디오 모달리티에 걸쳐 확산 및 플로우 매칭 모델의 온라인 RL과 오프라인 파인튜닝을 위한 통합 프레임워크입니다.
tiiuae/Falcon-Perception
Falcon‑Perception은 Falcon 다중 모달 트랜스포머를 위한 오픈소스 PyTorch/MLX 추론 라이브러리로, 자연어 질의에 따라 객체 탐지, 인스턴스 세그멘테이션 또는 OCR을 수행할 수 있습니다. 고도로 최적화된 페이지 및 배치 엔진, FastAPI 서버, Streamlit UI, Docker/vLLM 배포용 OCR, Colab 노트북을 제공합니다. 270 M 파라미터의 Falcon‑OCR 1.5 모델은 훨씬 더 큰 VLM과 유사한 엔드투엔드 OCR 품질을 제공하면서도 3배 작아 실시간 또는 엣지 배포에 적합합니다.