Notely-Voice/NotelyVoice
OpenAI Whisper를 사용하여 오프라인 음성-텍스트 변환 기능을 제공하는 프라이빗하고 크로스 플랫폼인 AI 음성 전사 및 노트 테이킹 앱입니다.
tdrussell/diffusion-pipe
여러 GPU를 통해 대규모 이미지 및 비디오 확산 모델을 학습할 수 있는 파이프라인 병렬 학습 스크립트입니다.
AI-Hypercomputer/maxtext
Google Cloud TPUs 및 GPU에서 대규모 모델의 초기 학습 및 학습 후 최적화를 위한 JAX와 Python 기반 고성능 확장 가능한 LLM 라이브러리입니다.
google/XNNPACK
XNNPACK은 ARM, x86, WebAssembly 및 RISC‑V 플랫폼에서 신경망 추론을 가속화하기 위해 최적화된 저수준 성능 프리미티브 라이브러리입니다.
modelcontextprotocol/php-sdk
Model Context Protocol (MCP)의 공식 PHP SDK로, PHP 도구 및 리소스를 AI 모델에 노출하기 위한 MCP 서버 및 클라이언트를 개발할 수 있습니다.
callstackincubator/agent-skills
AI 코딩 어시스턴트에 설치하여 앱 최적화, 테스트 및 마이그레이션을 도울 수 있는 전문적인 React Native 지식 번들 모음입니다.
workos/auth.md
AI 에이전트가 사용자 대신 서비스에 인증할 수 있도록 해주는 에이전트 등록 프로토콜의 참조 구현. 신원 증명과 클레임 의식을 통해 사용자 대신 서비스에 인증 가능.
ucb-bar/chipyard
Chisel 기반의 RISC-V 시스템온칩의 아자일 개발을 위한 오픈소스 프레임워크로, 프로세서 코어, 가속기, VLSI 도구를 통합합니다.
LeslieLeung/glean
지능적인 집약과 벡터 데이터베이스를 활용해 고용량 읽기 작업을 관리할 수 있는 자체 호스팅형 RSS 리더이자 개인 지식 관리 도구
luwill/research-skills
학술 연구 워크플로우를 자동화화하기 위해 설계된 Claude Code skills 모음집으로, 철저한 문헌 검색, 검증된 제안서 작성, 고정밀 슬라이드 생성을 포함합니다.
ards-project/ard-spec
네트워크 전반에 걸쳐 MCP 서버, 스킬, API와 같은 에이전트 리소스를 카탈로그화하고 검색하기 위한 연합형 및 도메인 기반 사양입니다.
huggingface/transformers.js
ONNX Runtime을 사용하여 서버가 필요 없이 사전 학습된 기계학습 모델을 브라우저에서 직접 실행할 수 있는 자바스크립트 라이브러리입니다.
DeepLabCut/DeepLabCut
DeepLabCut은 딥러닝을 사용하여 물리적 마커 없이 비디오 내의 동물과 물체를 추적할 수 있는 마커리스 포즈 추정 툴박스입니다.
zsibot/matrix
Unreal Engine 5와 MuJoCo를 결합한 고정밀 로봇 시뮬레이션 플랫폼으로, 현실적인 렌더링, 고속 물리, ROS 2 호환 데이터 스트리밍을 제공합니다.
elevenlabs/skills
ElevenLabs의 음성, 음성 변환, 더빙, 음악 생성 API를 제공하는 즉시 사용 가능한 "agent skills" 세트입니다. `npx skills add elevenlabs/skills`로 설치하고 API 키를를 설정하면, 호환 가능한 모든 AI 코딩 어시스턴트에서 스킬(예: text‑to‑speech, speech‑to‑text, real‑time voice chat, voice‑changer, dubbing)을 호출할 수 있습니다. Python, JS/TS, 및 CLI SDK를 제공하며, trigger 및 functional 검증을 위한 테스트 스위트도 포함되어 있습니다. MIT 라이선스로 제공됩니다.
hjanuschka/pi-multi-pass
pi 코딩 에이전트용 멀티 구독 확장 프로그램으로, 여러 AI 제공업체 계정 간 자동 속도 제한 순환 및 장애 조치를 지원합니다.
kennyzir/7deer_skills
7단계의 증거 기반 파이프라인을 통해 AI 에이전트가 Roblox 게임 웹사이트를 조사, 계획 및 성장시킬 수 있는 조합 가능하고 감사 가능한 워크플로우입니다.
martin-ger/esp32_nat_router
ESP32를 WiFi NAT 라우터로 전환하는 펌웨어. WireGuard VPN, WPA2-Enterprise 지원, AI 제어 가능한 네트워크 관리용 MCP 브리지 포함.
enactic/openarm_hardware
로봇 팔을 구축하고 커스터마이즈하기 위해 필요한 CAD 파일, BOM, 조립 가이드를 제공하는 오픈소스 하드웨어 플랫폼입니다.
lucasygu/redbook
브라우저 쿠키 인증을 사용하여 키워드 리서치, 바이럴 콘텐츠 분석 및 자동 엔게이지먼트 관리를 수행하는 Xiaohongshu용 명령줄 도구입니다.
aikohanasaki/SillyTavern-MemoryBooks
SillyTavern 확장 기능으로 대화 기록을 구조화된 로어북 항목으로 변환하여 장기 기억과 서사의 연속성을 유지합니다.
ricky0123/vad
사용자 발화를 포함한 오디오 세그먼트에서 콜백을 실행할 수 있는 JavaScript 라이브러리입니다.
Chestnut-Robotics/aero-hand-open
저렴한 비용으로 접근 가능한 오픈소스 3D 프린트 테이든 드라이브 로봇 손. 정교한 조작 학습 및 강화학습 연구에 적합합니다.
PrismML-Eng/Bonsai-Image-Demo
Apple Silicon, Linux, Windows용 크로스플랫폼 데모. 4 B 파라미터의 Bonsai 디퓨전 모델을 macOS (MLX) 또는 NVIDIA GPU (gemlite + HQQ)에서 웹 기반 스튜디오와 CLI를 통해 이미지 생성 가능.
kyutai-labs/hibiki
Hibiki는 사용자가 말하는 동안 자연스러운 타겟 음성과 텍스트를 실시간으로 생성하는 스트리밍 음성-음성 번역 모델입니다.
jtydhr88/ComfyUI-qwenmultiangle
ComfyUI용 커스텀 노드로, Qwen-Image-Edit-2511-Multiple-Angles-LoRA와 호환되는 프롬프트를 생성하기 위한 인터랙티브 3D 뷰포트를 제공합니다.
neo4j-contrib/mcp-neo4j
LLM이 Neo4j 데이터베이스를 쿼리하고, Aura 클라우드 인스턴스를 관리하며, 지속적인 지식 그래프 메모리를 유지할 수 있도록 해주는 Model Context Protocol (MCP) 서버 모음입니다.
monarch-initiative/ontogpt
LLM을 사용하여 텍스트에서 구조화되고 온톨로지 기반의 정보를 추출하기 위한 파이썬 패키지로, 식별자를 실제 세계의 온톨로지와 비교하여 환각을 방지합니다.
oomol-lab/epub-translator
AI 기반 도구로 EPUB 책을 이중 언어 판으로 변환하여 원본 포맷과 구조를 유지하면서 양면 번역을 제공합니다.
liu00222/Open-Prompt-Injection
오염된 프롬프트의 탐지 및 국지화에 특화된 오픈소스 툴킷으로, 프롬프트 인젝션 공격 및 방어의 구현과 평가를 지원합니다.
Windecay/ComfyUI-ReservedVRAM
OOM 오류를 방지하고 GPU 메모리 사용량을 최적화하기 위해 예약된 VRAM을 실시간으로 동적으로 조정하는 ComfyUI 노드.
mcpware/cross-code-organizer
AI 코딩 도구용 크로스 하네스 구성 오거나이저로, 메모리, 스킬, MCP 서버를 관리하는 통합 대시보드를 제공하고 토큰 사용량을 최적화하며 도구 포이즈닝을 감지합니다.
ok-helloworld/vibe-pentest
웹 앱 및 API에서 취약점을 발견할 때 인간 보안 전문가를 시뮬레이션하는 멀티 에이전트 아키텍처를 사용하는 AI 기반 침투 테스트 도구.
TencentARC/Track4World
Track4World는 단안 영상에서 모든 픽셀의 밀도 높은 3D 추적을 가능하게 하며, 피드포워드 방식으로 월드 센트릭 3D 장면 흐름을 추정하는 프레임워크입니다.
hamishivi/tmax
Tmax는 합성 데이터 생성 파이프라인과 특화된 훈련 레시피를 갖춘, 터미널을 사용하는 AI 에이전트의 훈련 및 평가를 위한 프레임워크입니다.
UVA-Computer-Vision-Lab/OmniShotCut
다양한 동영상 소스에서 컷과 전환을 식별하는 고성능 쇼트 경계 검출 도구. Shot-Query Transformer를 사용.
saddam213/AmuseAI
다양한 오픈소스 파이프라인과 GPU 백엔드를 사용하여 이미지, 동영상, 오디오, 텍스트의 생성 및 편집을 수행하는 로컬 멀티모달 AI 애플리케이션입니다.
lencx/Noi
Noi는 프롬프트 관리, 세션 격리, 내장 터미널을 통해 AI 채팅 워크플로우를 간소화하는 인터랙션 중심의 워크스페이스 및 브라우저입니다.
kigner/audio.cpp-webui
ggml 기반의 고성능 C++ 오디오 추론 프레임워크로, 다양한 하드웨어 백엔드에서 TTS, ASR 및 음성 복제 모델의 빠르고 휴대 가능한 로컬 실행을 가능하게 합니다.
VigoZhao/AI-Visual-Prompt-Cookbook
AI 이미지 생성을 위한 130개 이상의 JSON 기반 비주얼 스타일 프롬프트 템플릿을 큐레이션한 라이브러리입니다. 각 `style.json` 파일은 재사용 가능한 레이아웃(예: 포스터, 콜라주, 타이포그래피 아트)을 정의하며, 미리 채워야 할 자리 표시자(placeholder)를 포함합니다. 전체 파일을 멀티모달 LLM(예: ChatGPT‑4‑Vision, Gemini‑3‑Pro 등)에 붙여넣기 전에 변수를 채우면 됩니다. 리포지토리에는 미리보기 이미지, 예시 값, 검증 스크립트, 복사 프롬프트 단축키가 포함되어 있어 AI 생성 그래픽의 일관성과 반복 작업의 용이성을 높입니다.
SAIL-Research-Lab/cheetahclaws
로컬 모델을 포함한 모든 LLM을 지원하는 파이썬 네이티브 에이전트 허니스로, Claude Code와 같은 프로퍼리터리 도구의 유연하고 오픈소스 대안을 제공합니다.
skyzh/vector-db-from-scratch
Arrow 테이블, DataFusion 통합, 여러 ANN 인덱스(IVFFlat, NSW, HNSW, IVF-PQ)를 다루는 Rust 기반 단계별 강의. SQL 지원 및 벤치마크 도구 포함.
OrRon/EpicInfographics
AI 에이전트를 위한 스킬로서, 일반적인 템플릿을 장면 기반 디자인과 수학적 정확성으로 대체하여 전문적인 스튜디오 수준의 인포그래픽 및 애니메이션 제작을 가능하게 합니다.
kunchenguid/vision
리포지토리의 기록을 분석하여 검증 가능한 VISION.md 파일을 생성하는 에이전트 기술로, 프로젝트 기능과 기여에 대한 구체적인 수용 기준을 제공합니다.
Fannovel16/comfyui_controlnet_aux
깊이 맵, Canny 엣지, 인체 포즈 등 ControlNet 힌트 이미지를 생성하기 위한 전처리기(preprocessors)를 제공하는 ComfyUI 노드 모음입니다.
tornikegomareli/Talkify
macOS용 개인 정보 보호형 디바이스 내 음성 입력 및 트랜스크립션 도구로, Apple의 네이티브 프레임워크를 사용해 네트워크 요청 없이 음성 인식, 번역, 음성 합성을 수행합니다.
OHF-Voice/linux-voice-assistant
Linux-Voice-Assistant는 리눅스 장치를 Home Assistant용 음성 서버로 전환하는 오픈소스 도구입니다. 웨이크워드 감지를 로컬에서 처리하고 음성을 Home Assistant의 Assist로 스트리밍하여 타이머, 안내 메시지, 대화 지원 기능을 갖춘 자체 스마트 스피커를 구축할 수 있습니다.
ailyProject/aily-blockly
100개 이상의 개발 보드에서 작동하는 AI 지원 시각 프로그래밍 IDE로, 비전문 사용자가 하드웨어 프로젝트를 빠르게 프로토타이핑할 수 있도록 합니다.