csyangwen/dsh-memory-evolve

dsh‑memory‑evolve 는 AI에게 지속적인 크로스세션 메모리, 할 일/프로젝트 로그, Git 기반 메모리 동기화, 다중 에이전트 오케스트레이션(내부 하위 세션 및 외부 AI 제공자), 파일용 검색 가능한 무한 캔버스, 선택적 리뷰 세션, 모바일 친화적 UI와 알림을 제공하는 DSH 플러그인입니다. AI가 장기적인 파트너이자 팀 조율자로 기능하게 하면서도, 모든 쓰기 작업을 사용자가 제어할 수 있도록 합니다.

narcotic-sh/senko

1시간의 오디오를 몇 초 내에 처리할 수 있는 고속이고 정확한 말하기자 분리 파이프라인입니다.

spaceamoeba-t/tapq

TapQ는 Swift 기반의 macOS 런타임으로, 코드 에이전트(Claude Code, Codex, Cursor, OpenCode)를 AirPods에 연결합니다. 에이전트의 프롬프트를 음성으로 읽어주며, 이중 고개 끄덕임/흔들기, 스템 스와이프, 또는 음성(OpenAI의 실시간 API를 선택적으로 사용)으로 응답 가능하며, 해석이 불가능할 경우 화면 UI로 백업됩니다. 모든 모션 처리는 디바이스 내에서 수행되며, 오디오는 짧은 응답 창 동안만 OpenAI에 전송됩니다. macOS 14+, Swift 6, 헤드 모션을 노출하는 모든 AirPods 지원. Apache 2.0 라이선스.

Companion-Inc/feynman

Feynman은 CLI 우선의 오픈소스 AI 연구 에이전트로, 논문, 웹, 다양한 과학 데이터베이스를 검색하여 브리핑, 문헌 검토, 논문 순위, 감사, 재현 계획 및 머신러닝 학습 레시피를 합성합니다. 독립형 네이티브 번들(또는 npm 패키지)로 제공되며, 노트북, 아티팩트 미리보기 및 컴퓨팅 오케스트레이션을 위한 로컬 웹 워크벤치를 선택적으로 실행할 수 있습니다. Pi 에이전트 런타임과 AlphaXiv 논문 엔진을 기반으로 하며, 호스팅된 LLM과 LM Studio, Ollama, LiteLLM 등을 통한 로컬 모델을 모두 지원합니다.

yeyupiaoling/VoiceprintRecognition-Pytorch

VoiceprintRecognition-Pytorch는 PyTorch 기반의 화자 검증 툴킷으로, 다양한 최신 백본, 풀링 레이어, 손실 함수, 프론트엔드를 제공하며 데이터 준비, 학습, 평가 스크립트 및 즉시 사용 가능한 웹/위챗 데모를 포함합니다.

MiniMax-AI/minimax-code

MiniMax Code는 터미널 기반 AI 코딩 어시스턴트입니다. LLM(MiniMax 또는 OpenAI/Anthropic 호환 제공업체)과 대화하여 명령줄에서 직접 코드를 읽고, 수정하고, 테스트할 수 있습니다. 대화형 TUI, 스크립트/CI용 헤드리스 CLI, 사용자 지정 모델 지원, 내장 검색 및 도구 실행, 세션 관리, ACP를 통한 에디터 통합 기능을 제공합니다. 원클릭 스크립트나 npm으로 설치하고 로그인(또는 자체 API 키 사용)한 후, "실패한 테스트 수정"과 같은 프롬프트를 입력하세요. 리포지토리에는 CLI 소스(MIT 라이선스)와 전체 문서가 포함되어 있습니다.

nanbingxyz/5ire

5ire는 오픈 Model-Context-Protocol (MCP)을 사용하여 도구(파일 시스템, 데이터베이스, API 등)를 연결하는 무료 크로스 프로바이더 AI 채팅 어시스턴트입니다. RAG를 위한 로컬 다국어 벡터 저장소, 프롬프트 라이브러리, 북마크 및 사용량 분석 기능을 포함합니다.

arnegiacomo/fugleramme

Raspberry Pi용 전자잉크 조류 액자로, 로컬 AI를 사용하여 오디오로 새를 감지하고 1800년대 자연사 삽화 스타일의 컷아웃 이미지로 렌더링합니다.

DamRsn/NeuralNote

MuScriptor Transformer 모델을 사용하여 오디오 녹음을 로컬에서 편집 가능한 MIDI 노트로 변환하는 DAW용 오디오-MIDI 변환 플러그인.

schibsted/WAAS

OpenAI Whisper를 위한 GUI 및 API 래퍼로, 비동기 전사 서비스와 텍스트 수정을 위한 내장 편집기를 제공합니다.

magenta/mt3

MT3는 T5X 프레임워크를 사용하여 오디오 녹음을 악보로 변환하는 다중 악기 자동 음악 전사 모델입니다.

Kulaxyz/self-learning-skills

self‑learning‑skills는 AI 코딩 에이전트가 세션 중에 발견한 절차적 지식(배포 단계, 비밀값 조회 위치 등)을 캡처하고 재사용할 수 있게 해주는 메타 스킬입니다. Claude Code, Cursor 및 `AGENTS.md` 파일을 읽는 모든 도구와 함께 작동하며, "골든 패스"를 새로운 스킬 파일이나 메모로 저장하고 향후 세션에서 자동으로 로드합니다. 설치는 `npx skills`를 통한 한 줄 명령, Claude Code 플러그인 또는 수동 복사로 가능합니다. 이 프로젝트는 개방형 Agent‑Skills 표준을 따르며 MIT 라이선스로 제공됩니다.

espressif/esp-skainet

ESP‑Skainet은 ESP32 칩을 위한 Espressif의 온디바이스 음성 어시스턴트 SDK입니다. 초소형 웨이크 워드 엔진(WakeNet), 최대 200개 언어를 지원하는 오프라인 명령어 인식기(MultiNet), 그리고 완전한 오디오 프론트엔드(AEC, VAD, NS)를 번들로 제공합니다. 이 스택은 최소한의 RAM/Flash를 사용하여 ESP32‑S3(또는 기타 ESP32 보드)에서 실행되며, 스마트 홈, 웨어러블 또는 로봇을 위한 개인정보 보호형 음성 제어를 가능하게 합니다. 저장소에는 즉시 플래시 가능한 예제, 상세 문서, 사용자 정의 웨이크 워드 및 명령어에 대한 지원이 포함되어 있습니다.

233stone/vocotype-cli

VocoType-CLI는 FunASR 기반의 오픈소스 오프라인 음성 인식 명령줄 도구입니다. CPU에서 실행되며 중영 혼용 전사를 지원하고, 사용자 정의 사전 및 AI 기반 후처리 기능을 제공합니다. 또한 선택적으로 볼케이노 엔진(Volcengine)의 클라우드 인식 서비스를 사용할 수 있습니다. 저장소에는 Python 기반의 설치 단계와 데이터셋 내보내기 기능이 포함되어 있으며, 비기술 사용자를 위한 GUI 버전 링크도 제공합니다.

Dpro-at/Tel-Agent

Tel‑Agent는 SIP 전화 회선(및 24개 이상의 메시징 플랫폼)을 직접 호스팅하는 AI 에이전트에 연결하는 오픈 소스 게이트웨이입니다. 음성 인식(STT), LLM 생성, 음성 합성(TTS)을 실시간으로 스트리밍하며, 외부 HTTP 서비스 호출, 모든 상호작용 기록 및 전사 기능을 제공합니다. Windows/macOS/Linux 또는 Docker에서 실행되며 AGPL‑3.0 라이선스를 따릅니다.

daobataotie/CAD-MCP

CAD‑MCP는 Windows 전용 Python 서버로, Model‑Context‑Protocol을 통해 AutoCAD/GstarCAD/ZWCAD 기능을 노출합니다. LLM 기반 클라이언트가 35개의 구조화된 JSON 도구를 사용해 도면, 질의, 편집, 레이어, 블록, 파일 작업을 자연어로 제어할 수 있게 하여 자연어 기반 CAD 자동화를 가능하게 합니다.

JasonLiu0826/ackem

Ackem은 Windows 전용 Electron 앱으로, OpenAI 호환 LLM을 지속적인 로컬 우선 AI 동반자로 바꿔줍니다. 채팅, 검색 가능한 메모리, 감정/관계 추적, 선택적 데스크톱 펫, 확장 가능한 플러그인 시스템을 제공하며, 모든 데이터(API 키 포함)를 사용자 기기에 보관합니다. 이 프로젝트는 활발히 유지보수되고 있으며 AGPL-3.0 라이선스로 배포됩니다. 최종 사용자는 Node.js 런타임을 설치할 필요가 없습니다.

context-labs/whip

whip은 LLM 기반 코딩 에이전트를 실행하는 Go 언어 기반의 명령줄 하네스입니다. 모델 응답을 스트리밍하고 도구(bash, 파일 편집, 하위 에이전트)를 병렬로 호출하며, OpenAI 호환 엔드포인트라면 어디서든 작동합니다. 이 도구는 OpenRouter와 같은 제공업체의 모델을 자동으로 검색하고, 로그인 기반 Codex 구독을 지원하며, 내장 터미널 테마를 제공합니다. 단일 스크립트나 go install을 통해 설치할 수 있습니다.

HKUDS/CatchMe

CatchMe는 로컬, 개인정보 보호 우선 도구로, 컴퓨터 활동(마우스, 키보드, 창, 클립보드, 스크린샷 등)을 지속적으로 기록하고, 계층적 활동 트리로 구성하며, LLM 생성 요약을 추가하고, CLI, 웹 대시보드 또는 AI 에이전트 스킬을 통해 전체 기록을 쿼리할 수 있습니다. 벡터 임베딩이 필요 없습니다.

Autodesk/XLB

XLB는 미분 가능한 격자 볼츠만(Lattice Boltzmann) 유체 시뮬레이션을 위한 Python 라이브러리입니다. CPU, 단일 GPU(Warp), 다중 GPU(Neon), TPU(JAX) 하드웨어에서 실행되며, 격자 세분화, 다양한 LBM 모델 및 경계 조건을 제공합니다. 또한 JAX 기반 머신러닝 도구와 통합되어 기울기 기반 최적화 및 물리 정보 학습을 지원합니다.

pax-beehive/dsh-hub-cli

Node 기반 CLI로 DeepSeek Harness(런타임, 순서가 있는 플러그인, 구성 패치, 환경 변수 선언)를 공개 DSH Plugin Hub의 불변·버전 관리된 *Preset Release*로 캡처할 수 있습니다. 다른 사용자는 단일 명령으로 프리셋을 가져와 적용하여 정확한 플러그인 버전, 로드 순서, 런타임을 고정할 수 있습니다. 이 도구는 계획, 원자적 스테이징 설치, diff/업그레이드/롤백을 지원하며 안전한 계획-적용 워크플로를 통해 AI 에이전트와 통합됩니다. 모든 릴리스는 콘텐츠 주소 지정(sha256)되며 비밀은 로컬에 유지되고 CLI는 MIT 라이선스입니다.

yvetteYSY/creator-agent

Creator Agent는 오픈소스이며 개인정보 중심의 웹 프로토타입으로, 크리에이터가 텍스트, 마크다운, 또는 비디오 + 자막 파일을 업로드하고 승인한 후 결정론적이고 인용이 풍부한 챗 에이전트를 노출할 수 있습니다. Auth0를 통한 인증, PostgreSQL을 통한 지속적 워크스페이스 메타데이터, 제로 AI 로컬 리트리ieval 엔진을 사용하며, 향후 모델 통합을 위한 "Bring-Your-Own-Agent" HTTP 계약을 문서화했습니다.

devcodex-labs/devcodex

DevCodex는 의도 기반, 프로젝트 인식 워크플로우로 AI 코딩 어시스턴트(Copilot, Claude Code 등)를 오케스트레이션하는 Node.js CLI입니다. 구조화된 프로젝트 프로파일을 생성하고, 필요 시 도메인 전문 스킬을 로드하며, 세션 간 작업 상태를 지속 저장하고, 작업 완료를 위해 증거가 필요합니다. 재현 가능하고 감사 가능한 AI 생성 코드 변경이 필요한 개발자와 팀을 위한 설계입니다.

miracodeai/mira

Mira는 오픈소스이며 자체 호스팅 가능한 AI 코드 리뷰 서비스입니다. OpenRouter, Ollama, AWS Bedrock, Codex CLI 등 어떤 LLM과도 호환 가능하며, 차이점, 임베딩, CVE 데이터, 사용 로그를 사용자가 관리하는 SQLite/Postgres에 저장하고, 개인용 대시보드를 통해 결과를 제공합니다. 노이즈 필터링된 댓글, 거부된 피드백을 기반으로 커스텀 규칙을 학습하는 루프, 전체 리포지토리 인덱싱, 취약성 경고, GitHub, GitLab, Forgejo 지원 기능을 갖추고 있습니다. Docker(One-click Railway, Fly.io, Render)로 배포 가능하며, `mira.yaml`/`.mira.yaml`로 리포지토리별로 설정할 수 있습니다. Apache 2.0 라이선스.

Unity-Technologies/unity-agent-plugin

Claude Code 또는 Codex가 자연어로 Unity 작업을 이해하고 해당 Unity 프로젝트 코드와 자산을 자동으로 생성할 수 있는 AI 에이전트 기능입니다. 마켓플레이스 명령어 또는 수동 설치 가능하며, Unity 6 이상과 호환되며 Unity의 Companion License에 따라 라이선스됩니다.

danium/lateral-thinking

AI 코딩 에이전트를 위한 스킬 번들로, 랜덤 자극, SCAMPER, Six Hats 등 고전적인 라테럴 사고 기법과 내장된 '포기 규칙'을 제공하여, 아이디어가 지루하게 느껴질 때 이유를 진단하고 구조적이고 명백하지 않은 제품 방향을 생성할 수 있게 합니다.

nkarasiak/qgis-mcp

QGIS MCP는 AI 에이전트(Claude, Gemini, Codex 등)가 Model Context Protocol(MCP)를 통해 QGIS를 제어할 수 있도록 해주는 오픈소스 브리지입니다. QGIS 내부에 플러그인을 제공하고, 외부의 FastMCP 서버를 통해 118개의 GIS 중심 도구(레이어 처리, 편집, 처리, 렌더링, 레이아웃 등)를 노출합니다. QGIS에서 플러그인을 설치하고, LLM 클라이언트에 작은 `uvx` 기반 서버를 추가하면, AI 기반 명령어로 프로젝트 생성, 피처 편집, 처리 알고리즘 실행, 지도 렌더링을 순전히 수행할 수 있습니다.

LucieEveille/kiwi-mem

kiwi‑mem은 LLM 채팅에 인간처럼 장기 기억을 추가하는 자체 호스팅 FastAPI 게이트웨이입니다. 사실은 PostgreSQL + pgvector에 저장되며, 시간이 지나면서 감소하는 열량을 부여하고, 매일 밤 "드림" 사이클을 통해 관련 정보를 통합하며, 오래된 채팅을 계층적 캘린더 요약으로 압축합니다. OpenAI 호환 또는 Anthropic 네이티브 API와 호환되며, 웹 관리 패널을 제공하고, 단일 Docker‑Compose 명령어로 실행됩니다.

katipally/openlive

OpenLive는 어떤 LLM 또는 코딩 에이전트에도 로컬에서 음성 인식, 음성 합성(옵션으로 음성 클론), 그리고 선택적 카메라/화면 캡처 기능을 추가하는 오픈소스 데스크톱 앱입니다. 전체 오디오 파이프라인은 WebGPU로 로컬에서 실행되며, 모델에 전송되는 것은 최종 텍스트뿐이며, 음성으로 응답을 반환함으로써 개인 정보 보호형, 요금 없는 음성 기반 AI 보조자를 가능하게 합니다.

gdstudio-org/Embeat

MLP를 통한 음향 특징 인코딩과 Track2Vec를 통한 협업 필터링을 결합하여 고품질이고 장르 인식 가능한 곡 추천을 제공하는 하이브리드 음악 추천 시스템입니다.