mlwithme/BertWithPretrained

사용자가 모델을 스크래치에서 구축하고 분류, QA, NER 등의 다양한 NLP 작업에 적용할 수 있도록 하는 PyTorch 기반 BERT 구현입니다.

VCIP-RGBD/DFormer

DFormer은 RGB‑D 세그멘테이션을 위한 연구용 코드베이스로, DFormer, DFormerv2(지오메트리 가이드 애티튜드) 및 DFormer++(효율적이고 고정확도 변형)을 구현합니다. 사전 훈련 스크립트, 데이터셋 헬퍼, 훈련/평가 파이프라인, NYU‑Depth v2 및 SUN‑RGBD용 사전 학습 가중치를 포함합니다. 이 리포지토리는 진정한 AI/ML 프로젝트입니다.

baxtree/subaligner

Subaligner는 자막과 비디오/오디오를 동기화하는 오픈소스 파이썬/CLI 도구입니다. Whisper를 통한 음성 인식, HuggingFace 모델을 통한 자막 번역, 사용자 정의 동기화 모델 훈련 기능을 제공합니다. 다양한 자막 및 미디어 형식을 지원하며, 빠른 전역 이동(`single`)과 고정밀 이중 단계(`dual`) 동기화를 제공하고, Docker, pip, LLM 기반 기능용 선택적 확장 기능도 제공합니다.

ria-com/nomeroff-net

YOLOv8과 RNN 기반 OCR을 사용하여 여러 국가의 번호판을 자동으로 검출하고 읽는 오픈소스 파이썬 프레임워크입니다.

hplt-project/sacremoses

NLP 데이터셋을 위한 토큰화, 디토큰화, 정규화 및 트루케이싱 도구를 제공하는 텍스트 전처리 라이브러리입니다.

NVIDIA/cuQuantum

NVIDIA에서 제공하는 고성능 SDK로, 양자 과학 시뮬레이션을 가속화하도록 설계되었으며, 상태 벡터 및 텐서 네트워크 계산을 위한 특수 라이브러리를 제공합니다.

microsoft/TransformerCompression

직교 변환을 사용하여 의미 없는 가중치 행렬 구성 요소를 자르는 사후 훈련 압축 도구로, Transformer 네트워크를 더 작고 빠르게 만듭니다.

chi2liu/ABC-GRPO

4개의 독립적인 클리핑 경계를 사용하는 비대칭적이고 적응적인 GRPO 강화학습 알고리즘의 개선 버전으로, LLM 추론 작업에서 엔트로피 붕괴를 방지하고 일반화 성능을 향상시킵니다.

femto/minion-agent

다수의 에이전트 백엔드에서 브라우저 자동화, 코드 실행, MCP 도구 지원을 통합하는 강력한 에이전트 프레임워크입니다.

Softlandia-Ltd/vision-is-all-you-need

VLM을 사용해 PDF 페이지를 이미지로 임베딩하여 문서 검색 시 텍스트 청크화의 필요성을 제거하는 비전 기반 RAG(V-RAG) 데모.

yzhao062/SUOD

이질적 모델 앙상블의 학습 및 예측을 최적화하는 대규모 비지도 이상 탐지용 가속 프레임워크입니다.

NVIDIA/logits-processor-zoo

LLM의 출력 동작을 제어할 수 있는 로짓 프로세서 모음. 특정 문구 강제, 응답 길이 관리, 환각 완화 등 가능.

aniketkarne/ClaudeNightsWatch

Claude CLI용 자율 태스크 실행 시스템으로, 사용 창을 모니터링하고 Markdown 파일에서 사전 정의된 태스크를 자동으로 실행합니다.

marciopuga/cog

AI 에이전트가 다양한 도구와 프로젝트 간에 문맥과 지속적 지식을 공유할 수 있도록 하는 중앙 집중식 플레인 텍스트 메모리 계층. 마크다운 파일을 사용하여 지식을 공유합니다.

Azure-Samples/ai-rag-chat-evaluator

GPT 기반 및 코드 기반 지표를 사용하여 생성된 답변을 정답 데이터와 비교함으로써 RAG 채팅 애플리케이션을 평가하는 도구 키트.

wangle201210/go-rag

문서와 웹 페이지에서 지식 베이스를 생성할 수 있는 Go 기반 RAG 시스템으로, 멀티 패스 리콜과 관리 GUI를 제공합니다.

Kabanosk/whisper-website

OpenAI의 Whisper를 사용하여 로컬에서 오디오를 텍스트 또는 다양한 형식의 자막으로 변환하는 자체 호스팅 웹 애플리케이션입니다.

py-why/pywhyllm

대규모 언어 모델(LLM)을 인과 분석 프로세스에 통합하여 교란 변수, 인과 관계, 및 검증 전략을 제안하는 라이브러리.

jdtoscano94/NABLA-SciML

복잡한 물리 시스템 연구를 위해 PINNs, DeepONets, KANs 구현을 제공하는 과학적 기계 학습 (SciML)을 위한 통합 프레임워크.

openaiotlab/CUHK-X

인간 행동 인식과 추론을 위한 대규모 다중 모달 데이터셋과 벤치마크로, 7개의 동기화된 센서 모달리티를 통합하여 복잡한 행동 이해를 가능하게 합니다.

apple-aiml-research/ml-diffucoder

DiffuCoder는 코드 생성을 위한 마스크 확산 모델로, Coupled-GRPO를 도입하여 사후 훈련 효율성과 모든 토큰의 학습 신호를 개선합니다.

apple-aiml-research/ml-mdm

마트료시카 확산 모델을 위한 엔드투엔드 프레임워크로, 최대 1024x1024 픽셀의 고해상도 텍스트-이미지 합성 모델을 효율적으로 학습할 수 있게 합니다.

BenyRonald77/uajy-academic-rag-chatbot

Google Gemini와 FAISS를 사용한 RAG 기반 챗봇으로, 공식 UAJY 학술 핸드북을 기반으로 학문적 질문에 대해 환각 없는 답변을 제공합니다.

aws/sagemaker-training-toolkit

커스텀 Docker 컨테이너를 Amazon SageMaker와 호환되게 만드는 라이브러리로, 격리된 환경에서 기계학습 모델을 훈련시키는 과정을 간소화합니다.

TheDesignFounder/DreamLayer-Eval

이미지 및 동영상 확산 모델을 위한 오픈소스 벤치마킹 플랫폼으로, 프롬프트 스위프트, 메트릭 계산, 재현 가능한 실행 로깅을 자동화합니다.

jonathan-laurent/AlphaZero.jl

표준 데스크톱 하드웨어에서 자기 대결을 사용하여 조합 게임용 AI 에이전트를 훈련할 수 있는 AlphaZero 알고리즘의 빠르고 범용적인 Julia 구현.

cha0upup/LeoAI

LeoAI는 웹 대시보드, 이중 자바/PHP Puppet 런타임을 통한 원격 호스트 제어, 그리고 LangChain4j 기반 LLM 에이전트를 결합한 오픈소스 AI 보강 레드팀 플랫폼으로, 후 침입 작업 자동화, 보고서 생성, 팀 관리 기능을 제공하며, JAR 또는 Docker를 통해 배포 가능합니다.

OpenBMB/DeepThinkVLA

DeepThinkVLA는 로봇 행동을 생성하기 전에 명시적인 사고 흐름(Chain-of-Thought) 단계를 삽입하는 시각-언어-행동 모델입니다. 자가회귀적 추론 → 병렬 동시 행동 생성을 결합한 하이브리드 디코더를 사용하며, 새로 구축한 몸체화된 CoT 데이터셋으로 훈련한 후 성과 중심 강화학습으로 보완합니다. 이 모델은 LIBERO 벤치마크에서 평균 97 %의 성공률을 달성하고, 순수 자가회귀 기반 대비 0.175×의 지연만을 가지며, 더 새로운 LIBERO Plus 스위트로 제로샷 전이가 가능합니다.

aidatatools/ollama-benchmark

사용자의 시스템 RAM에 따라 Ollama를 통해 실행되는 로컬 LLM의 토큰/초 처리량을 측정하는 크로스플랫폼 CLI 도구입니다.

teticio/audio-diffusion

멜 스펙트로그램에 확산 모델을 적용하여 음악과 오디오 루프를 합성하는 프레임워크로, 잠재 확산(latent diffusion) 및 조건부 생성을 지원합니다.

guidone/node-red-contrib-chatbot

Node-RED 라이브러리로, 최소한의 코딩으로 Telegram, Facebook Messenger, WhatsApp, Viber, Slack용 챗봇을 시각적으로 구축하고 배포할 수 있습니다.

ReinerBRO/grok-register

일시 이메일과 브라우저 패치를 사용하여 Cloudflare Turnstile을 우회하는 Grok (x.ai) 자동 계정 등록 도구.

khaled-alshamaa/ar-php

전문적인 아랍어 언어 처리를 위한 오픈소스 PHP 라이브러리로, 감성 분석, 철자 검사, 히자리 날짜 관리 기능 제공.

Xueyang-Song/paper-pilot

Paper Pilot는 8개 이상의 학술 데이터베이스를 크롤링하고, PDF를 다운로드하며, SQLite + FTS5 + 벡터 검색으로 인덱싱한 후, 로컬 또는 호스팅된 LLM에 근거 기반 답변을 요청할 수 있는 데스크톱(Electron + React) 연구 보조 도구입니다. 모든 데이터는 당신의 기계에 머물며, 앱은 감사 가능한 인용 트레이스와 문헌 리뷰를 위한 재현 가능한 워크플로우를 제공합니다.

melody0709/zencrop

어떤 애플리케이션에서도 상호작용 가능한 하위 창을 자르고 고정할 수 있는 독립형 Windows 유틸리티로, 고급 OCR, 번역 및 스크린샷 도구를 제공합니다.

honojs/cli

문서 검색, 서버 관리, 번들 최적화를 통합한 Hono 개발자 및 AI 에이전트를 위한 명령줄 인터페이스입니다.

fengbingchun/NN_Test

YOLO와 Ollama와 같은 현대적인 AI 프레임워크를 포함하여 딥러닝 기초, 기계학습 알고리즘, C++ 및 Python 구현의 포괄적인 컬렉션입니다.

NVIDIA/nvtrust

NVIDIA 트러스트드 컴퓨팅 및 기밀 컴퓨팅 환경에서 증명을 구현하고 검증하기 위한 도구 및 SDK 모음입니다.

Deep-ai-inc/ch.at

ch.at은 HTTP, SSH, DNS 또는 API를 통해 LLM(기본값 GPT-4o)과 대화할 수 있는 단일 바이너리 Go 서버입니다. JavaScript나 계정이 필요 없으며 모든 상태는 RAM에 유지됩니다. 개인정보 보호에 중점을 두고 있으며 자체 호스팅이 쉽고, 동일한 경량 프로토콜을 사용하여 메시지를 게시할 수 있는 공개 게시판이 포함되어 있습니다.

breezewish/CodexPotter

지정된 목표에 코드베이스를 반복적으로 일치시키기 위해 새로운 컨텍스트와 파일 시스템 메모리를 사용하는 재정렬 기반 코딩 에이전트입니다.

realopslabs/kubeledger

CPU, 메모리, GPU 자원을 추적하여 숨겨진 시스템 오버헤드를 밝히고, 네임스페이스 단위로 정확한 비용 할당을 가능하게 하는 Kubernetes 사용량 회계 도구입니다.

google-ar/arcore-unity-extensions

Unity의 AR Foundation을 위해 Google ARCore의 증강 현실(AR) 기능에 대한 네이티브 API 액세스를 제공하는 확장 기능 세트입니다.

QuinnDamerell/OctoPrint-OctoEverywhere

AI 기반 인쇄 실패 감지 기능을 갖춘 3D 프린터용 원격 액세스 및 모니터링 서비스로, 실패한 인쇄를 자동으로 중단합니다.

PallasBot/Pallas-Bot

그룹 채팅 코퍼스의 학습 기반 반복 기능과 LLM 기능을 결합하여 커뮤니티의 특정 언어 스타일을 모방하는 소셜 챗봇.

MAIF/melusine

딥러닝과 결정론적 규칙을 통합하여 이메일 라우팅, 우선순위 지정 및 세그멘테이션을 자동화하는 포괄적인 이메일 처리 라이브러리입니다.

Snaplii-Inc/agent-to-merchant-payments

사전 자금 조달과 스코프가 지정된 API 키를 사용하여 AI 에이전트가 안전하게 기프트 카드를 구매하고 공과금을 지불할 수 있도록 하는 토큰화된 결제 계층입니다.

evelyyyyynnnnn/4.0-Decision-Intelligence-Framework

운영 연구와 AI를 통합한 의사결정 인텔리전스 프레임워크로, 의료 및 금융과 같은 고위험 분야에서 강건하고 감사 가능한 최적화를 제공합니다.

gfo-project/Gradient-Free-Optimizers

혼합 탐색 공간의 black-box 최적화를 위한 Python 라이브러리로, 하이퍼파라미터 튜닝 및 엔지니어링 설계를 위해 23가지 gradient-free 알고리즘에 대한 통합 인터페이스를 제공합니다.