llm-beginner: 밑바닥부터 구현하며 LLM과 AI 에이전트를 마스터하기 위한 단계별 실습 커리큘럼
mini-GPT 구축부터 코딩 에이전트 생성까지, 6개의 단계별 구현 과제를 통해 초보자가 LLM과 AI 에이전트를 배울 수 있는 포괄적인 실습 튜토리얼 시리즈.
SkillOpt: 딥러닝 스타일의 최적화 루프를 사용하여 자기 진화형 에이전트 기술을 구현하는 실행 전략
SkillOpt는 에이전트 기술 문서를 trainable state로 취급하여, 모델 가중치를 수정하지 않고도 딥러닝 스타일의 최적화 루프를 사용하여 에이전트 성능을 진화시키고 개선하는 프레임워크입니다.
mrpt: SLAM, 내비게이션 및 3D 시각화를 특징으로 하는 모바일 로보틱스를 위한 종합적인 C++ 프레임워크
SLAM, 내비게이션 및 센서 통합을 위한 필수 도구를 제공하는 모바일 로보틱스를 위한 강력하고 모듈식인 C++ 프레임워크입니다.
unrealcv: Unreal Engine과 AI 프레임워크를 연결하여 합성 컴퓨터 비전 환경을 만드는 브리지
UnrealCV는 Unreal Engine용 플러그인으로, 컴퓨터 비전 연구자들이 가상 세계와 프로그래밍 방식으로 상호 작용하여 합성 데이터를 생성하고 PyTorch/Tensorflow와 통합할 수 있게 합니다.
paperlib: AI 기반 요약 및 시맨틱 라이브러리 검색 기능을 갖춘 오픈소스 학술 논문 관리 도구
LLM 기반 요약 및 시맨틱 검색 기능을 갖추고 메타데이터 스크레이핑과 정리를 간소화하는 오픈소스 학술 논문 관리 도구입니다.
bgslibrary: 비디오 스트림에서 전경‑배경 분리를 위한 포괄적인 C++ 프레임워크
컴퓨터 비전에서 배경 차감을 위한 포괄적인 C++ 프레임워크로, 비디오 스트림에서 움직이는 객체를 탐지하기 위해 40개가 넘는 알고리즘을 제공합니다.
emgucv: OpenCV 이미지 처리 라이브러리를 위한 크로스 플랫폼 .NET 래퍼
OpenCV 이미지 처리 라이브러리를 위한 크로스 플랫폼 .NET 래퍼로, .NET 호환 언어가 여러 운영 체제에서 OpenCV 함수를 사용할 수 있게 합니다.
MaaNTE: *異環* 게임 내 반복적인 작업을 단순화하기 위한 이미지 및 오디오 인식 기반 자동화 도구
이미지 및 오디오 인식을 사용하여 사용자 상호작용을 시뮬레이션함으로써 반복적인 게임 플레이를 단순화하는 *異環* (The Ring) 게임용 자동화 도구입니다.
stitching: 빠르고 견고한 이미지 스티칭 및 파노라마 생성을 위한 Python 패키지
OpenCV를 사용하여 여러 개의 겹치는 이미지를 하나의 파노라마로 결합하는, 빠르고 견고한 이미지 스티칭을 위한 Python 패키지입니다.
CV-CUDA: AI 전처리 파이프라인을 위한 고처리량 GPU 가속 컴퓨터 비전 라이브러리
NVIDIA에서 제공하는 GPU 가속 컴퓨터 비전 라이브러리로, AI 파이프라인을 위한 고처리량, 저지연 이미지 및 비디오 처리를 제공합니다.
comic-translate: LLM과 inpainting을 활용하여 만화 패널 내의 텍스트를 번역하는 AI 기반 만화 번역기
LLM, OCR, 및 inpainting을 사용하여 원본 이미지를 유지하면서 여러 언어의 만화를 번역하는 AI 기반 만화 번역기입니다.
habitat-lab: 실내 환경에서 embodied AI 에이전트를 훈련하고 평가하기 위한 모듈형 프레임워크
embodied AI의 엔드투엔드 개발을 위한 모듈형 고수준 라이브러리로, 실내 환경에서 작업을 수행하는 에이전트를 훈련시키고 평가하는 데 사용됩니다.
WebPlotDigitizer: 데이터 시각화 이미지에서 수치 데이터를 추출하기 위한 컴퓨터 비전 지원 도구
WebPlotDigitizer는 연구자와 과학자를 위해 데이터 시각화 이미지에서 수치 데이터를 추출하는 컴퓨터 비전 지원 도구입니다.
ComputeLibrary: Arm 하드웨어에 최적화된 저수준 머신러닝 함수 모음
Arm Cortex-A, Neoverse, Mali GPU 아키텍처에 최적화되어 고성능 ML 추론을 제공하는 저수준 머신러닝 함수 모음.
LichtFeld-Studio: 3D Gaussian Splatting 장면의 학습, 편집 및 자동화를 위한 모듈형 워크스테이션
학습, 실시간 시각화, 편집 및 내보내기를 하나의 네이티브 애플리케이션에서 통합하는 3D Gaussian Splatting을 위한 모듈형 워크스테이션.
anylabeling: YOLOv8 및 Segment Anything를 통한 자동 레이블링 기능을 갖춘 AI 지원 이미지 어노테이션 도구
YOLOv8 및 Segment Anything Model (SAM) 제품군을 통합하여 컴퓨터 비전용 데이터 레이블링을 자동화하고 가속화하는 AI 기반 이미지 어노테이션 도구입니다.
AliceVision: 3D 재구성 및 카메라 트래킹을 위한 사진측량 컴퓨터 비전 프레임워크
사진 또는 비디오로부터 3D 재구성 및 카메라 트래킹을 위한 알고리즘을 제공하는 사진측량 컴퓨터 비전 프레임워크입니다.
habitat-sim: embodied AI 연구를 위한 고성능 물리 기반 3D 시뮬레이터
embodied AI 연구를 위한 고성능 물리 기반 3D 시뮬레이터로, 현실적인 3D 환경에서 에이전트를 훈련시키기 위한 빠른 렌더링과 강체 역학을 제공합니다.
scenic: 대규모 어텐션 기반 컴퓨터 비전 모델 프로토타이핑을 위한 JAX 기반 연구 라이브러리
이미지, 비디오, 오디오 전반에 걸쳐 어텐션 기반 모델을 개발하기 위한 확장 가능한 라이브러리와 프로젝트 템플릿을 제공하는 JAX 및 Flax 기반의 컴퓨터 비전 연구용 라이브러리입니다.
torchgeo: 다중 스펙트럼 지형 공간 및 원격 탐사 데이터를 활용한 딥러닝을 위한 PyTorch 도메인 라이브러리
지형 공간 및 원격 탐사 데이터를 위해 특별히 설계된 데이터셋, 샘플러 및 사전 학습된 모델을 제공하는 PyTorch 도메인 라이브러리입니다.
VLMEvalKit: 70개 이상의 벤치마크를 지원하는 대규모 시각-언어 모델을 위한 통합 평가 툴킷
70개 이상의 벤치마크와 200개 이상의 모델에 대해 단 한 번의 명령어로 평가를 수행할 수 있는 대규모 시각-언어 모델용 오픈 소스 평가 툴킷입니다.
MaaFramework: 로우코드 블랙박스 자동화 도구를 구축하기 위한 크로스 플랫폼 이미지 인식 프레임워크
로우코드 파이프라인을 통해 시각적 기반 자동화 도구를 생성할 수 있게 해주는 블랙박스 테스트용 이미지 인식 기반 자동화 프레임워크.
obs-backgroundremoval: OBS Studio를 위한 가상 그린 스크린 및 저조도 개선 플러그인
신경망을 사용하여 인물 영상 및 이미지에 대해 가상 그린 스크린 배경 제거 및 저조도 개선 기능을 제공하는 OBS Studio 플러그인입니다.
webots: 기계 시스템 모델링 및 프로그래밍을 위한 오픈 소스 로봇 시뮬레이터
로봇, 차량 및 기계 시스템을 모델링, 프로그래밍 및 시뮬레이션할 수 있는 완전한 개발 환경을 제공하는 오픈 소스 로봇 시뮬레이터.
ceres-solver: 대규모 비선형 최소제곱 및 일반 최적화 문제를 해결하는 성숙한 C++ 라이브러리
Ceres Solver는 대규모 복잡한 비선형 최소제곱 및 일반 무제약 최적화 문제를 모델링하고 해결하기 위한 C++ 라이브러리입니다.
sparrow: 구조화된 데이터 추출 및 에이전트 워크플로우를 위한 API 우선 문서 지능 플랫폼
Vision LLM과 에이전트 워크플로우를 사용하여 송장, 영수증, 명세서를 구조화된 JSON으로 변환하는 기업용 문서 지능을 위한 API 우선 플랫폼입니다.
Chinese-CLIP: 교차 모달 검색 및 제로샷 이미지 분류를 위한 대규모 중국어 시각-언어 모델
교차 모달 검색 및 제로샷 이미지 분류를 위해 2억 개의 이미지-텍스트 쌍으로 학습된 CLIP 모델의 중국어 버전입니다.
scikit-image: 과학적 이미지 처리 및 분석을 위한 종합적인 Python 라이브러리
scikit-image는 이미지를 분석하고 조작하기 위한 알고리즘 모음을 제공하는 이미지 처리용 Python 라이브러리입니다.
Final2x: 커스텀 모델 및 Nvidia 50 시리즈 GPU를 지원하는 크로스 플랫폼 이미지 초해상도 도구
AI 모델을 사용하여 이미지를 업스케일링하고 해상도를 개선하는 크로스 플랫폼 이미지 초해상도 도구입니다.
gocv: OpenCV 4 컴퓨터 비전 라이브러리를 위한 Go 언어 바인딩
GoCV는 OpenCV 4에 대한 Go 언어 바인딩을 제공하여 Go 개발자가 고급 컴퓨터 비전 및 하드웨어 가속 이미지 처리를 애플리케이션에 통합할 수 있게 합니다.
librealsense: RealSense 카메라에서 깊이 및 컬러 데이터를 스트리밍하기 위한 크로스 플랫폼 라이브러리
RealSense 깊이 카메라를 위한 크로스 플랫폼 SDK로, 깊이 및 컬러 스트리밍을 가능하게 하고 컴퓨터 비전 및 로보틱스를 위한 보정 데이터를 제공합니다.
rerun: 물리적 AI 및 로보틱스를 위한 멀티모달 데이터 레이어 및 시각적 디버거
물리적 AI를 위한 멀티모달 데이터 레이어 및 시각적 디버거로, 개발자가 멀티레이트 센서 데이터를 실시간으로 기록, 쿼리 및 시각화할 수 있도록 지원합니다.
pcl: 2D 및 3D 이미지와 포인트 클라우드 처리를 위한 대규모 오픈소스 라이브러리
2D/3D 이미지와 포인트 클라우드 처리를 위한 대규모 오픈소스 라이브러리로, 로봇공학 및 3D 인식 분야에서 널리 사용됩니다.
segmentation_models.pytorch: 800개 이상의 사전 학습된 인코더를 제공하는 이미지 시맨틱 세그멘테이션을 위한 고수준 PyTorch 라이브러리
다양한 사전 학습된 인코더와 아키텍처를 사용하여 이미지 시맨틱 세그멘테이션 모델을 쉽게 생성하고 학습시킬 수 있는 고수준 API를 제공하는 PyTorch 라이브러리입니다.
colmap: 3D 재구성을 위한 범용 Structure-from-Motion 및 Multi-View Stereo 파이프라인
이미지 컬렉션에서 3D 구조를 재구성하기 위한 범용 Structure-from-Motion 및 Multi-View Stereo 파이프라인
Meshroom: 3D 재구성 및 컴퓨터 비전 파이프라인을 위한 노드 기반 시각적 프로그래밍 프레임워크
3D 재구성 및 컴퓨터 비전을 위한 노드 기반 시각적 프로그래밍 프레임워크로, 사용자가 AI와 사진 측량 기술을 사용하여 복잡한 데이터 처리 파이프라인을 구축할 수 있게 해줍니다.
open_clip: 대규모 대비 언어‑이미지 및 오디오‑텍스트 모델을 학습·배포하기 위한 오픈소스 프레임워크
OpenAI의 CLIP을 오픈소스로 구현한 프로젝트로, 대규모 대비 언어‑이미지 모델을 학습하고 제로샷 분류 및 검색에 활용할 수 있습니다.
carla: 자율 주행 시스템의 훈련 및 검증을 위한 오픈 소스 도시 주행 시뮬레이터
시뮬레이션된 도시 환경에서 자율 주행 시스템을 개발, 훈련 및 검증하는 데 사용되는 자율 주행 연구용 오픈 소스 시뮬레이터.
labelme: AI 지원 마스킹 및 다중 형식 데이터셋 내보내기가 가능한 그래픽 이미지 어노테이션 도구
사용자가 다양한 도형과 AI 지원 도구를 사용하여 이미지를 레이블링하고 컴퓨터 비전 모델을 위한 데이터셋을 생성할 수 있게 해주는 그래픽 이미지 어노테이션 도구입니다.
cvat: 고품질 컴퓨터 비전 데이터셋 구축을 위한 전문 데이터 어노테이션 플랫폼
고품질 컴퓨터 비전 시각 데이터셋 구축을 위한 오픈소스 데이터 어노테이션 플랫폼으로, 이미지·비디오·3D 어노테이션을 지원합니다.
AirSim: 자율 주행 차량 및 AI 연구를 위한 고충실도 시각 및 물리 시뮬레이터
Unreal Engine을 기반으로 구축된 드론 및 자동차용 오픈 소스 시뮬레이터로, 딥러닝, 컴퓨터 비전, 강화 학습 분야의 AI 연구를 위한 플랫폼으로 설계되었습니다.
MaaAssistantArknights: Arknights의 일일 작업 및 기지 관리를 자동화하는 이미지 인식 기반 자동화 어시스턴트
이미지 인식과 딥러닝을 사용하여 Arknights의 일일 작업, 기지 관리 및 자원 파밍을 자동화하는 자동화 어시스턴트.
vit-pytorch: PyTorch로 구현된 Vision Transformer (ViT) 및 그 변형들의 포괄적인 컬렉션
원본 Vision Transformer (ViT)와 수십 가지 고급 변형들을 구현한 포괄적인 PyTorch 라이브러리로, 이미지 분류에 활용됩니다.
label-studio: ML 지원 사전 레이블링 및 능동 학습을 제공하는 멀티모달 오픈소스 데이터 레이블링 도구
머신러닝 모델의 학습 데이터를 준비하거나 개선하기 위해 오디오, 텍스트, 이미지 및 비디오를 어노테이션할 수 있는 오픈소스 데이터 레이블링 도구입니다.
espnet: ASR, TTS, 음성 언어 이해를 위한 포괄적인 엔드투엔드 음성 처리 툴킷
PyTorch를 사용하는 ASR, TTS, 음성 번역 및 향상을 위한 통합 프레임워크를 제공하는 엔드투엔드 음성 처리 툴킷.
leon: 에이전트 실행 기능과 로컬 우선 프라이버시를 갖춘 오픈 소스 개인용 AI 어시스턴트
도구, 메모리, 에이전트 실행을 사용하여 작업을 수행하며 프라이버시를 위해 로컬 AI 모델을 지원하는 오픈 소스 개인용 AI 어시스턴트입니다.
HunyuanVideo-1.5: 소비자용 GPU에서 고품질 합성을 위한 경량 8.3B 파라미터 비디오 생성 모델
소비자용 GPU에서 고품질 text-to-video 및 image-to-video 합성을 가능하게 하는 경량 8.3B 파라미터 비디오 생성 모델입니다.
OpenMontage: 연구, 스크립트 작성, 편집을 전체 제작 파이프라인으로 조율하는 에이전트 기반 비디오 제작 시스템
평이한 언어의 프롬프트로부터 전문적인 비디오를 제작하기 위해 연구, 스크립트 작성, 에셋 생성 및 편집을 조율하는 오픈 소스 에이전트 기반 비디오 제작 시스템입니다.
genai-processors: 비동기 및 조합 가능한 멀티모달 AI 파이프라인 구축을 위한 모듈형 프레임워크
멀티모달 콘텐츠 처리와 스트리밍을 통합하는 모듈식, 비동기 및 조합 가능한 AI 파이프라인 구축을 위한 경량 Python 라이브러리입니다.
instill-core: 데이터 처리, 파이프라인 오케스트레이션 및 모델 호스팅을 위한 엔드투엔드 AI 인프라 플랫폼
비정형 데이터, AI 파이프라인 및 모델 배포의 오케스트레이션을 단순화하여 RAG 및 AI 우선 애플리케이션을 구축할 수 있는 엔드투엔드 AI 플랫폼입니다.