2051

cvat: 고품질 컴퓨터 비전 데이터셋 구축을 위한 전문 데이터 어노테이션 플랫폼

고품질 컴퓨터 비전 시각 데이터셋 구축을 위한 오픈소스 데이터 어노테이션 플랫폼으로, 이미지·비디오·3D 어노테이션을 지원합니다.

2052

AirSim: 자율 주행 차량 및 AI 연구를 위한 고충실도 시각 및 물리 시뮬레이터

Unreal Engine을 기반으로 구축된 드론 및 자동차용 오픈 소스 시뮬레이터로, 딥러닝, 컴퓨터 비전, 강화 학습 분야의 AI 연구를 위한 플랫폼으로 설계되었습니다.

2053

MaaAssistantArknights: Arknights의 일일 작업 및 기지 관리를 자동화하는 이미지 인식 기반 자동화 어시스턴트

이미지 인식과 딥러닝을 사용하여 Arknights의 일일 작업, 기지 관리 및 자원 파밍을 자동화하는 자동화 어시스턴트.

2054

vit-pytorch: PyTorch로 구현된 Vision Transformer (ViT) 및 그 변형들의 포괄적인 컬렉션

원본 Vision Transformer (ViT)와 수십 가지 고급 변형들을 구현한 포괄적인 PyTorch 라이브러리로, 이미지 분류에 활용됩니다.

2055

label-studio: ML 지원 사전 레이블링 및 능동 학습을 제공하는 멀티모달 오픈소스 데이터 레이블링 도구

머신러닝 모델의 학습 데이터를 준비하거나 개선하기 위해 오디오, 텍스트, 이미지 및 비디오를 어노테이션할 수 있는 오픈소스 데이터 레이블링 도구입니다.

2056

espnet: ASR, TTS, 음성 언어 이해를 위한 포괄적인 엔드투엔드 음성 처리 툴킷

PyTorch를 사용하는 ASR, TTS, 음성 번역 및 향상을 위한 통합 프레임워크를 제공하는 엔드투엔드 음성 처리 툴킷.

2057

leon: 에이전트 실행 기능과 로컬 우선 프라이버시를 갖춘 오픈 소스 개인용 AI 어시스턴트

도구, 메모리, 에이전트 실행을 사용하여 작업을 수행하며 프라이버시를 위해 로컬 AI 모델을 지원하는 오픈 소스 개인용 AI 어시스턴트입니다.

2058

Cursor iOS 앱이 사용자 동의 없이 새로운 프라이버시 모드로 전환

Cursor iOS 앱을 설치하면 계정이 레거시 "코드를 저장하지 않음" 프라이버시 모드에서 덜 제한적인 새로운 모드로 자동 이동하고, 레거시 옵션은 앱 내에서 복구할 수 없습니다.

2059

PlayStation Store Studio Canal 영화 삭제

Sony는 PlayStation Store 사용자 계정에서 수백 편의 Studio Canal 영화를 환불 없이 삭제했으며, 이는 디지털 소유권의 본질에 대한 논쟁을 촉발했습니다.

2060

미국 대법원, 지오펜스 영장이 헌법적 보호를 요구한다고 판결

미국 대법원은 지오펜스 영장이 수정헌법 4조 보호를 준수해야 한다고 판결했으며, 위치 서비스에 opt-in하는 것이 사용자의 개인정보 보호권을 포기한다는 주장을 거부했습니다.

2061

Tidal AI 정책: AI 생성 음악의 수익 창출 제한

Tidal은 플랫폼에서 AI 생성 음악을 허용하되 수익 창출을 금지하는 새로운 AI 정책을 도입했습니다. 이는 로열티가 인간 아티스트에게만 돌아가도록 보장하기 위함입니다.

2062

HunyuanVideo-1.5: 소비자용 GPU에서 고품질 합성을 위한 경량 8.3B 파라미터 비디오 생성 모델

소비자용 GPU에서 고품질 text-to-video 및 image-to-video 합성을 가능하게 하는 경량 8.3B 파라미터 비디오 생성 모델입니다.

2063

OpenMontage: 연구, 스크립트 작성, 편집을 전체 제작 파이프라인으로 조율하는 에이전트 기반 비디오 제작 시스템

평이한 언어의 프롬프트로부터 전문적인 비디오를 제작하기 위해 연구, 스크립트 작성, 에셋 생성 및 편집을 조율하는 오픈 소스 에이전트 기반 비디오 제작 시스템입니다.

2064

Ornith-1.0: 에이전트 코딩을 위한 자기 개선형 오픈 소스 모델

Ornith-1.0은 Gemma 4 및 Qwen 3.5를 기반으로 사후 학습된 에이전트 코딩용 MIT 라이선스 자기 개선형 오픈 소스 모델 제품군(9B, 35B, 397B)입니다.

2065

Outer Shell: SSH용 네이티브 그래픽 셸

Outer Shell은 SSH를 통해 원격 서버에 브라우저 기반 그래픽 인터페이스를 제공하며, Unix 도메인 소켓을 사용해 공개 HTTP 포트 없이 네이티브 및 HTML 기반 앱을 서비스합니다.

2066

Rocket Lab Iridium 인수

Rocket Lab은 Iridium을 인수하여 수익성 있는 위성 통신 네트워크와 귀중한 스펙트럼을 확보함으로써 수직 통합 우주 기업으로 거듭났습니다.

2067

삼성, SK 하이닉스, 그리고 마이크론, 미국에서 메모리 가격 담합으로 고소당함

삼성, SK 하이닉스, 그리고 마이크론은 DRAM 공급 감소와 구형 메모리 표준의 단종을 협조해 가격을 올렸다는 혐의로 미국에서 소송을 당하고 있습니다.

2068

ZLUDA 6 출시: 비 NVIDIA GPU에서 수정되지 않은 CUDA 애플리케이션 실행하기

ZLUDA 6는 32비트 PhysX 지원, Blender를 위한 기본적인 텍스처 지원, 그리고 비 NVIDIA 하드웨어에서 CUDA 애플리케이션을 실행하기 위한 대폭 개선된 Windows 사용성을 도입합니다.

2069

Mullvad VPN 논란: 공동 설립자 Daniel Berntsson의 정치 기부

Mullvad VPN 공동 설립자 Daniel Berntsson의 스웨덴 Örebro Party에 대한 자금 지원이 기업 중립성과 사적 정치 기부 및 기업 가치의 교차점에 대한 논의를 촉발했습니다.

2070

AI와 함께 작업하기: 마법사의 견습생 문제에 대한 구체적인 사례

Carson Gross는 하이퍼스크립트 파서의 실제 버그 수정을 통해 소프트웨어 개발에서 AI의 강점과 약점을 탐구하며, AI가 제안하는 해결책을 무비판적으로 받아들이는 위험성을 강조합니다.

2071

BAIR 2026 졸업생 쇼케이스

Berkeley Artificial Intelligence Research (BAIR) Lab이 2026년 박사 학위 졸업생 명단을 발표하며 로봇 공학, 대규모 언어 모델, AI 안전성 및 헬스케어를 아우르는 연구 성과를 강조했습니다.

2072

genai-processors: 비동기 및 조합 가능한 멀티모달 AI 파이프라인 구축을 위한 모듈형 프레임워크

멀티모달 콘텐츠 처리와 스트리밍을 통합하는 모듈식, 비동기 및 조합 가능한 AI 파이프라인 구축을 위한 경량 Python 라이브러리입니다.

2073

instill-core: 데이터 처리, 파이프라인 오케스트레이션 및 모델 호스팅을 위한 엔드투엔드 AI 인프라 플랫폼

비정형 데이터, AI 파이프라인 및 모델 배포의 오케스트레이션을 단순화하여 RAG 및 AI 우선 애플리케이션을 구축할 수 있는 엔드투엔드 AI 플랫폼입니다.

2074

YTPro: AI 기반 비디오 요약 및 고급 재생 컨트롤 기능을 갖춘 수정된 YouTube 클라이언트

Google Gemini를 통합하여 AI 비디오 요약 기능을 제공하며, 광고 차단 및 콘텐츠 다운로드 도구를 함께 갖춘 수정된 YouTube 클라이언트.

2075

alan-sdk-web: 실시간으로 비즈니스 로직과 UI를 생성할 수 있는 인텔리전트 앱 플랫폼 SDK

웹 애플리케이션에 인텔리전트 레이어를 삽입하여 실시간으로 비즈니스 로직과 UI 컴포넌트를 생성할 수 있는 SDK.

2076

presentation-ai: 로컬 LLM 및 커스텀 테마를 지원하는 오픈소스 AI 프레젠테이션 생성기

개요 우선 워크플로우를 통해 주제로부터 커스텀 가능한 슬라이드를 생성하는 오픈소스 AI 기반 프레젠테이션 생성기입니다.

2077

TTS-WebUI: 수십 개의 오픈 소스 텍스트 음성 변환 및 오디오 생성 모델을 실행하고 관리하기 위한 통합 웹 인터페이스

광범위한 오픈 소스 텍스트 음성 변환, 오디오 생성 및 오디오 변환 AI 모델을 관리하고 실행하기 위한 통합 웹 인터페이스.

2078

Gemini-API: Google Gemini 웹 앱을 위한 리버스 엔지니어링된 비동기 Python wrapper

Google Gemini 웹 앱에 대한 리버스 엔지니어링된 비동기 Python wrapper로, 이미지 생성, 딥 리서치, 커스텀 Gems와 같은 기능에 대한 프로그래밍 방식의 접근을 가능하게 합니다.

2079

hallucination-leaderboard: 요약 작업 시 LLM 환각률을 추적하는 공개 리더보드

Vectara의 Hallucination Evaluation Model (HHEM)을 사용하여 문서를 요약할 때 서로 다른 LLM이 얼마나 자주 환각을 일으키는지 측정하고 비교하는 공개 리더보드입니다.

2080

semantic-router: LLM 및 에이전트를 위한 의미론적 벡터 공간을 이용한 초고속 의사결정 레이어

느린 LLM 생성 대신 의미론적 벡터 공간을 사용하여 의미에 기반하여 요청을 라우팅하는 LLM 및 에이전트를 위한 고속 의사결정 레이어.

2081

transformer-explainer: GPT-2의 내부 동작을 학습하기 위한 대화형 브라우저 기반 시각화 도구

브라우저에서 실시간 GPT-2 모델을 실행하여 사용자가 Transformer 기반 모델이 텍스트를 예측하는 방식을 학습할 수 있도록 돕는 대화형 시각화 도구입니다.

2082

ChatGPT-Shortcut: 여러 플랫폼에서 AI 출력을 개선하기 위한 큐레이션된 프롬프트 라이브러리 및 관리 도구

5,000개 이상의 프롬프트 큐레이션 라이브러리와 다양한 AI 플랫폼에서 맞춤형 프롬프트를 정리, 생성 및 공유할 수 있는 도구를 제공하는 AI 프롬프트 관리 도구입니다.

2083

morphic: 스트리밍된 JSON으로부터 풍부한 인라인 컴포넌트를 렌더링하는 생성형 UI를 갖춘 AI 검색 엔진

생성형 UI를 사용하여 단순한 텍스트 대신 풍부하고 인용된 답변을 대화형 컴포넌트로 렌더링하는 AI 기반 검색 엔진입니다.

2084

krita-ai-diffusion: 정밀한 이미지 편집 및 페인팅을 위해 diffusion models를 통합하는 Krita용 생성형 AI 플러그인

페인팅 워크플로우에 생성형 AI diffusion models를 통합하여 inpainting, live painting 및 정밀한 구조적 제어를 위한 도구를 제공하는 Krita 플러그인.

2085

outlines: 타입 제약 생성을 통해 구조화된 LLM 출력을 보장하는 라이브러리

생성을 특정 Python 타입 또는 Pydantic 모델에 맞게 제한함으로써 LLM으로부터 구조화된 출력을 보장하는 라이브러리입니다.

2086

Open-Generative-AI: 로컬 추론 및 멀티 모델 지원을 갖춘 AI 비디오 플랫폼의 제한 없는 오픈 소스 대안

200개 이상의 모델을 사용하여 이미지와 비디오를 생성할 수 있는 오픈 소스이며 제한 없는 AI 스튜디오로, 로컬 추론 옵션과 시각적 워크플로우 빌더를 특징으로 합니다.

2087

openui: 실시간 설명을 프레임워크 준비 코드로 변환하는 오픈소스 AI 기반 UI 생성기

자연어로 UI 컴포넌트를 설명하면 실시간으로 렌더링되고, 이를 React, Svelte, Web Components로 변환할 수 있는 오픈소스 도구입니다.

2088

TurboDiffusion: 확산 지연 시간을 100-200배 줄이는 비디오 생성 가속 프레임워크

TurboDiffusion은 어텐션 최적화와 타임스텝 증류를 활용해 단일 GPU에서 확산 생성 속도를 100-200배 가속하는 비디오 생성 가속 프레임워크입니다.

2089

MAGI-1: 강력한 물리적 정확성을 갖춘 확장 가능한 고충실도 비디오 생성을 위한 자기회귀 월드 모델

MAGI-1은 시간적 일관성과 물리적 정확성을 보장하기 위해 비디오를 청크 단위로 생성하는 자기회귀 비디오 생성 모델입니다.

2090

ComfyUI-LTXVideo: 고급 LTX-2 비디오 생성 및 오디오 합성을 위한 커스텀 ComfyUI 노드

HDR 출력, 립싱크, 생성형 업스케일링과 같은 기능으로 LTX-2 비디오 생성 모델을 확장하는 커스텀 ComfyUI 노드 및 워크플로우 모음입니다.

2091

transformerlab-app: AI 연구 도구와 클러스터 오케스트레이션을 통합하는 오픈 소스 머신러닝 플랫폼

개인 및 연구실을 위해 학습, 미세 조정, 추론 및 평가를 하나의 인터페이스로 통합하는 오픈 소스 머신러닝 플랫폼.

2092

CUDA 커널을 실행할 때 발생하는 일: 소스에서 SASS까지

CUDA 커널의 전체 수명 주기를 깊이 있게 살펴보며, nvcc 컴파일 및 PTX/SASS 생성 단계부터 RTX 4090에서의 하드웨어 수준 실행까지의 흐름을 추적합니다.

2093

HackerRank Hiring Agent: AI 이력서 스크리닝에서 비결정성 분석

HackerRank의 오픈소스 `hiring-agent` 도구를 분석한 결과, 동일한 이력서가 여러 번 실행될 때마다 점수가 크게 달라지는 심각한 점수 일관성 문제와 설계 결함이 드러났습니다.

2094

Translated article title, plain text

Translated summary, plain text

2095

SimpleTuner: 기업급 오케스트레이션을 갖춘 멀티모달 생성 모델 미세 조정을 위한 통합 훈련 프레임워크

이미지, 비디오, 오디오 생성 모델의 미세 조정을 위한 포괄적인 훈련 프레임워크로, 단순성과 메모리 효율성에 중점을 두어 다양한 아키텍처를 지원합니다.

2096

OneTrainer: 다양한 확산 모델(diffusion models)을 학습시키고 미세 조정하기 위한 원스톱 솔루션

GUI 또는 CLI를 통해 데이터셋 준비, 미세 조정, 모델 변환 도구를 제공하는 확산 모델을 위한 포괄적인 학습 스위트입니다.

2097

OpenDeepWiki: 코드베이스로부터 구조화된 문서, 채팅 인터페이스 및 MCP 엔드포인트를 생성하는 AI 기반 저장소 지식 베이스

Git 저장소와 로컬 디렉토리를 구조화된 문서, 검색 가능한 채팅 인터페이스 및 MCP 엔드포인트로 변환하는 AI 기반 지식 베이스 생성기.

2098

MetaClaw: 실세계 대화를 통해 AI 어시스턴트가 메타 학습하고 진화할 수 있게 하는 에이전트 프록시

스킬 주입과 비동기 RL 파인튜닝을 사용하여 AI 어시스턴트가 실세계 대화를 통해 메타 학습하고 진화할 수 있게 하는 에이전트 프록시입니다.

2099

Kiln: 프롬프트 최적화, 평가 및 에이전트 오케스트레이션을 위한 로컬 퍼스트 AI 개발 워크벤치

프롬프트 최적화, 평가, RAG, 파인튜닝을 팀을 위한 단일 워크플로우로 통합하는 로컬 퍼스트 AI 개발 워크벤치입니다.

2100

h2o-llmstudio: 메모리 효율적인 학습을 지원하는 대규모 언어 모델 미세 조정을 위한 노코드 GUI 및 프레임워크

LoRA와 같은 메모리 효율적인 기술과 DPO와 같은 고급 최적화 방법을 지원하는 대규모 언어 모델 미세 조정을 위한 노코드 GUI 및 프레임워크.