아카이브 · 연구소 11곳 · 디스패치 870건

연구소

매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.

251

ScreenEnv 릴리스: 풀 스택 데스크톱 에이전트 배포

Hugging Face는 GUI 에이전트를 테스트하고 배포하기 위해 Docker 컨테이너 내에 격리된 Ubuntu 데스크톱 환경을 생성할 수 있는 Python 라이브러리인 ScreenEnv를 출시했습니다.

252

Hugging Face 비동기 로봇 추론

Hugging Face는 행동 예측을 실행과 분리하는 비동기 로봇 추론을 도입하여 로봇의 대기 시간을 줄이고 작업 완료 시간을 최대 2배 가속화합니다.

253

Hugging Face Gradio MCP 서버 통합

Hugging Face는 Model Context Protocol (MCP)을 Gradio(v5.28.0)에 통합하여, Hugging Face Spaces가 LLM에게 이미지 편집 및 전사와 같은 새로운 기능을 제공하는 방대한 MCP 서버 라이브러리로 작동하도록 했습니다.

254

AMD MI300용 커스텀 커널 만들기

Hugging Face는 AMD와 협력하여 MI300X용 오픈소스 최적화 커널을 개발했으며, VLLM에서 Llama 3.1 405B의 FP8 추론 성능을 크게 향상시켰습니다.

255

Reachy Mini: AI 개발을 위한 오픈소스 데스크톱 로봇

Hugging Face와 Pollen Robotics는 인간-로봇 상호작용 및 AI 실험을 위해 설계된, $399부터 시작하는 오픈소스 프로그래머블 데스크톱 로봇 Reachy Mini를 소개했습니다.

256

Hugging Face 효율적인 멀티모달 데이터 파이프라인

Hugging Face는 멀티모달 데이터 파이프라인을 최적화하기 위해 다섯 단계의 과정을 도입하고, 균형 잡힌 배낭 포장 전략을 활용해 GPU 유휴 시간과 패딩 낭비를 최소화합니다.

257

SmolLM3 릴리스: 다국어, 장기 컨텍스트 3B 추론기

Hugging Face는 Llama-3.2-3B와 Qwen2.5-3B보다 뛰어난 3B 파라미터 모델인 SmolLM3를 출시했으며, 듀얼 모드 추론과 128k 컨텍스트 윈도우를 특징으로 합니다.

258

Hugging Face 프로덕션 인프라 알림 전략

Hugging Face는 NAT 게이트웨이 처리량, 로그 보관 성공률, Kubernetes API 상태에 대한 특화된 알림을 활용하여 프로덕션 환경의 안정성과 비용 효율성을 유지합니다.

259

NeurIPS 2025 E2LM Competition: 언어 모델의 초기 학습 평가

Hugging Face와 파트너가 초기 LLM 학습 단계에서 추론 및 과학 지식 신호를 감지할 수 있는 벤치마크를 개발하기 위한 E2LM 대회를 발표합니다.

260

Sentence Transformers를 사용한 희소 임베딩 모델의 학습 및 파인튜닝

Hugging Face는 Sentence Transformers 라이브러리를 사용하여 희소 임베딩 모델의 학습 및 파인튜닝을 위한 포괄적인 가이드를 소개하여 하이브리드 검색 및 검색 성능을 향상시킵니다.

261

NVIDIA Llama Nemotron Nano VL 출시

NVIDIA는 고정밀 지능형 문서 처리 및 OCR 작업에 최적화된 8B 비전 언어 모델(VLM)인 Llama Nemotron Nano VL을 출시했습니다.

262

Gemma 3n 릴리스 노트: 멀티모달 온-디바이스 AI

Google의 Gemma 3n이 이제 오픈소스 생태계에 공개되었으며, 로컬 하드웨어 실행을 위해 설계된 네이티브 멀티모달(텍스트, 이미지, 오디오, 비디오) 및 메모리 효율적인 아키텍처를 특징으로 합니다.

263

SGLang Transformers 백엔드 통합

SGLang은 이제 Hugging Face transformers를 백엔드로 지원하여, 네이티브 SGLang 지원 없이도 모든 transformers 호환 모델에 대해 고성능 추론을 가능하게 합니다.

264

소비자 하드웨어에서 QLoRA를 사용한 FLUX.1-dev 파인튜닝

Hugging Face는 QLoRA와 diffusers 라이브러리를 사용해 FLUX.1-dev 모델을 파인튜닝하고, 단일 소비자 GPU에서 피크 VRAM 사용량을 10 GB 이하로 줄이는 방법을 보여줍니다.

265

Groq와 Hugging Face 추론 제공자 통합

Hugging Face는 Groq를 지원되는 추론 제공자로 추가하여 사용자가 Llama 4와 QWQ-32B와 같은 모델에 대해 고속 LPU 기반 추론을 Hub를 통해 직접 이용할 수 있게 했습니다.

266

LLM 성능 최적화: 긴 프롬프트 차단 및 디코드 지연 해결

Hugging Face는 긴 프롬프트가 요청 큐를 차단하고 토큰 생성 속도를 늦추는 방식을 조사하고, 지연 시간을 줄이기 위한 해결책으로 요청 병렬 프리필과 분산 프리필을 제안합니다.

267

Featherless AI와 Hugging Face 추론 제공자 통합

Hugging Face는 Featherless AI를 지원되는 추론 제공자로 추가하여 방대한 오픈소스 텍스트 및 대화 모델 카탈로그에 서버리스 접근을 가능하게 했습니다.

268

Hugging Face 커널 허브 출시

Hugging Face는 사전 컴파일된 최적화된 컴퓨트 커널을 직접 파이썬 애플리케이션에 로드하여 로컬 컴파일 없이 GPU 연산을 가속화할 수 있는 중앙 저장소인 Kernel Hub를 도입했습니다.

269

NVIDIA Isaac GR00T N1.5: LeRobot SO-101 팔을 위한 사후 학습

NVIDIA는 인간형 로봇의 추론 및 기술을 위한 오픈 기본 모델인 Isaac GR00T N1.5를 출시했으며, LeRobot SO-101 팔과 같은 특정 로봇 임베디엄에 대해 사후 학습이 가능합니다.

270

Hugging Face와 NVIDIA, Training Cluster as a Service 출시

Hugging Face와 NVIDIA는 Training Cluster as a Service를 도입했습니다. 이 협업은 연구 기관에 대규모 NVIDIA GPU 클러스터를 온디맨드로 유연하게 이용할 수 있게 하여 기본 모델 교육을 지원합니다.

271

Hugging Face ScreenSuite 릴리스

Hugging Face는 GUI 에이전트를 위한 포괄적인 평가 스위트인 ScreenSuite를 출시했으며, 13개의 벤치마크를 통합하여 Vision Language Models (VLMs)의 인식, 그라운딩 및 행동 능력을 평가합니다.

272

nanoVLM에서 KV 캐시 구현

Hugging Face는 nanoVLM 저장소에서 KV 캐싱을 처음부터 구현하여 비전 언어 모델의 생성 속도를 38% 향상시켰습니다.

273

Arm CPU에서 실시간 AI 사운드 생성

Arm과 Hugging Face는 Stable Audio Open을 사용한 개인 사운드 생성 도구를 시연했으며, 이를 통해 음악 제작 워크플로우에서 실시간, 온디바이스 오디오 생성이 가능해졌습니다.

274

Holo1 및 Surfer-H: GUI 자동화를 위한 오픈소스 Action VLMs

H Company는 정밀한 GUI 로컬라이제이션을 위해 설계된 Action Vision Language Models 패밀리인 Holo1와 실제 작업에서 92.2% 정확도를 달성하고 작업당 $0.13의 비용으로 수행되는 모듈형 웹 에이전트 Surfer-H를 출시했습니다.

275

Hugging Face TRL: 효율적인 GRPO 학습을 위한 공동 배치 vLLM

Hugging Face는 TRL에 공동 배치 vLLM을 도입해 학습과 추론이 동일한 GPU를 공유하도록 함으로써 유휴 시간을 없애고 GRPO 학습 중 처리량을 높입니다.

276

SmolVLA: Lerobot 커뮤니티 데이터로 학습된 효율적인 Vision-Language-Action 모델

Hugging Face는 커뮤니티가 공유한 데이터를 활용하여 시뮬레이션 및 실제 로봇 작업에서 더 큰 모델을 능가하는, 450M 파라미터의 소형 오픈소스 Vision-Language-Action 모델인 SmolVLA를 소개합니다.

277

Hugging Face CodeAgents + Structure: 구조화된 생성으로 에이전트 신뢰성 향상

Hugging Face 연구에 따르면, CodeAgents가 생각과 코드를 구조화된 JSON 형식으로 생성하도록 강제하면 파싱 오류를 제거하고 명시적인 추론을 강제함으로써, 능력 있는 모델에서 평균 2~7 퍼센트 포인트의 성능 향상을 가져옵니다.

278

Liger GRPO와 TRL 통합

사용자 보고서에 따르면, bf16 환경에서 DeepSpeed ZeRO-3와 Qwen2.5-0.5B-Instruct 모델을 사용할 때 Liger GRPO 손실에서 형태 불일치 오류가 발생한다고 합니다.

279

Hugging Face 파이썬용 Tiny Agents

Hugging Face는 Model Context Protocol (MCP) 기반의 경량 에이전트 프레임워크인 Tiny Agents in Python을 도입했습니다. 이를 통해 LLM이 최소한의 코드로 외부 도구와 상호작용할 수 있습니다.

280

Dell Enterprise Hub 업데이트: 온프레미스 AI 모델 및 애플리케이션

Dell과 Hugging Face는 Dell Enterprise Hub를 업데이트하여 Dell AI 서버와 AI PC용으로 최적화된 모델과 즉시 배포 가능한 AI 애플리케이션 전체 스위트를 제공했습니다.

281

Falcon-H1: 효율성과 성능을 위한 하이브리드 헤드 언어 모델

Hugging Face와 TII UAE는 Transformer 어텐션과 Mamba-2 상태 공간 모델을 결합하여 메모리 사용량을 줄이고 추론 속도를 높이면서 높은 성능을 달성하는 0.5B에서 34B까지의 6가지 오픈소스 하이브리드 헤드 모델군인 Falcon-H1을 소개했습니다.

282

Falcon-Arabic: 아랍어 언어 모델의 혁신

Technology Innovation Institute(TII)는 Falcon-Arabic이라는 7B 파라미터 모델을 출시했으며, 이 모델은 현대 표준 아랍어와 지역 방언 전반에 걸친 일반 지식, 문법 및 추론에서 더 큰 규모의 아랍어 LLM을 능가합니다.

283

nanoVLM: 비전 언어 모델 훈련을 위한 미니멀리스트 PyTorch 툴킷

Hugging Face는 초보자와 연구자를 위해 Vision Language Models (VLM)의 훈련 및 이해를 간소화하도록 설계된 가볍고 순수 PyTorch 기반 툴킷인 nanoVLM을 출시했습니다.

284

Hugging Face Diffusers 양자화 백엔드

Hugging Face Diffusers는 bitsandbytes, torchao, Quanto, GGUF, 그리고 FP8 레이어별 캐스팅을 포함한 여러 양자화 백엔드를 통합하여 FLUX.1-dev와 같은 대형 디퓨전 모델의 메모리 사용량을 줄입니다.

285

Microsoft와 Hugging Face, Azure AI Foundry를 위한 협업 확대

Microsoft와 Hugging Face는 10,000개 이상의 오픈 소스 모델을 Azure AI Foundry에 통합하기 위해 파트너십을 확대했으며, 이를 통해 다양한 AI 모달리티를 안전하고 엔터프라이즈급으로 배포할 수 있게 되었습니다.

286

Falcon-Edge: 강력하고, 범용적이며, 미세조정 가능한 1.58비트 LLMs

Hugging Face와 Falcon-LLM 팀은 새로운 사전 학습 패러다임을 통해 추론과 미세조정 모두를 지원하는 1B 및 3B 파라미터 규모의 1.58비트(삼진) 언어 모델 시리즈인 Falcon-Edge를 출시했습니다.

287

Hugging Face Transformers: 생태계 상호 운용성을 위한 모델 정의 표준화

Hugging Face는 Transformers 라이브러리를 모델 정의의 중심축으로 자리매김하여, Transformers가 지원하는 모든 아키텍처가 추론 엔진 및 학습 프레임워크를 포함한 광범위한 ML 생태계와 자동으로 호환되도록 하고 있습니다.

288

Hugging Face와 Kaggle 모델 액세스 통합

Hugging Face와 Kaggle은 Hugging Face 모델을 Kaggle 노트북 및 모델 페이지 내에서 직접 검색 가능성과 사용성을 향상시키는 통합을 출시했습니다.

289

Hugging Face 추론 엔드포인트: 빠른 Whisper 전사

Hugging Face는 Inference Endpoints에서 새로운 OpenAI Whisper 배포 옵션을 도입했으며, 전사 속도를 최대 8배 향상시키면서 정확성을 희생하지 않습니다.

290

Hugging Face 비전 언어 모델 2025 업데이트

Hugging Face는 Vision Language Models (VLMs)의 2024‑2025년 진화를 포괄적으로 정리하며, any-to-any 아키텍처, 추론 모델, 로봇 분야를 위한 Vision‑Language‑Action (VLA) 모델의 부상을 강조합니다.

291

LeRobot 커뮤니티 데이터셋: 로봇공학의 ImageNet 구축

Hugging Face는 LeRobot를 통해 로봇 정책의 일반화 문제를 해결하기 위해 다양하고 오픈소스인 로봇 데이터셋 저장소를 만들기 위한 커뮤니티 주도 노력을 촉진하고 있습니다.

292

Gradio로 MCP 서버 구축

Hugging Face는 Model Context Protocol(MCP)을 Gradio에 통합하여, 개발자가 단 하나의 매개변수 변경만으로 Python 함수를 LLM이 접근할 수 있는 도구로 전환할 수 있게 했습니다.

293

Qwen-3 채팅 템플릿 분석

Qwen-3 모델은 선택적 추론, rolling checkpoint를 통한 동적 문맥 관리, 그리고 개선된 도구 인자 직렬화가 가능한 정교한 채팅 템플릿을 도입합니다.

294

Intel AutoRound: 대형 언어 모델(LLM) 및 비전-언어 모델(VLM)을 위한 고급 가중치 전용 양자화

Intel은 서명된 그래디언트 하강법을 사용하여 LLM 및 VLM에 대해 고정밀 저비트 양자화(INT2-INT8)를 가능하게 하는 가중치 전용 사후 훈련 양자화 방법인 AutoRound를 소개했습니다.

295

Llama Guard 4 및 Llama Prompt Guard 2 출시

Meta는 12B 멀티모달 안전 모델인 Llama Guard 4와 프롬프트 인젝션 및 탈옥을 감지하기 위한 일련의 분류기인 Llama Prompt Guard 2를 출시했습니다.

296

PipelineRL: 인플라이트 가중치 업데이트를 통한 LLM 강화 학습 최적화

Hugging Face와 ServiceNow Research가 인플라이트 가중치 업데이트를 사용하여 추론 처리량과 온-폴리시 데이터 수집 간의 트레이드오프를 없애는 실험적 RL 구현인 PipelineRL을 오픈소스로 공개했습니다.

297

Hugging Face Tiny Agents: 50줄 코드로 MCP 기반 에이전트 구축

Hugging Face는 Model Context Protocol (MCP)과 InferenceClient를 사용하여 기능적인 AI 에이전트를 구축하는 방법을 보여주며, 핵심 에이전트 로직을 간단한 while 루프로 축소합니다.

298

신뢰할 수 있는 문서 추출을 위한 olmOCR 파인튜닝

TNG는 헤더와 푸터를 보존하는 파인튜닝된 olmOCR-7B-0225-preview 버전을 출시했으며, 이를 통해 인보이스 파싱과 같은 비즈니스 애플리케이션에 적합합니다.

299

LLM 성능 최적화: 동시 요청을 위한 프리필 및 디코드

Hugging Face(TNG)를 통해 연속 배치와 청크 프리필과 같은 전략으로 토큰 생성의 프리필 및 디코드 단계를 관리하면 GPU 활용도를 최적화하고 토큰 처리량을 최대 50%까지 증가시킬 수 있음을 설명합니다.

300

HELMET: 장기 컨텍스트 언어 모델을 전체적으로 평가하기

Hugging Face와 Princeton 연구원들은 HELMET를 도입했다. 이는 needle-in-a-haystack와 같은 합성 테스트를 대체하고, 장기 컨텍스트 언어 모델을 위한 다양하고, 제어 가능하며, 신뢰할 수 있는 실제 평가를 제공하는 포괄적인 벤치마크이다.