TimeScope: 장시간 비디오 대형 멀티모달 모델 이해를 위한 새로운 벤치마크
Hugging Face는 1분에서 8시간에 이르는 콘텐츠에 삽입된 비디오 needle를 사용하여 비전-언어 모델의 시간 이해도를 평가하는 오픈소스 벤치마크인 TimeScope를 소개합니다.
NVIDIA NIM과 Hugging Face 통합
NVIDIA는 NVIDIA NIM을 확장하여 Hugging Face에서 100,000개 이상의 LLM을 지원하도록 했으며, 모델 분석, 백엔드 선택 및 성능 최적화를 자동화하는 단일 Docker 컨테이너를 제공하여 빠른 배포를 가능하게 합니다.
Arc 가상 세포 챌린지 프라이머
Arc 가상 세포 챌린지는 참가자들에게 CRISPR를 이용한 유전자 침묵이 세포 전사체에 미치는 영향을 예측하는 모델을 훈련하도록 요구하며, 30만 개의 단일 세포 RNA 시퀀싱 프로파일 데이터셋을 활용합니다.
Gradio 5.38.0 MCP 서버 개선
Gradio 버전 5.38.0은 Model Context Protocol (MCP) 서버 기능에 다섯 가지 주요 업데이트를 도입했으며, 원활한 로컬 파일 지원, 실시간 진행 알림, 자동 OpenAPI 사양 변환 등을 포함합니다.
Hugging Face FutureBench: 미래 이벤트 예측에 대한 AI 에이전트 평가
Hugging Face는 FutureBench를 도입했습니다. 이 벤치마크는 AI 에이전트에게 미래 실제 사건을 예측하도록 요구함으로써 추론 및 종합 능력을 평가하며, 데이터 오염을 효과적으로 제거합니다.
Ettin Suite: 최신 상태의 페어 인코더와 디코더
Hugging Face는 동일한 데이터와 학습 레시피로 훈련된 17M~1B 파라미터 규모의 페어 인코더 전용 및 디코더 전용 모델 모음인 Ettin을 소개합니다. 이를 통해 아키텍처 성능을 통제된 방식으로 비교할 수 있습니다.
Git LFS에서 Xet으로의 Hugging Face Hub 마이그레이션
Hugging Face는 AI 워크로드에 맞춰 확장하도록 설계된 콘텐츠 주소 지정 스토리지 시스템인 Xet으로 Git LFS에서 500,000개의 리포지토리와 20 PB의 데이터를 마이그레이션했습니다.
Kimina-Prover: 대규모 형식 추론 모델에 대한 테스트 시점 RL 검색 적용
Hugging Face는 Lean 4용 최첨단 정리 증명 모델인 Kimina-Prover-72B를 발표했으며, 새로운 테스트 시점 강화 학습(TTRL) 검색 프레임워크를 활용해 miniF2F 벤치마크에서 92.2%의 통과율을 달성했습니다.
Hugging Face MCP 서버 구축
Hugging Face는 공식 Model Context Protocol (MCP) 서버를 출시했습니다. 이를 통해 AI 어시스턴트가 단일 URL로 Hugging Face Hub와 수천 개의 Gradio 기반 AI 애플리케이션에 동적으로 접근할 수 있습니다.
ScreenEnv 릴리스: 풀 스택 데스크톱 에이전트 배포
Hugging Face는 GUI 에이전트를 테스트하고 배포하기 위해 Docker 컨테이너 내에 격리된 Ubuntu 데스크톱 환경을 생성할 수 있는 Python 라이브러리인 ScreenEnv를 출시했습니다.
Hugging Face 비동기 로봇 추론
Hugging Face는 행동 예측을 실행과 분리하는 비동기 로봇 추론을 도입하여 로봇의 대기 시간을 줄이고 작업 완료 시간을 최대 2배 가속화합니다.
Hugging Face Gradio MCP 서버 통합
Hugging Face는 Model Context Protocol (MCP)을 Gradio(v5.28.0)에 통합하여, Hugging Face Spaces가 LLM에게 이미지 편집 및 전사와 같은 새로운 기능을 제공하는 방대한 MCP 서버 라이브러리로 작동하도록 했습니다.
AMD MI300용 커스텀 커널 만들기
Hugging Face는 AMD와 협력하여 MI300X용 오픈소스 최적화 커널을 개발했으며, VLLM에서 Llama 3.1 405B의 FP8 추론 성능을 크게 향상시켰습니다.
Reachy Mini: AI 개발을 위한 오픈소스 데스크톱 로봇
Hugging Face와 Pollen Robotics는 인간-로봇 상호작용 및 AI 실험을 위해 설계된, $399부터 시작하는 오픈소스 프로그래머블 데스크톱 로봇 Reachy Mini를 소개했습니다.
Hugging Face 효율적인 멀티모달 데이터 파이프라인
Hugging Face는 멀티모달 데이터 파이프라인을 최적화하기 위해 다섯 단계의 과정을 도입하고, 균형 잡힌 배낭 포장 전략을 활용해 GPU 유휴 시간과 패딩 낭비를 최소화합니다.
SmolLM3 릴리스: 다국어, 장기 컨텍스트 3B 추론기
Hugging Face는 Llama-3.2-3B와 Qwen2.5-3B보다 뛰어난 3B 파라미터 모델인 SmolLM3를 출시했으며, 듀얼 모드 추론과 128k 컨텍스트 윈도우를 특징으로 합니다.
Hugging Face 프로덕션 인프라 알림 전략
Hugging Face는 NAT 게이트웨이 처리량, 로그 보관 성공률, Kubernetes API 상태에 대한 특화된 알림을 활용하여 프로덕션 환경의 안정성과 비용 효율성을 유지합니다.
NeurIPS 2025 E2LM Competition: 언어 모델의 초기 학습 평가
Hugging Face와 파트너가 초기 LLM 학습 단계에서 추론 및 과학 지식 신호를 감지할 수 있는 벤치마크를 개발하기 위한 E2LM 대회를 발표합니다.
Sentence Transformers를 사용한 희소 임베딩 모델의 학습 및 파인튜닝
Hugging Face는 Sentence Transformers 라이브러리를 사용하여 희소 임베딩 모델의 학습 및 파인튜닝을 위한 포괄적인 가이드를 소개하여 하이브리드 검색 및 검색 성능을 향상시킵니다.
NVIDIA Llama Nemotron Nano VL 출시
NVIDIA는 고정밀 지능형 문서 처리 및 OCR 작업에 최적화된 8B 비전 언어 모델(VLM)인 Llama Nemotron Nano VL을 출시했습니다.
Gemma 3n 릴리스 노트: 멀티모달 온-디바이스 AI
Google의 Gemma 3n이 이제 오픈소스 생태계에 공개되었으며, 로컬 하드웨어 실행을 위해 설계된 네이티브 멀티모달(텍스트, 이미지, 오디오, 비디오) 및 메모리 효율적인 아키텍처를 특징으로 합니다.
SGLang Transformers 백엔드 통합
SGLang은 이제 Hugging Face transformers를 백엔드로 지원하여, 네이티브 SGLang 지원 없이도 모든 transformers 호환 모델에 대해 고성능 추론을 가능하게 합니다.
소비자 하드웨어에서 QLoRA를 사용한 FLUX.1-dev 파인튜닝
Hugging Face는 QLoRA와 diffusers 라이브러리를 사용해 FLUX.1-dev 모델을 파인튜닝하고, 단일 소비자 GPU에서 피크 VRAM 사용량을 10 GB 이하로 줄이는 방법을 보여줍니다.
Groq와 Hugging Face 추론 제공자 통합
Hugging Face는 Groq를 지원되는 추론 제공자로 추가하여 사용자가 Llama 4와 QWQ-32B와 같은 모델에 대해 고속 LPU 기반 추론을 Hub를 통해 직접 이용할 수 있게 했습니다.
LLM 성능 최적화: 긴 프롬프트 차단 및 디코드 지연 해결
Hugging Face는 긴 프롬프트가 요청 큐를 차단하고 토큰 생성 속도를 늦추는 방식을 조사하고, 지연 시간을 줄이기 위한 해결책으로 요청 병렬 프리필과 분산 프리필을 제안합니다.
Featherless AI와 Hugging Face 추론 제공자 통합
Hugging Face는 Featherless AI를 지원되는 추론 제공자로 추가하여 방대한 오픈소스 텍스트 및 대화 모델 카탈로그에 서버리스 접근을 가능하게 했습니다.
Hugging Face 커널 허브 출시
Hugging Face는 사전 컴파일된 최적화된 컴퓨트 커널을 직접 파이썬 애플리케이션에 로드하여 로컬 컴파일 없이 GPU 연산을 가속화할 수 있는 중앙 저장소인 Kernel Hub를 도입했습니다.
NVIDIA Isaac GR00T N1.5: LeRobot SO-101 팔을 위한 사후 학습
NVIDIA는 인간형 로봇의 추론 및 기술을 위한 오픈 기본 모델인 Isaac GR00T N1.5를 출시했으며, LeRobot SO-101 팔과 같은 특정 로봇 임베디엄에 대해 사후 학습이 가능합니다.
Hugging Face와 NVIDIA, Training Cluster as a Service 출시
Hugging Face와 NVIDIA는 Training Cluster as a Service를 도입했습니다. 이 협업은 연구 기관에 대규모 NVIDIA GPU 클러스터를 온디맨드로 유연하게 이용할 수 있게 하여 기본 모델 교육을 지원합니다.
Hugging Face ScreenSuite 릴리스
Hugging Face는 GUI 에이전트를 위한 포괄적인 평가 스위트인 ScreenSuite를 출시했으며, 13개의 벤치마크를 통합하여 Vision Language Models (VLMs)의 인식, 그라운딩 및 행동 능력을 평가합니다.
nanoVLM에서 KV 캐시 구현
Hugging Face는 nanoVLM 저장소에서 KV 캐싱을 처음부터 구현하여 비전 언어 모델의 생성 속도를 38% 향상시켰습니다.
Arm CPU에서 실시간 AI 사운드 생성
Arm과 Hugging Face는 Stable Audio Open을 사용한 개인 사운드 생성 도구를 시연했으며, 이를 통해 음악 제작 워크플로우에서 실시간, 온디바이스 오디오 생성이 가능해졌습니다.
Holo1 및 Surfer-H: GUI 자동화를 위한 오픈소스 Action VLMs
H Company는 정밀한 GUI 로컬라이제이션을 위해 설계된 Action Vision Language Models 패밀리인 Holo1와 실제 작업에서 92.2% 정확도를 달성하고 작업당 $0.13의 비용으로 수행되는 모듈형 웹 에이전트 Surfer-H를 출시했습니다.
Hugging Face TRL: 효율적인 GRPO 학습을 위한 공동 배치 vLLM
Hugging Face는 TRL에 공동 배치 vLLM을 도입해 학습과 추론이 동일한 GPU를 공유하도록 함으로써 유휴 시간을 없애고 GRPO 학습 중 처리량을 높입니다.
SmolVLA: Lerobot 커뮤니티 데이터로 학습된 효율적인 Vision-Language-Action 모델
Hugging Face는 커뮤니티가 공유한 데이터를 활용하여 시뮬레이션 및 실제 로봇 작업에서 더 큰 모델을 능가하는, 450M 파라미터의 소형 오픈소스 Vision-Language-Action 모델인 SmolVLA를 소개합니다.
Hugging Face CodeAgents + Structure: 구조화된 생성으로 에이전트 신뢰성 향상
Hugging Face 연구에 따르면, CodeAgents가 생각과 코드를 구조화된 JSON 형식으로 생성하도록 강제하면 파싱 오류를 제거하고 명시적인 추론을 강제함으로써, 능력 있는 모델에서 평균 2~7 퍼센트 포인트의 성능 향상을 가져옵니다.
Liger GRPO와 TRL 통합
사용자 보고서에 따르면, bf16 환경에서 DeepSpeed ZeRO-3와 Qwen2.5-0.5B-Instruct 모델을 사용할 때 Liger GRPO 손실에서 형태 불일치 오류가 발생한다고 합니다.
Hugging Face 파이썬용 Tiny Agents
Hugging Face는 Model Context Protocol (MCP) 기반의 경량 에이전트 프레임워크인 Tiny Agents in Python을 도입했습니다. 이를 통해 LLM이 최소한의 코드로 외부 도구와 상호작용할 수 있습니다.
Dell Enterprise Hub 업데이트: 온프레미스 AI 모델 및 애플리케이션
Dell과 Hugging Face는 Dell Enterprise Hub를 업데이트하여 Dell AI 서버와 AI PC용으로 최적화된 모델과 즉시 배포 가능한 AI 애플리케이션 전체 스위트를 제공했습니다.
Falcon-H1: 효율성과 성능을 위한 하이브리드 헤드 언어 모델
Hugging Face와 TII UAE는 Transformer 어텐션과 Mamba-2 상태 공간 모델을 결합하여 메모리 사용량을 줄이고 추론 속도를 높이면서 높은 성능을 달성하는 0.5B에서 34B까지의 6가지 오픈소스 하이브리드 헤드 모델군인 Falcon-H1을 소개했습니다.
Falcon-Arabic: 아랍어 언어 모델의 혁신
Technology Innovation Institute(TII)는 Falcon-Arabic이라는 7B 파라미터 모델을 출시했으며, 이 모델은 현대 표준 아랍어와 지역 방언 전반에 걸친 일반 지식, 문법 및 추론에서 더 큰 규모의 아랍어 LLM을 능가합니다.
nanoVLM: 비전 언어 모델 훈련을 위한 미니멀리스트 PyTorch 툴킷
Hugging Face는 초보자와 연구자를 위해 Vision Language Models (VLM)의 훈련 및 이해를 간소화하도록 설계된 가볍고 순수 PyTorch 기반 툴킷인 nanoVLM을 출시했습니다.
Hugging Face Diffusers 양자화 백엔드
Hugging Face Diffusers는 bitsandbytes, torchao, Quanto, GGUF, 그리고 FP8 레이어별 캐스팅을 포함한 여러 양자화 백엔드를 통합하여 FLUX.1-dev와 같은 대형 디퓨전 모델의 메모리 사용량을 줄입니다.
Microsoft와 Hugging Face, Azure AI Foundry를 위한 협업 확대
Microsoft와 Hugging Face는 10,000개 이상의 오픈 소스 모델을 Azure AI Foundry에 통합하기 위해 파트너십을 확대했으며, 이를 통해 다양한 AI 모달리티를 안전하고 엔터프라이즈급으로 배포할 수 있게 되었습니다.
Falcon-Edge: 강력하고, 범용적이며, 미세조정 가능한 1.58비트 LLMs
Hugging Face와 Falcon-LLM 팀은 새로운 사전 학습 패러다임을 통해 추론과 미세조정 모두를 지원하는 1B 및 3B 파라미터 규모의 1.58비트(삼진) 언어 모델 시리즈인 Falcon-Edge를 출시했습니다.
Hugging Face Transformers: 생태계 상호 운용성을 위한 모델 정의 표준화
Hugging Face는 Transformers 라이브러리를 모델 정의의 중심축으로 자리매김하여, Transformers가 지원하는 모든 아키텍처가 추론 엔진 및 학습 프레임워크를 포함한 광범위한 ML 생태계와 자동으로 호환되도록 하고 있습니다.
Hugging Face와 Kaggle 모델 액세스 통합
Hugging Face와 Kaggle은 Hugging Face 모델을 Kaggle 노트북 및 모델 페이지 내에서 직접 검색 가능성과 사용성을 향상시키는 통합을 출시했습니다.
Hugging Face 추론 엔드포인트: 빠른 Whisper 전사
Hugging Face는 Inference Endpoints에서 새로운 OpenAI Whisper 배포 옵션을 도입했으며, 전사 속도를 최대 8배 향상시키면서 정확성을 희생하지 않습니다.
Hugging Face 비전 언어 모델 2025 업데이트
Hugging Face는 Vision Language Models (VLMs)의 2024‑2025년 진화를 포괄적으로 정리하며, any-to-any 아키텍처, 추론 모델, 로봇 분야를 위한 Vision‑Language‑Action (VLA) 모델의 부상을 강조합니다.
LeRobot 커뮤니티 데이터셋: 로봇공학의 ImageNet 구축
Hugging Face는 LeRobot를 통해 로봇 정책의 일반화 문제를 해결하기 위해 다양하고 오픈소스인 로봇 데이터셋 저장소를 만들기 위한 커뮤니티 주도 노력을 촉진하고 있습니다.