✷ 아카이브 · 연구소 11곳 · 디스패치 870건
연구소
매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.
PyTorch 프로파일링 (파트 3): Attention이 전부다
Hugging Face의 Profiling in PyTorch (Part 3)에서는 다양한 어텐션 구현이 PyTorch 프로파일러 트레이스에 어떻게 나타나는지 보여주며, 단순, 인플레이스, Math, Efficient, Flash, cuDNN 백엔드의 성능 트레이드오프를 밝혀냅니다.
Hugging Face 네이티브 속도 vLLM Transformers 모델링 백엔드
Hugging Face는 런타임에 추론 전용 레이어 융합을 동적으로 적용함으로써, 맞춤형 vLLM 구현의 처리량에 맞추거나 능가하도록 transformers vLLM 백엔드를 업데이트했습니다.
Hugging Face와 Amazon SageMaker Studio 통합
Hugging Face는 Amazon SageMaker AI와의 딥링크 통합을 도입하여 개발자가 모델 탐색에서 SageMaker Studio에서의 파인튜닝 또는 배포까지 단 한 번의 클릭으로 이동할 수 있게 했습니다.
Foundry Managed Compute의 Hugging Face 모델
Microsoft Foundry는 이제 기업 수준의 운영을 위해 클릭 한 번으로 Foundry Managed Compute에 배포할 수 있는, 매주 업데이트되는 Hugging Face 오픈 웨이트 모델의 엄선된 카탈로그를 통합합니다.
Hugging Face와 SkyPilot 통합으로 제로 이그레스 AI 스토리지
Hugging Face와 SkyPilot이 통합되어 Hugging Face Hub에 저장된 모델과 데이터셋을 읽을 때 제로 이그레스 비용으로 어떤 클라우드 공급자에서도 AI 워크로드를 실행할 수 있게 되었습니다.
LeRobot v0.6.0 릴리스 노트 / 새로운 기능
LeRobot v0.6.0은 월드 모델 정책, 확장된 VLA 모델 주, 통합 보상 모델 API, 그리고 DAgger 방식의 인간 개입 수정을 지원하는 새로운 배포 CLI를 도입합니다.
PRX 데이터 전략: VLM 재캡셔닝 및 Mosaic Streaming을 통한 사전 학습 확장
Photoroom은 7B 파라미터 모델을 최적화하기 위해 긴 VLM 생성 캡션 사용, Lance 및 Mosaic Data Shards를 결합한 하이브리드 저장 전략, 그리고 고품질 JPEG 인코딩을 강조하며 PRX의 데이터 파이프라인을 상세히 설명합니다.
Hugging Face Kernels 주요 업데이트
Hugging Face는 새로운 커널 저장소 유형, 신뢰할 수 있는 게시자 및 코드 서명, 개편된 CLI, 광범위한 프레임워크 지원, 에이전트 기반 커널 개발을 위한 기반을 도입하며 Kernels 프로젝트의 주요 업데이트를 발표했습니다.
허깅 페이스와 세레브라스 실시간 음성 AI with Gemma 4
허깅 페이스와 세레브라스는 Gemma 4 31B를 사용한 오픈 캐스케이디드 음성-음성 파이프라인을 개발하여 자연스럽고 낮은 지연 시간의 음성 AI 상호작용을 가능하게 했습니다.
ScarfBench: 엔터프라이즈 자바 프레임워크 마이그레이션을 위한 AI 에이전트 벤치마크
IBM Research는 엔터프라이즈 자바 애플리케이션을 Spring, Jakarta EE, Quarkus 프레임워크 간에 마이그레이션하는 AI 에이전트의 능력을 평가하는 오픈 벤치마크인 ScarfBench를 소개합니다.
왜 특화는 AI 시스템에서 불가피한가
2026년 Goldfeder 등(2026) 연구에 따르면, 한정된 자원으로 인해 집중된 용량이 넓은 일반성보다 더 효과적이기 때문에 특화는 AI 성능에 구조적인 필수조건이다.
허깅 페이스 커뮤니티 Evals과 Every Eval Ever (EEE) 통합
허깅 페이스는 표준화된 평가 결과를 교차 게시하고 모델 페이지와 상세 기술 기록 간의 직접 연결을 가능하게 하기 위해 커뮤니티 Evals과 Every Eval Ever (EEE) 프로젝트를 통합했습니다.
DiScoFormer: 밀도와 점수를 위한 하나의 트랜스포머, 분포 전반에 걸쳐
DiScoFormer는 주어진 데이터 포인트 집합으로부터 분포의 밀도와 점수를 단일 순전파에서 추정하며, 새로운 분포에 대해 재훈련이 필요 없는 새로운 트랜스포머 기반 모델입니다.
Hugging Face Jobs: 단일 명령으로 vLLM 서버 배포하기
Hugging Face는 이제 HF Jobs를 통해 단일 명령으로 자체 인프라에서 비공개 OpenAI 호환 vLLM 엔드포인트를 배포할 수 있게 하여, 테스트, 평가 및 배치 생성을 위한 초당 과금 대안을 제공합니다.
NVIDIA NeMo AutoModel 가 Mixture-of-Experts 모델의 파인튜닝을 가속화합니다
NVIDIA NeMo AutoModel은 Hugging Face Transformers v5 위에 Expert Parallelism, DeepEP, TransformerEngine 커널을 결합해 Mixture-of-Experts 모델 파인튜닝 시 3.4‑3.7배 높은 학습 처리량과 29‑32% 낮은 GPU 메모리 사용량을 제공하며, 단 한 줄의 import 변경만으로 사용할 수 있습니다.
Hugging Face FFASR 리더보드: 원거리 ASR 벤치마킹
허깅 페이스와 트레블 테크놀로지스는 FFASR 리더보드를 출시했는데, 이는 현실적인 음향 환경에서 근거리와 원거리 자동 음성 인식(ASR) 사이의 성능 격차를 정량화하는 최초의 오픈 커뮤니티 중심 벤치마크입니다.
Transformers.js에서 Cross-Origin Storage API 실험하기
Hugging Face는 Transformers.js가 실험적인 Cross-Origin Storage API를 사용하여 모델 및 Wasm 리소스를 해시별로 캐싱함으로써 오리진 간 중복 다운로드를 제거하는 방법을 보여줍니다.
Hugging Face huggingface_hub 릴리스 자동화
Hugging Face은 오픈소스 도구와 오픈-웨이트 모델을 사용하여 AI-driven, human-in-the-loop CI/CD 파이프라인을 구현함으로써 huggingface_hub의 4-6주 릴리스 주기를 주간 cadence로 전환했습니다.
PP-OCRv6 릴리스: 1.5M에서 34.5M 파라미터까지 50개 언어 OCR
PaddlePaddle은 1.5M에서 34.5M 파라미터까지 범위의 파라미터 수를 갖는 50개 언어를 지원하는 확장 가능한 OCR 모델 패밀리 PP-OCRv6을 출시했습니다.
OpenClaw PR 트리아지를 위한 Hugging Face 로컬 모델
Hugging Face는 Gemma 4와 Qwen 3.6과 같은 로컬 모델을 에이전트 기반 하네스에 배포함으로써 OpenClaw 저장소의 GitHub 이슈와 풀 리퀘스트를 실시간으로 비용 없이 트리아지할 수 있음을 보여줍니다.
MosaicLeaks: 딥 리서치 에이전트의 프라이버시 누출 해결
요약: Hugging Face는 연구 에이전트가 외부 웹 쿼리를 통해 프라이빗 엔터프라이즈 데이터를 누출하는 것을 방지하기 위해 벤치마크인 MosaicLeaks와 Privacy-Aware Deep Research (PA-DR) 훈련 방법을 소개합니다.
Hugging Face 에이전트 툴링에 대한 오픈 모델 벤치마킹
Hugging Face는 다양한 모델 크기와 라이브러리 버전이 소프트웨어 도구를 사용하는 코딩 에이전트의 효율성과 성공률에 어떻게 영향을 미치는지 평가하기 위한 새로운 벤치마킹 하네스를 소개합니다.
Hugging Face PEFT: LoRA 대안 평가
Hugging Face의 `PEFT` 라이브러리 벤치마킹 결과, LoRA가 널리 사용되지만 OFT, Lily와 같은 다른 파라미터 효율 파인튜닝 기법이 작업에 따라 메모리 효율성과 테스트 정확도에서 더 뛰어난 성능을 보일 수 있음을 보여줍니다.
Strands Robots와 LeRobot 통합: Hugging Face Hub 데이터셋에서 물리 로봇 배포까지
Hugging Face는 Strands Robots SDK와 LeRobot의 통합을 발표했습니다. 이를 통해 사용자는 로봇 시연을 기록하고 Hub에 푸시하며, 시뮬레이션에서 정책을 실행하고, 단일 인자 변경만으로 동일 코드를 물리 SO-101 로봇에 배포할 수 있습니다. 또한 Zenoh 기반 메쉬를 활용해 다수 로봇을 협조시킬 수 있습니다.
GLM-5.2: 장기 과업(Long-Horizon Tasks)을 위해 구축됨
Hugging Face에 출시된 Z.AI의 GLM-5.2는 견고한 1M-token 컨텍스트, IndexShare 및 MTP 개선을 통한 아키텍처 향상, 노력 수준 제어, 그리고 장기 코딩 벤치마크에서의 강력한 오픈 소스 성능을 선보입니다.
Agentic Resource Discovery (ARD) Specification and Hugging Face Implementation
Hugging Face는 AI 에이전트가 런타임에 동적으로 도구, 스킬 및 다른 에이전트를 검색하고 통합할 수 있게 하는 오픈 표준인 Agentic Resource Discovery (ARD) 사양의 레퍼런스 구현을 출시했습니다.
PyTorch 프로파일링 (파트 2): nn.Linear에서 융합 MLP까지
Hugging Face는 GPU 커널 융합 분석, torch.compile의 영향, 그리고 kernels 라이브러리를 통한 손수 튜닝된 커널 사용을 통해 PyTorch에서 다층 퍼셉트론(MLP)을 최적화하는 방법을 설명합니다.
Hugging Face Spaces agents.md는 자동 3D 멀티미디어 파이프라인을 가능하게 한다
코딩 에이전트가 자동으로 정적 Hugging Face Space를 구축했는데, 이는 두 개의 기존 Space(하나는 이미지 생성용, 다른 하나는 단일 이미지 3‑D 재구성용)를 연결하여 파리 기념비를 3‑D 가우시안 스플랫으로 보여주며, `agents.md`가 어떤 Space라도 멀티미디어 파이프라인의 조합 가능한 구성 요소로 변환함을 보여준다.
GitHub CI를 Hugging Face Jobs로 마이그레이션하기
Hugging Face는 서버리스 Hugging Face Jobs 인프라에서 GitHub Actions를 실행하는 방법을 소개하며, 이로 인해 GPU 가속 CI를 가능하게 하고 CPU 작업 실행 시간을 최대 30% 단축합니다.
OpenEnv: 오픈소스 AI를 위한 에이전틱 RL 환경 표준화
Hugging Face는 OpenEnv를 커뮤니티 조정 프로젝트로 전환하여 에이전틱 강화 학습 환경의 상호 운용성 레이어로 제공하고 있습니다.
NVIDIA Nemotron 3.5 콘텐츠 안전 릴리스
NVIDIA는 맞춤 정책 적용 및 선택적 추론 흔적을 갖춘 4B 파라미터 멀티모달, 다국어 안전 모델인 Nemotron 3.5 콘텐츠 안전을 기업용 AI를 위해 출시했습니다.
TITLE: Hugging Face hf CLI 에이전트‑최적화 재설계, 토큰 사용량을 절감하고 성공률을 높인다
SUMMARY: Hugging Face는 hf CLI의 에이전트‑최적화 재설계를 발표했으며, 토큰 사용량을 최대 6배 절감하고 Claude Code와 Codex와 같은 코딩 에이전트의 성공률을 향상시킵니다.
챗봇을 넘어선 직접 선호 최적화
제공된 소스 자료는 Hugging Face의 429 속도 제한 오류 페이지이며, Direct Preference Optimization과 관련된 기술적 내용이 포함되어 있지 않습니다.
Hugging Face Rate Limit로 인해 'Adding MCP Tools to Reachy Mini' 게시물에 접근 불가
요약: Hugging Face 링크가 블로그 게시물 'Adding MCP Tools to Reachy Mini'에 대해 429 rate limit 오류를 반환하므로 요약할 내용이 없습니다.
제목: Holo3.1: 빠른 & 로컬 컴퓨터 사용 에이전트
요약: Holo3.1에 대한 제공된 소스 자료는 429 속도 제한 오류로 인해 사용할 수 없으며, 기술 세부 사항이 제공되지 않았습니다.
JetBrains Mellum2 릴리스
JetBrains는 12B Mixture-of-Experts(MoE) 모델인 Mellum2의 출시를 발표했지만, 제공된 소스 자료는 오류 페이지이며 기술 세부 정보가 없습니다.
LLM을 넘어: 확장 가능한 기업용 AI 도입이 에이전트 로직에 달려 있는 이유 – 요약
Hugging Face의 “Beyond LLMs: Why Scalable Enterprise AI Adoption Depends on Agent Logic”에 관한 포스트를 가져올 수 없었으므로, 기술적 세부 사항을 요약할 수 없습니다.
PyTorch에서 프로파일링: torch.profiler 초보자 가이드
Hugging Face는 torch.profiler를 활용해 병목을 식별하고, CPU‑GPU 디스패치 체인을 이해하며, torch.compile이 커널 실행에 미치는 영향을 분석하는 포괄적인 가이드를 제공합니다.
Reachy Mini 로컬 음성 백엔드 통합
Hugging Face는 Reachy Mini용 로컬 음성-음성 파이프라인을 출시하여, 캐스케이드된 VAD, STT, LLM, TTS 스택을 사용해 로봇이 대화를 완전히 로컬에서 처리할 수 있도록 했습니다.
TRL의 Delta Weight Sync를 통한 최소 대역폭 기반 조 단위 파라미터 모델 학습
Hugging Face는 TRL에 Delta Weight Sync 기능을 발표했습니다. 이 기능은 Hugging Face Buckets를 통해 희소 가중치 변경 사항만 전송함으로써 비동기 RL 학습의 가중치 동기화 대역폭을 100배 이상 줄여, 공유 클러스터 없이도 분리된 학습을 가능하게 합니다.
Hugging Face AI Agent 용어 사전: Harness, Scaffold 및 Agent Architecture 정의
Hugging Face는 AI agent를 모델, 실행을 위한 harness, 행동 정의를 위한 scaffolding의 결합으로 정의하며, AI agent를 위한 표준화된 어휘를 제공합니다.
OlmoEarth v1.1 릴리스 노트 / 새로운 기능
Hugging Face와 AllenAI는 계산 비용을 최대 3배까지 줄이면서 v1과 유사한 성능을 유지하는 지구 관측 모델 가족인 OlmoEarth v1.1을 출시했습니다.
Ettin Reranker 패밀리 v1 릴리즈 노트
Hugging Face가 Ettin Reranker 패밀리를 공개했습니다. 17M부터 1B 파라미터까지 여섯 개의 CrossEncoder 재랭커가 mxbai-rerank-large-v2 로부터 디스틸링되었으며, 최첨단 검색 재랭킹 품질과 속도를 달성했습니다.
PaddleOCR 3.5 릴리즈 노트 / 새로운 내용
PaddleOCR 3.5는 Hugging Face Transformers를 지원되는 추론 백엔드로 도입하여 OCR 및 문서 파싱 모델이 PyTorch 기반 워크플로에 보다 원활하게 통합될 수 있도록 합니다.
Granite Embedding 다국어 R2 릴리스: 32K 컨텍스트를 지원하는 오픈 Apache 2.0 다국어 임베딩
IBM Granite은 Apache 2.0 라이선스의 두 가지 다국어 임베딩 모델—granite-embedding-97m-multilingual-r2(97M)와 granite-embedding-311m-multilingual-r2(311M)—을 출시했으며, 32K 토큰 컨텍스트, 200개 이상 언어 지원, 그리고 서브‑100M 규모 모델 중 최고 검색 점수를 제공합니다.
연속 배치에서 비동기성 활용하기
Hugging Face는 CUDA 스트림과 이벤트를 사용하여 연속 배치에서 CPU와 GPU 작업을 겹치게 하는 방법을 보여주며, 8B 모델이 8K 토큰을 생성할 때 LLM 추론 시간을 약 22% 단축합니다.
AWS에서 파운데이션 모델 훈련 및 추론을 위한 빌딩 블록
Hugging Face는 AWS에서 인프라, 리소스 오케스트레이션, ML 소프트웨어 스택, 관측성을 포함하는 4계층 아키텍처 프레임워크를 상세히 설명하여 사전 훈련, 사후 훈련 및 테스트 시점 컴퓨팅의 진화하는 스케일링 법칙을 지원합니다.
vLLM V1 마이그레이션: 강화 학습에서 백엔드 정확성 보장
ServiceNow AI는 로그확률 의미, 런타임 기본값, 가중치 업데이트 경로를 수정하고 fp32 lm_head를 구현함으로써 RL 롤아웃 생성에서 vLLM V0와 V1 간의 동등성을 달성했습니다.
허깅 페이스 오픈 ASR 리더보드: 벤치맥싱 방지를 위한 비공개 데이터셋
허깅 페이스는 Appen Inc.와 DataoceanAI의 비공개 평가 데이터셋을 오픈 ASR 리더보드에 도입하여 테스트 세트 오염을 방지하고 실제 세계에서의 ASR 성능에 대한 보다 강력한 측정을 제공합니다.
IBM Granite 4.1 LLMs 릴리스 노트 / 기술 개요
IBM은 Granite 4.1을 출시했습니다. 이는 높은 성능을 달성하기 위해 엄격한 데이터 큐레이션과 다단계 강화 학습 파이프라인을 사용하는 밀집형, 디코더 전용 LLM 가족(3B, 8B, 30B)입니다.