LLMs를 넘어: 확장 가능한 기업 AI 채택이 Agent Logic에 의존하는 이유
제공된 소스 자료는 429 Too Many Requests 오류로 인해 사용할 수 없으며, 따라서 Agent Logic 또는 기업 AI 채택과 관련된 기술 내용이 없습니다.
PyTorch에서 프로파일링: torch.profiler 초보자 가이드
Hugging Face는 torch.profiler를 활용해 병목을 식별하고, CPU‑GPU 디스패치 체인을 이해하며, torch.compile이 커널 실행에 미치는 영향을 분석하는 포괄적인 가이드를 제공합니다.
Reachy Mini 로컬 음성 백엔드 통합
Hugging Face는 Reachy Mini용 로컬 음성-음성 파이프라인을 출시하여, 캐스케이드된 VAD, STT, LLM, TTS 스택을 사용해 로봇이 대화를 완전히 로컬에서 처리할 수 있도록 했습니다.
TRL의 Delta Weight Sync를 통한 최소 대역폭 기반 조 단위 파라미터 모델 학습
Hugging Face는 TRL에 Delta Weight Sync 기능을 발표했습니다. 이 기능은 Hugging Face Buckets를 통해 희소 가중치 변경 사항만 전송함으로써 비동기 RL 학습의 가중치 동기화 대역폭을 100배 이상 줄여, 공유 클러스터 없이도 분리된 학습을 가능하게 합니다.
Hugging Face AI Agent 용어 사전: Harness, Scaffold 및 Agent Architecture 정의
Hugging Face는 AI agent를 모델, 실행을 위한 harness, 행동 정의를 위한 scaffolding의 결합으로 정의하며, AI agent를 위한 표준화된 어휘를 제공합니다.
OlmoEarth v1.1 릴리스 노트 / 새로운 기능
Hugging Face와 AllenAI는 계산 비용을 최대 3배까지 줄이면서 v1과 유사한 성능을 유지하는 지구 관측 모델 가족인 OlmoEarth v1.1을 출시했습니다.
Ettin Reranker 패밀리 v1 릴리즈 노트
Hugging Face가 Ettin Reranker 패밀리를 공개했습니다. 17M부터 1B 파라미터까지 여섯 개의 CrossEncoder 재랭커가 mxbai-rerank-large-v2 로부터 디스틸링되었으며, 최첨단 검색 재랭킹 품질과 속도를 달성했습니다.
PaddleOCR 3.5 릴리즈 노트 / 새로운 내용
PaddleOCR 3.5는 Hugging Face Transformers를 지원되는 추론 백엔드로 도입하여 OCR 및 문서 파싱 모델이 PyTorch 기반 워크플로에 보다 원활하게 통합될 수 있도록 합니다.
Granite Embedding 다국어 R2 릴리스: 32K 컨텍스트를 지원하는 오픈 Apache 2.0 다국어 임베딩
IBM Granite은 Apache 2.0 라이선스의 두 가지 다국어 임베딩 모델—granite-embedding-97m-multilingual-r2(97M)와 granite-embedding-311m-multilingual-r2(311M)—을 출시했으며, 32K 토큰 컨텍스트, 200개 이상 언어 지원, 그리고 서브‑100M 규모 모델 중 최고 검색 점수를 제공합니다.
연속 배치에서 비동기성 활용하기
Hugging Face는 CUDA 스트림과 이벤트를 사용하여 연속 배치에서 CPU와 GPU 작업을 겹치게 하는 방법을 보여주며, 8B 모델이 8K 토큰을 생성할 때 LLM 추론 시간을 약 22% 단축합니다.
AWS에서 파운데이션 모델 훈련 및 추론을 위한 빌딩 블록
Hugging Face는 AWS에서 인프라, 리소스 오케스트레이션, ML 소프트웨어 스택, 관측성을 포함하는 4계층 아키텍처 프레임워크를 상세히 설명하여 사전 훈련, 사후 훈련 및 테스트 시점 컴퓨팅의 진화하는 스케일링 법칙을 지원합니다.
vLLM V1 마이그레이션: 강화 학습에서 백엔드 정확성 보장
ServiceNow AI는 로그확률 의미, 런타임 기본값, 가중치 업데이트 경로를 수정하고 fp32 lm_head를 구현함으로써 RL 롤아웃 생성에서 vLLM V0와 V1 간의 동등성을 달성했습니다.
허깅 페이스 오픈 ASR 리더보드: 벤치맥싱 방지를 위한 비공개 데이터셋
허깅 페이스는 Appen Inc.와 DataoceanAI의 비공개 평가 데이터셋을 오픈 ASR 리더보드에 도입하여 테스트 세트 오염을 방지하고 실제 세계에서의 ASR 성능에 대한 보다 강력한 측정을 제공합니다.
IBM Granite 4.1 LLMs 릴리스 노트 / 기술 개요
IBM은 Granite 4.1을 출시했습니다. 이는 높은 성능을 달성하기 위해 엄격한 데이터 큐레이션과 다단계 강화 학습 파이프라인을 사용하는 밀집형, 디코더 전용 LLM 가족(3B, 8B, 30B)입니다.
DeepInfra와 Hugging Face Inference Providers의 통합
Hugging Face가 DeepInfra를 지원되는 Inference Provider로 추가하여, Hub 및 클라이언트 SDK를 통해 DeepSeek V4 및 Kimi-K2.6를 포함한 100개 이상의 모델에 대한 서버리스 액세스를 가능하게 했습니다.
제목: NVIDIA Nemotron 3 Nano Omni 릴리스 노트 / 새로운 기능
요약: NVIDIA는 텍스트, 이미지, 비디오, 오디오 전반에 걸친 장기 컨텍스트 추론이 가능한 옴니모달 모델인 Nemotron 3 Nano Omni를 출시했으며, 문서 지능 및 비디오 이해 벤치마크에서 최고 수준의 정확도를 제공합니다.
OpenAI Privacy Filter: 확장 가능한 PII 탐지 웹 앱 구축하기
OpenAI는 128k 컨텍스트 윈도우에서 8가지 범주의 민감한 데이터를 라벨링할 수 있는 오픈 소스 1.5B-parameter PII 탐지기인 Privacy Filter를 출시했습니다.
DeepSeek-V4 릴리스 노트: AI 에이전트를 위한 효율적인 1M-토큰 컨텍스트
DeepSeek-V4는 하이브리드 CSA/HCA 주의 메커니즘으로 구동되는 1M-토큰 컨텍스트 윈도우를 도입하며, 장기 실행 에이전트 워크로드 및 도구 사용 궤적에 특별히 최적화되었습니다.
크롬 확장 프로그램에서 Transformers.js 사용하기
Hugging Face는 Gemma 4 E2B로 구동되는 백그라운드 호스팅 모델 아키텍처를 특징으로 하는 Manifest V3를 사용하는 Chrome 확장 프로그램에 Transformers.js를 통합하는 기술 가이드를 제공합니다.
QIMMA: 품질 우선 아라비아어 LLM 리더보드
Hugging Face와 파트너들은 QIMMA를 도입했습니다. 이는 새로운 아라비아어 LLM 리더보드로, 벤치마크가 실제 언어 능력을 반영하도록 엄격한 품질 검증 파이프라인을 구현합니다.
Hugging Face: AI와 사이버 보안의 미래
Hugging Face는 오픈소스 AI 모델과 툴링이 Mythos와 같은 자율 취약점 탐지 시스템이 초래하는 위험에 대응하기 위한 사이버 보안 방어에 필수적이라고 주장합니다.
Ecom-RLVE: 전자상거래 대화형 에이전트를 위한 적응형 검증 가능한 환경
Hugging Face는 대화형 유창성과 실제 작업 완료 사이의 격차를 해소하기 위해 적응형 난이도 확장을 갖춘 여덟 개 검증 가능하고 다중 턴 환경을 사용하여 전자상거래 에이전트를 훈련하는 프레임워크인 EcomRLVE-GYM을 소개합니다.
Hugging Face transformers-to-mlx 스킬 및 테스트 하네스
Hugging Face는 transformers 라이브러리에서 mlx-lm으로 언어 모델 포팅을 간소화하면서 높은 코드 품질과 리뷰어 신호를 유지하기 위해 스킬과 비에이전트 테스트 하네스를 출시했습니다.
Sentence Transformers를 사용한 멀티모달 임베딩 & 리랭커 모델의 학습 및 파인튜닝
Hugging Face는 Sentence Transformers를 사용한 멀티모달 임베딩 및 리랭커 모델의 학습과 파인튜닝에 대한 가이드를 발표했으며, 작업 특화 파인튜닝이 Visual Document Retrieval과 같은 검색 작업에서 성능을 향상시킨다는 것을 보여주었습니다.
VAKRA 내부 살펴보기: 에이전트의 추론, 도구 사용 및 실패 모드
IBM Research는 API와 문서 전반에 걸친 에이전트의 조합적 추론을 평가하는 실행형 벤치마크인 VAKRA를 도입했습니다. 이를 통해 개별 도구 호출의 발전에도 불구하고 도구 사용 및 정책 준수 측면에서 상당한 격차가 있음을 밝혔습니다.
HCompany HoloTab 출시
HCompany은 Holo3 모델을 기반으로 하는 Chrome 확장 프로그램인 HoloTab을 출시했는데, 이는 사용자가 자연어 설명이나 기록된 루틴을 통해 웹 작업을 자동화할 수 있게 합니다.
Sentence Transformers v5.4: 멀티모달 임베딩 및 리랭커 모델
Sentence Transformers v5.4는 텍스트, 이미지, 오디오, 비디오의 인코딩 및 비교를 위한 멀티모달 임베딩 및 리랭커 모델을 도입합니다.
Waypoint-1.5 릴리스 노트
Hugging Face와 Overworld가 Waypoint-1.5를 출시했습니다. 이 실시간 비디오 세계 모델은 고품질 인터랙티브 생성 환경을 소비자 GPU에서 로컬로 실행할 수 있게 합니다.
Safetensors, PyTorch Foundation에 합류
Safetensors는 벤더 중립적인 거버넌스와 커뮤니티 주도 개발을 보장하기 위해 PyTorch Foundation 및 Linux Foundation 아래의 재단 호스팅 프로젝트로 전환되었습니다.
Gemma 4 출시: 온디바이스 지원을 갖춘 오픈 소스 멀티모달 모델
Google DeepMind의 새로운 오픈 소스 멀티모달 제품군인 Gemma 4가 이미지, 오디오, 비디오 지원, 최대 256K 컨텍스트, 그리고 transformers, llama.cpp, MLX, Rust, WebGPU와의 day-0 호환성을 갖추고 Hugging Face에 출시되었습니다.
Falcon Perception 및 Falcon OCR 출시
Hugging Face와 TII는 오픈 보카뷸러리 그라운딩을 위한 0.6B 파라미터 초기 융합 트랜스포머인 Falcon Perception과 고처리량 문서 이해를 위한 0.3B 파라미터 모델인 Falcon OCR을 소개합니다.
Gradio Server: 맞춤 프론트엔드를 Gradio 백엔드와 통합하기
Hugging Face는 `gradio.Server`라는 FastAPI 확장을 소개합니다. 이를 통해 개발자는 맞춤 프론트엔드 프레임워크를 자유롭게 사용하면서도 Gradio의 큐, API 인프라 및 ZeroGPU 지원을 그대로 유지할 수 있습니다.
Granite 4.0 3B Vision 릴리스 노트 / 새로운 기능
IBM은 엔터프라이즈 문서 이해를 위해 최적화된 소형 멀티모달 모델인 Granite 4.0 3B Vision을 출시했으며, 고정밀 테이블 추출, 차트 추론 및 키-값 쌍 추출 기능을 제공합니다.
OpenMed CodonRoBERTa 다중 종 mRNA 언어 모델 출시
OpenMed는 CodonRoBERTa-large-v2(당혹도 4.10, CAI 0.404)를 포함한 엔드‑투‑엔드 단백질 엔지니어링 파이프라인과 55 GPU‑시간(≈ $165)으로 학습된 25종 코돈 최적화 모델 스위트를 출시했습니다.
TRL v1.0 릴리스 노트 / 새로운 내용
Hugging Face가 75개 이상의 방법을 구현한 안정적인 포스트 트레이닝 라이브러리인 TRL v1.0을 출시했습니다. 이 라이브러리는 빠른 실험 반복과 프로덕션 수준의 신뢰성을 균형 있게 맞추는 이중 트랙 안정성 모델을 특징으로 합니다.
Hugging Face OpenClaw 마이그레이션 가이드
Hugging Face는 제한된 Claude 모델에서 오픈소스 대안으로 OpenClaw 에이전트를 마이그레이션하기 위해 Inference Providers와 로컬 llama.cpp 설정 두 가지 방법을 제공합니다.
음성 에이전트를 위한 EVA 엔드‑투‑엔드 평가 프레임워크
EVA는 정확도와 대화 경험을 동시에 평가하는 새로운 엔드‑투‑엔드 프레임워크로, 작업 성공과 사용자 만족 사이에 일관된 트레이드‑오프가 존재함을 밝혀냅니다.
NVIDIA Nemotron을 활용한 도메인 특화 임베딩 파인튜닝 – 하루 안에
NVIDIA와 Hugging Face는 단일 GPU, 하루 안에 완료되는 파이프라인을 공개했으며, Llama‑Nemotron‑Embed‑1B‑v2 모델을 합성 도메인 데이터로 파인튜닝하여 10% 이상의 검색 성능 향상과 실제 기업 데이터셋에서 최대 26% 개선을 달성했습니다.
Holotron-12B 고처리량 컴퓨터 사용 에이전트
H Company는 NVIDIA Nemotron-Nano-2 VL 기반의 멀티모달 컴퓨터 사용 모델인 Holotron-12B를 출시했으며, 하이브리드 SSM-Attention 아키텍처를 사용해 에이전트 작업에 대한 높은 추론 처리량을 달성합니다.
토큰 흐름을 유지하기: 16개의 오픈소스 RL 라이브러리에서 얻은 교훈
Hugging Face는 16개의 오픈소스 RL 라이브러리를 조사했으며, 비동기 RL 훈련이 추론과 훈련을 서로 다른 GPU 풀로 분리하고, 롤아웃 버퍼를 사용하며, 가중치를 비동기적으로 푸시한다는 점을 발견했으며, Ray가 오케스트레이션을 주도하고 NCCL 브로드캐스트가 일반적인 가중치‑동기화 방법이라는 사실을 확인했습니다.
Hugging Face 스토리지 버킷 출시
Hugging Face는 Xet을 기반으로 하는 가변적이며 S3와 유사한 객체 스토리지 시스템인 Storage Buckets를 도입하여 체크포인트와 처리된 데이터와 같은 중간 ML 아티팩트를 효율적으로 처리합니다.
백만 토큰 컨텍스트 학습을 위한 Ulysses 시퀀스 병렬 처리
Hugging Face는 Accelerate, Transformers, 그리고 TRL에 Ulysses 시퀀스 병렬 처리를 통합하여, 여러 GPU에 걸쳐 어텐션 연산을 분산함으로써 백만 토큰 컨텍스트를 가진 LLM 훈련을 가능하게 했습니다.
LeRobot v0.5.0 릴리스 노트 / 새로운 내용
Hugging Face는 LeRobot v0.5.0을 출시했으며, 전체 Unitree G1 인간형 지원, Pi0-FAST 및 Wall-X와 같은 새로운 VLA 정책, 그리고 데이터셋 성능 최적화를 도입했습니다.
로보틱스 AI를 임베디드 플랫폼으로 가져오기: 데이터셋 기록, VLA 파인튜닝, 그리고 온-디바이스 최적화
Hugging Face와 NXP는 Vision-Language-Action (VLA) 모델을 i.MX 95 SoC에 배포하기 위한 기술 가이드를 제공하며, 데이터셋 일관성, 아키텍처 분해, 비동기 추론을 강조하여 실시간 로봇 제어를 달성합니다.
Hugging Face Modular Diffusers 릴리스
Hugging Face는 재사용 가능한 블록을 혼합·매칭하여 전체 파이프라인을 처음부터 작성하지 않고도 확산 파이프라인을 구축할 수 있는 조합 가능한 프레임워크인 Modular Diffusers를 소개했습니다.
PRX 파트 3: 24시간 안에 텍스트-이미지 모델 훈련하기
Hugging Face와 Photoroom은 32개의 H200 GPU와 $1500 예산으로 24시간 안에 텍스트-이미지 모델을 훈련시켰으며, 픽셀 공간 훈련, 토큰 라우팅, 그리고 표현 정렬을 결합했습니다.
트랜스포머에서 전문가 혼합 (MoEs)
Hugging Face는 새로운 가중치 로딩 리팩터, 플러그인 가능한 전문가 백엔드, 그리고 네이티브 전문가 병렬성을 통해 Mixture of Experts (MoEs)를 일등 시민으로 만들기 위해 transformers 라이브러리를 재설계했습니다.
Unsloth와 Hugging Face Jobs로 AI 모델 훈련
Hugging Face는 Unsloth와 Hugging Face Jobs를 통합하여 빠르고 저비용의 LLM 파인튜닝을 가능하게 했으며, 특히 LiquidAI/LFM2.5-1.2B-Instruct와 같은 소형 모델에 최적화되었습니다.
GGML 및 llama.cpp, Hugging Face에 합류
GGML, llama.cpp의 제작자는 Hugging Face에 합류하여 로컬 AI 추론을 위한 지속 가능한 자원을 제공하고 Transformers 라이브러리와 로컬 모델 배포 간의 통합을 간소화합니다.
IBM과 UC Berkeley, IT-Bench와 MAST를 활용해 엔터프라이즈 에이전트 실패 진단
IBM Research와 UC Berkeley는 MAST(멀티에이전트 시스템 실패 분류법)를 도입해 엔터프라이즈 IT 에이전트가 실패하는 이유를 진단했으며, 최첨단 모델은 고립된 검증 오류를 겪는 반면 오픈 모델은 연쇄적인 시스템 붕괴를 겪는 것으로 밝혀졌습니다.