DABStep: 데이터 에이전트 벤치마크: 다단계 추론
Hugging Face와 Adyen은 450개 이상의 실제 세계 데이터 분석 작업으로 구성된 DABStep 벤치마크를 도입했으며, 이는 현재 최첨단 AI 에이전트가 복잡한 추론 작업에서 16%의 정확도만을 달성한다는 것을 보여줍니다.
pi0와 pi0-FAST: 일반 로봇 제어를 위한 Vision-Language-Action 모델
Hugging Face는 Physical Intelligence가 개발한 범용 Vision-Language-Action(VLA) 모델인 pi0와 pi0-FAST를 LeRobot 저장소에 통합하여 다양한 로봇 형태에서 다재다능한 로봇 제어를 가능하게 했습니다.
Hugging Face Open-source DeepResearch
Hugging Face는 OpenAI의 Deep Research 기능을 재현하는 프레임워크를 오픈소스로 공개했으며, 코드네이티브 에이전트 접근 방식을 사용하여 GAIA 벤치마크에서 55.15% 점수를 달성했습니다.
Open-R1 업데이트 #1: DeepSeek-R1 훈련 및 합성 데이터 복제
Hugging Face는 Open-R1 프로젝트에 대한 첫 번째 진행 상황 업데이트를 제공하며, DeepSeek-R1 평가 점수 재현, TRL에 GRPO 통합, 그리고 합성 추론 데이터 생성 확대를 위한 전략을 상세히 설명합니다.
Hugging Face AI Tools for Art 뉴스레터 제1호
Hugging Face는 오픈 소스 크리에이티브 AI의 현황을 상세히 다루는 월간 뉴스레터를 출시했으며, 2024년 Diffusion Transformers로의 전환과 고품질 오픈 비디오 및 오디오 모델의 등장을 강조했습니다.
AWS에서 DeepSeek R1 모델을 배포하고 미세 조정하는 방법
Hugging Face는 Hugging Face Inference Endpoints, Amazon Bedrock Marketplace, Amazon SageMaker AI (GPU 및 Neuron 인스턴스), 그리고 Hugging Face Neuron Deep Learning AMI를 사용한 EC2 Neuron을 통해 AWS에서 DeepSeek R1 및 그 증류 변체들을 배포하고 미세 조정하는 방법을 보여줍니다.
Open-R1: DeepSeek-R1의 완전한 오픈 재생산
Hugging Face는 Open-R1 프로젝트를 출시하여 DeepSeek-R1의 데이터와 학습 파이프라인을 체계적으로 재구성하고, 오픈소스 커뮤니티에 추론 모델을 위한 누락된 데이터셋과 코드를 제공하려고 합니다.
Hugging Face 인퍼런스 프로바이더 통합
허깅 페이스는 fal, Replicate, SambaNova, 그리고 Together AI 네 가지 서버리스 인퍼런스 프로바이더를 허브에 직접 통합하여 통합된 모델 중심 서버리스 인퍼런스를 제공합니다.
Diffusers에서의 오픈 비디오 생성 모델 현황
Hugging Face는 오픈 비디오 생성 모델에 대한 포괄적인 개요를 제공하고, HunyuanVideo와 같은 모델의 VRAM 요구 사항을 60GB에서 약 6.5GB로 줄일 수 있는 Diffusers 최적화 스위트를 소개합니다.
smolagents Vision 지원 업데이트
Hugging Face가 smolagents에 네이티브 비전 지원을 추가하여, 자율 웹 브라우징과 같은 작업에 시각 언어 모델(VLMs)을 에이전트 파이프라인에서 사용할 수 있게 되었습니다.
NVIDIA KVPress: Long-Context LLM에서의 KV 캐시 압축을 위한 툴킷
NVIDIA는 메모리 사용량을 줄이고 장문 컨텍스트 Large Language Models의 디코딩 속도를 높이는 최신 KV 캐시 압축 기술을 구현한 Python 툴킷인 KVPress를 출시했습니다.
SmolVLM 256M 및 500M 릴리스 노트
Hugging Face가 대폭 줄어든 파라미터 크기 내에서도 강력한 멀티모달 성능을 유지하는 고효율 Vision Language Model인 SmolVLM-256M 및 SmolVLM-500M를 선보입니다.
Hugging Face와 FriendliAI의 모델 배포 파트너십
Hugging Face는 FriendliAI의 추론 인프라를 Hugging Face Hub에 통합하여, 고성능 엔드포인트로 생성형 AI 모델을 원클릭 배포할 수 있게 했습니다.
Hugging Face Organization Blog Articles Feature
Hugging Face는 이제 Enterprise Hub를 구독하는 조직이 자신의 조직 프로필에 블로그 기사를 직접 게시할 수 있도록 지원합니다.
Hugging Face Text Generation Inference (TGI) 멀티 백엔드 지원
Hugging Face는 Text Generation Inference (TGI)에 멀티 백엔드 아키텍처를 도입하여, 사용자가 통합된 프론트엔드를 통해 다양한 실행 엔진(예: TensorRT-LLM 및 vLLM)을 이용해 LLM을 배포할 수 있도록 했습니다.
Hugging Face Transformers timm 통합
Hugging Face가 TimmWrapper를 도입하여 PyTorch Image Models (timm) 라이브러리의 모든 모델을 추론, 양자화 및 미세 조정을 위해 transformers 생태계 내에서 원활하게 사용할 수 있도록 했습니다.
Sentence Transformers를 사용하여 400배 더 빠른 정적 임베딩 모델 학습하기
Hugging Face는 all-mpnet-base-v2와 같은 모델 품질의 최소 85%를 유지하면서 CPU에서 100배~400배 더 빠르게 실행되는 정적 임베딩 모델 학습 방법을 소개하며, 학습 스크립트 및 평가 결과와 함께 두 가지 모델(static-retrieval-mrl-en-v1 및 static-similarity-mrl-multilingual-v1)을 공개했습니다.
허깅 페이스 AI 에이전트 윤리 및 프레임워크 분석
허깅 페이스는 AI 에이전트를 이해하기 위한 포괄적인 프레임워크를 제공하며, 자율성이 높아질수록 위험이 증가한다고 주장하고 완전 자율 에이전트 개발에 반대한다.
Hugging Face가 vdr-2b-multi-v1 다국어 시각적 문서 검색 모델을 출시했습니다
Hugging Face는 OCR 없이 페이지 스크린샷을 밀집 벡터로 인코딩하여 복잡한 문서를 검색할 수 있게 하는 다국어 임베딩 모델인 vdr-2b-multi-v1을 도입했습니다.
Hugging Face Open LLM Leaderboard: CO₂ 배출량 및 모델 성능 분석
Hugging Face는 커뮤니티 파인튜닝 모델이 공식 출시물보다 탄소 효율성이 더 높다고 밝혔으며, 이는 간결성 증가와 지시 사항 준수 개선 때문이라고 설명했습니다.
Hugging Face smolagents 출시
Hugging Face는 smolagents를 출시했는데, 이는 JSON 대신 실행 가능한 코드로 행동을 작성함으로써 LLM이 복잡한 작업을 수행할 수 있게 하는 경량 라이브러리로, 구성성과 범용성을 향상시킵니다.
PyTorch에서 GPU 메모리 시각화 및 이해하기 – Hugging Face 블로그 요약
Hugging Face의 블로그 포스트는 torch.cuda.memory 도구를 사용하여 PyTorch에서 GPU 메모리 사용량을 시각화하는 방법을 설명하고, 모델 훈련 중 메모리 구성 요소를 분석하며, 총 메모리 요구사항을 추정하기 위한 공식을 제공합니다.
NVIDIA LogitsProcessorZoo: 모듈러 로짓 프로세서를 사용한 언어 모델 생성 제어
NVIDIA's LogitsProcessorZoo는 Hugging Face Transformers용 모듈러 로짓 프로세서를 제공하여 개발자가 생성 길이를 제어하고, 문구 포함을 강제하며, 프롬프트 콘텐츠를 인용하고, 출력을 다중 선택 옵션으로 제한할 수 있게 합니다.
Big Bench Audio 출시
Artificial Analysis는 음성 언어 모델의 추론 능력을 평가하기 위해 설계된 1,000개의 음성 질문으로 구성된 데이터셋인 Big Bench Audio를 공개했으며, 텍스트와 음성 추론 사이의 상당한 성능 격차를 드러냈습니다.
ModernBERT 릴리스 노트
Hugging Face, Answer.AI, LightOn은 BERT의 속도, 정확도 및 문맥 길이를 8,192 토큰까지 개선한 최첨단 인코더 전용 모델 제품군인 ModernBERT를 출시했습니다.
Bamba-9B: 추론 효율적인 하이브리드 Mamba2 모델
Bamba-9B는 IBM, Princeton, CMU, UIUC가 2.2조 개의 공개 토큰으로 학습한 하이브리드 Mamba2 모델로, vLLM에서 Llama 3.1 8B 대비 2.5배 높은 처리량과 2배 낮은 지연 시간을 달성하고, transformers, vLLM, TRL, llama.cpp에서 즉시 사용할 수 있습니다.
GCP에서 5세대 Xeon에서의 언어 모델 성능 벤치마크
Hugging Face는 Google Cloud의 C4(5세대 Xeon)와 N2(3세대 Xeon) 인스턴스에서 텍스트 임베딩 및 생성 벤치마크를 수행했으며, C4가 임베딩 처리량에서 10‑24배 높고 생성 처리량에서 2.3‑3.6배 높은 결과를 보여주어 각각 총 소유 비용(TCO) 장점이 7‑19배 및 1.7‑2.9배임을 확인했습니다.
Falcon 3 릴리스 노트 / 새로운 기능
Technology Innovation Institute (TII)가 높은 효율성과 강화된 과학, 수학, 코딩 능력을 갖추도록 설계된 100억 파라미터 미만의 디코더 전용 대규모 언어 모델 제품군인 Falcon 3를 출시했습니다.
Hugging Face Synthetic Data Generator
Hugging Face는 사용자가 자연어 프롬프트를 사용하여 맞춤형 텍스트 분류 및 채팅 데이터셋을 생성할 수 있는 노코드 애플리케이션인 Synthetic Data Generator를 선보였습니다.
LeMaterial v1.0: LeMat-Bulk 데이터셋 출시
LeMaterial v1.0은 Materials Project, Alexandria, OQMD의 670만 개 항목을 7가지 속성을 가진 표준화된 형식으로 통합하여 재료 발견을 가속화하는 오픈 소스 이니셔티브인 LeMat-Bulk 데이터셋 출시와 함께 시작됩니다.
허깅 페이스 오픈 선호 데이터셋 텍스트-이미지 생성
Data is Better Together 커뮤니티는 모델 정렬을 위한 오픈소스 선호 데이터 부족 문제를 해결하기 위해 텍스트-이미지 생성을 위한 Apache 2.0 라이선스 오픈 선호 데이터셋을 출시했습니다.
허깅페이스 모델이 아마존 베드록 마켓플레이스에 제공됨
허깅페이스는 아마존 베드록 마켓플레이스에 83개의 오픈 모델을 통합하여 AWS 고객이 관리형 인프라에서 오픈 모델을 배포하면서 베드록 API와의 호환성을 유지할 수 있도록 했습니다.
PaliGemma 2 릴리스 노트
Google은 PaliGemma 2를 출시했습니다. 이는 세 가지 매개변수 크기와 여러 입력 해상도에 걸쳐 SigLIP 이미지 인코더와 Gemma 2 텍스트 디코더를 결합한 비전 언어 모델 가족입니다.
LLM은 자신의 실수를 얼마나 잘 수정할까? Keras와 TPU를 이용한 챗봇 아레나 실험
Hugging Face는 여러 10B 미만의 LLM을 대상으로 간단한 캘린더 API 작업 테스트를 진행했으며, Gemma 2 9B는 최소한의 프롬프트로 실수를 일관되게 수정한 반면, 더 작은 모델과 구형 모델은 어려움을 겪거나 많은 교정 턴이 필요하다는 것을 발견했습니다.
AraGen 벤치마크 및 리더보드: 아랍어 LLM을 위한 3C3H 평가 도입
Hugging Face는 아랍어 LLM의 정확성, 완전성, 간결성, 도움이 됨, 솔직함, 무해함을 평가하는 3C3H 측정을 사용하는 동적 벤치마크 및 리더보드인 AraGen을 도입했습니다.
Hugging Face CFM 사례 연구: LLM 인사이트를 활용한 소형 모델 파인튜닝
Capital Fund Management (CFM)는 Llama 3.1을 사용하여 GLiNER와 SpanMarker와 같은 소형 모델의 파인튜닝을 위한 데이터 라벨링을 지원함으로써 금융 Named Entity Recognition(NER)의 정확도를 최대 6.4% 향상시키고 추론 비용을 최대 80배 줄였습니다.
오픈소스 개발자를 위한 EU AI 법 가이드
허깅 페이스 가이드는 EU AI 법이 오픈소스 AI 개발자에게 어떻게 적용되는지 설명하며, 제한된 위험 AI 시스템과 비시스템적 위험 범용 AI 모델에 대한 의무를 정리하고 준수를 위한 도구를 제시합니다.
허깅페이스 허브 스토리지 재아키텍처
허깅페이스는 콘텐츠 주소 저장소(CAS)를 도입하여 바이트 수준 중복 제거를 가능하게 하고巨大한 AI 모델의 전송 속도를 향상시키기 위해 업로드 및 다운로드 아키텍처를 재설계하고 있습니다.
SmolVLM 출시 노트 / 새로운 기능
Hugging Face는 낮은 메모리 점유율과 엣지 디바이스에서의 높은 처리량에 최적화된, 완전한 오픈 소스인 2B 파라미터 Vision Language Model (VLM) SmolVLM을 선보입니다.
당신은 최첨단 위치 인코딩을 설계할 수 있었을 것입니다
허깅 페이스 블로그 글은 트랜스포머를 위한 위치 인코딩의 반복적 설계를 안내하며, sinusoidal 인코딩이 어떻게 Rotary Positional Encoding (RoPE)로 이어지는지 보여주고, 이것이 토큰 관계 모델링에 왜 중요한지 설명합니다.
Hugging Face와 LLM-jp, 오픈 일본어 LLM 리더보드 출시
Hugging Face와 LLM-jp가 투명한 평가 플랫폼인 Open Japanese LLM Leaderboard를 도입했습니다. 이 플랫폼은 20개가 넘는 데이터셋을 통해 일본어 대형 언어 모델의 성능을 벤치마킹합니다.
Hugging Face가 저장 효율을 높이기 위해 콘텐츠 정의 청킹을 도입합니다
Hugging Face는 Xet 팀을 통해 콘텐츠 정의 청킹 저장 방식을 발표했으며, 이는 수정된 청크만 업로드하여 대용량 모델 및 데이터셋 파일의 저장 및 전송 비용을 줄입니다.
자체 추측 디코딩을 통한 더 빠른 텍스트 생성
Hugging Face는 LayerSkip을 통해 자체 추측 디코딩을 소개합니다. 이는 단일 LLM의 초기 레이어를 초안 작성에 사용하고 posteriores 레이어를 검증에 사용하여 생성 속도를 높이고 메모리 오버헤드를 줄이는 방법입니다.
FlagEval Debate: 새로운 다국어 LLM 평가 프레임워크
BAAI는 다국어 토론에서 LLMs가 경쟁하여 추론, 논리 및 적대적 능력을 더 잘 평가할 수 있도록 하는 동적 평가 플랫폼인 FlagEval Debate를 출시했습니다.
Hugging Face Judge Arena: LLM을 평가자로 벤치마킹하기
Hugging Face는 다른 AI 생성 응답을 채점하는 평가자로서 어떤 LLM이 가장 효과적인지 결정하기 위해 사용자 투표를 사용하는 크라우드소싱 플랫폼인 Judge Arena를 출시했습니다.
연구자를 위한 Hugging Face Hub 데이터셋 공유
Hugging Face Hub는 탐색, 보안 및 커뮤니티 참여를 위한 통합 도구와 함께 대규모 ML 데이터셋을 호스팅하고 공유할 수 있는 포괄적인 플랫폼을 제공합니다.
허깅 페이스 PyCharm 통합
허깅 페이스는 허브를 PyCharm Professional에 직접 통합하여, 개발자가 IDE를 떠나지 않고 머신러닝 모델을 발견, 삽입, 관리할 수 있도록 합니다.
Argilla 2.4 릴리즈 노트 / 새로운 내용
Argilla 2.4는 인간 피드백을 통해 파인튜닝 및 평가 데이터셋을 구축하기 위해 Hugging Face Hub 데이터셋을 가져오는 노코드 UI를 도입했습니다.
범용 보조 생성: 모든 어시스턴트 모델을 활용한 빠른 디코딩
Hugging Face와 Intel Labs는 Universal Assisted Generation (UAG)을 도입했습니다. 이 방법은 토크나이저와 무관하게 어떤 작은 모델이든 어시스턴트로 활용할 수 있게 하여 LLM 추론 속도를 1.5배~2.0배 가속화합니다.
Digital Green Farmer.chat: LLM-as-a-Judge로 RAG 강화
Digital Green은 Farmer.chat(리트리벌-증강 생성 기반 농업 챗봇)을 위해 LLM-as-a-judge 평가 프레임워크를 구현하여 RAG 정확성을 객관적으로 측정하고 34만 건의 질의에 걸쳐 모델 선택을 최적화했습니다.