허깅 페이스 PyCharm 통합
허깅 페이스는 허브를 PyCharm Professional에 직접 통합하여, 개발자가 IDE를 떠나지 않고 머신러닝 모델을 발견, 삽입, 관리할 수 있도록 합니다.
Argilla 2.4 릴리즈 노트 / 새로운 내용
Argilla 2.4는 인간 피드백을 통해 파인튜닝 및 평가 데이터셋을 구축하기 위해 Hugging Face Hub 데이터셋을 가져오는 노코드 UI를 도입했습니다.
범용 보조 생성: 모든 어시스턴트 모델을 활용한 빠른 디코딩
Hugging Face와 Intel Labs는 Universal Assisted Generation (UAG)을 도입했습니다. 이 방법은 토크나이저와 무관하게 어떤 작은 모델이든 어시스턴트로 활용할 수 있게 하여 LLM 추론 속도를 1.5배~2.0배 가속화합니다.
Digital Green Farmer.chat: LLM-as-a-Judge로 RAG 강화
Digital Green은 Farmer.chat(리트리벌-증강 생성 기반 농업 챗봇)을 위해 LLM-as-a-judge 평가 프레임워크를 구현하여 RAG 정확성을 객관적으로 측정하고 34만 건의 질의에 걸쳐 모델 선택을 최적화했습니다.
Aya Expanse 출시: 다국어 LLM 성능 향상
Hugging Face와 Cohere For AI가 8B와 32B 오픈-웨이트 모델군인 Aya Expanse를 출시했으며, 이는 다국어 성능에 대한 새로운 최첨단 벤치마크를 설정했습니다.
HUGS 출시: 무구성, 하드웨어 최적화 추론을 위한 오픈 LLM
Hugging Face는 무구성, 하드웨어 최적화 추론 서비스인 HUGS를 출시했습니다. 이 서비스는 NVIDIA, AMD, 그리고 곧 AWS Inferentia와 Google TPU에서 실행되며, 기업이 OpenAI 호환 API를 통해 모델을 사내에 호스팅할 수 있게 합니다.
CinePile 2.0 릴리스: 적대적 정제가 비디오 QA 데이터셋 품질을 향상시킵니다
CinePile 2.0은 약한 QA 쌍을 시각‑종속 질문으로 업그레이드하는 적대적 정제 파이프라인을 도입하여 개선된 데이터셋과 전체 코드를 공개하고, 상업용 및 오픈소스 비디오‑LLM에서 상당한 성능 향상을 보여줍니다.
Transformers v4.46.0에서 SynthID Text 통합
Google DeepMind와 Hugging Face가 SynthID Text를 Transformers v4.46.0에 통합하여, AI 생성 텍스트에 눈에 띄지 않는 워터마크를 적용하고 훈련된 분류기로 탐지할 수 있는 방법을 제공했습니다.
Hugging Face Inference Endpoints에서 Speech-to-Speech 배포
Hugging Face는 높은 계산 요구량을 처리하고 지연 시간을 줄이기 위해 Inference Endpoints에서 커스텀 Docker 이미지를 사용해 Speech-to-Speech (S2S) 파이프라인을 배포하는 가이드를 제공합니다.
Outlines-core 0.1.0 릴리즈 노트 / 새로운 소식
Hugging Face와 dottxt가 구조화된 생성을 위한 Outlines 핵심 알고리즘을 Rust로 포팅한 `outlines-core` 0.1.0을 출시했으며, 인덱스 컴파일 속도와 이식성을 향상시켰습니다.
Stable Diffusion 3.5 Large와 Diffusers 통합
Hugging Face는 표준 및 타임스텝-디스틸 버전으로 제공되는 8B 파라미터 모델인 Stable Diffusion 3.5 Large를 Diffusers 라이브러리에 통합했습니다.
Hugging Face, Protect AI와 파트너십을 맺어 모델 보안을 위한 Guardian 스캐너를 추가
Hugging Face는 Protect AI와 파트너십을 맺어 Guardian 스캐너를 Hub에 통합했으며, 위험한 모델 직렬화 악용을 자동으로 감지하고 전체 ML 커뮤니티의 보안을 향상시킵니다.
Transformers.js v3 릴리스, WebGPU 가속, 확장된 모델 지원 및 서버‑사이드 JavaScript 호환성 추가
Transformers.js v3는 WebGPU 가속, 새로운 양자화 포맷, 120개의 모델 아키텍처 지원, 그리고 Node.js/Deno/Bun과의 호환성을 추가하여 브라우저와 JavaScript 런타임에서 빠른 온‑디바이스 추론을 가능하게 합니다.
Keras에서 Llama 3.2
Llama 3.2는 keras‑hub를 통해 Keras에서 완전히 지원되며, 사용자는 Hugging Face 체크포인트를 로드하고 모델을 JAX, PyTorch 또는 TensorFlow 백엔드에서 실행할 수 있습니다.
Hugging Face Transformers Gradient Accumulation 수정
Hugging Face는 Transformers Trainer를 업데이트하여 손실을 배치 간에 평균하는 방식을 수정함으로써 gradient accumulation이 전체 배치 학습과 수학적으로 동등하도록 보장했습니다.
Gradio 5 보안 검토
Hugging Face는 Trail of Bits와 함께 Gradio 5에 대한 포괄적인 보안 감사를 수행했으며, 식별된 모든 취약점을 수정하여 머신러닝 애플리케이션이 기본적으로 안전하도록 보장했습니다.
AMD EPYC Turin CPU가 Genoa 대비 2배 LLM 추론 처리량을 제공
AMD의 5세대 EPYC Turin CPU는 Genoa에 비해 LLM 추론 처리량을 대략 두 배로 제공하여 Hugging Face 작업에서 낮은 지연 시간과 높은 처리량을 가능하게 합니다.
Hugging Face와 Dask를 활용한 AI 데이터 처리 확장
Hugging Face와 Dask를 활용하면 분산 컴퓨팅과 멀티‑GPU 병렬 추론을 통해 작은 로컬 샘플에서 수억 행에 이르는 AI 기반 데이터 처리를 확장할 수 있습니다.
Gradio 5 릴리스 노트
Hugging Face는 Python을 사용해 성능이 뛰어나고 확장 가능하며 안전한 머신러닝 웹 애플리케이션을 구축할 수 있는 프로덕션 준비 프레임워크인 Gradio 5를 출시했습니다.
Hugging Face Transformers 4.45.0 동적 추측 디코딩
Hugging Face와 Intel Labs는 Transformers 4.45.0에 동적 추측 디코딩을 도입했으며, 모델 신뢰도에 따라 초안 토큰 수를 동적으로 조정함으로써 텍스트 생성 속도를 최대 2.7배 가속합니다.
Hugging Face Hub에서 Parquet 중복 제거 개선
Hugging Face는 저장소 아키텍처를 최적화하여 Parquet 파일 중복 제거를 개선하고, 데이터셋 업데이트 시 저장 오버헤드를 줄이기 위해 콘텐츠 기반 행 그룹을 제안하고 있습니다.
Open FinLLM 리더보드 출시 – 금융 언어 모델을 위한 포괄적인 제로샷 벤치마크
Hugging Face가 Open FinLLM Leaderboard를 출시했습니다. 이 제로샷 벤치마크는 7개 카테고리의 40개 금융 전용 과제를 포괄하여 LLM이 실제 금융 애플리케이션에 얼마나 준비되어 있는지를 평가합니다.
중국 AI 글로벌 확장 분석
중국 AI 기업들은 국내 시장 포화, 치열한 가격 전쟁, 규제 압박으로 인해 국제 확장을 가속화하고 있으며, 동남아시아, 중동, 서구 소비자 시장을 목표로 하고 있습니다.
BenCzechMark: 체코어 LLM을 위한 포괄적인 평가 스위트
Hugging Face와 학계 파트너가 체코어 모델을 위한 최초의 포괄적인 평가 스위트인 BenCzechMark를 출시했습니다. 9개 카테고리에 걸친 50개의 작업과 새로운 듀얼 기반 점수 메커니즘을 특징으로 합니다.
버텍스 색상 메쉬를 텍스처 메쉬로 변환하기
Hugging Face는 버텍스 색상이 있는 3D 메쉬를 UV 매핑된 텍스처 메쉬로 변환하여 애플리케이션 호환성을 향상시키는 방법과 InstantTexture 라이브러리를 소개합니다.
Llama 3.2 릴리스 노트: 멀티모달 비전 및 온-디바이스 소형 언어 모델
Meta는 Llama 3.2를 출시했으며, 11B와 90B 규모의 멀티모달 비전 기능과 온-디바이스 배포에 최적화된 경량 1B 및 3B 텍스트 전용 모델을 도입했습니다.
Hugging Face Daily Papers 기능 가이드
Hugging Face의 Daily Papers 페이지는 AI 연구를 위한 커뮤니티가 큐레이션한 허브를 제공하며, 저자 주장, 논문 제출, 연구자와 개발자 간 직접적인 상호작용을 위한 도구들을 특징으로 합니다.
FineVideo 데이터셋 릴리스
Hugging Face가 고품질 오픈 비디오 데이터셋인 FineVideo를 공개했습니다. 이 데이터셋은 43천 개의 비디오(3.4천 시간)를 포함하며, 비디오 이해 및 생성 AI 학습을 위한 풍부하고 구조화된 주석이 제공됩니다.
Optimum-Intel 및 OpenVINO GenAI를 사용한 Hugging Face 모델 최적화 및 배포
Hugging Face와 Intel은 Optimum-Intel 및 OpenVINO GenAI를 활용하여 Intel 하드웨어에서 Transformers 모델을 최적화하고 배포하는 간소화된 워크플로를 제공하며, 특히 엣지 및 클라이언트 측 C++와 Python 환경을 목표로 합니다.
LLM을 1.58비트로 파인튜닝: BitNet을 이용한 극단적인 양자화
Hugging Face는 Llama 3 8B와 같은 기존 LLM을 동적 워밍업 양자화 전략을 사용해 1.58비트 삼진 정밀도로 파인튜닝할 수 있음을 보여주며, 메모리와 에너지 요구량을 크게 줄이면서도 강력한 성능을 유지합니다.
Hugging Face 데이터셋용 SQL 콘솔
Hugging Face는 DuckDB WASM을 기반으로 하는 브라우저 기반 SQL 콘솔을 도입했으며, 이를 통해 사용자는 백엔드 의존성 없이 Hub에서 직접 데이터셋을 쿼리하고, 필터링하며, 변환할 수 있습니다.
HuggingChat 커뮤니티 도구 출시
Hugging Face는 HuggingChat에 커뮤니티 도구를 도입하여 사용자가 공개 Hugging Face Space를 LLM이 채팅 인터페이스 내에서 직접 사용할 수 있는 도구로 통합할 수 있게 했습니다.
Accelerate 1.0.0 릴리스 후보 발표
Accelerate 1.0.0 릴리스 후보는 FP8, DeepSpeed 멀티 모델, torch.compile, 그리고 새로운 데이터 로더/파이프라인 기능을 추가하면서 대규모 학습 및 추론을 위한 API를 안정화합니다.
Hugging Face와 TruffleHog의 비밀 스캔 파트너십
Hugging Face는 Truffle Security와 파트너십을 맺어 TruffleHog의 비밀 스캔 기능을 자동 파이프라인에 통합하고, 사용자가 자체 계정 데이터를 사전 스캔할 수 있는 네이티브 스캐너를 제공한다.
LeRobotDataset 비디오 인코딩 포맷이 로봇 데이터셋 크기를 줄이고 학습 속도를 높입니다
Hugging Face는 LeRobotDataset 비디오 인코딩 포맷을 출시하여 로봇 시각 데이터를 원본 크기의 약 14 %로 축소하면서 로딩 속도와 학습 성능을 유지합니다.
Hugging Face 블로그 게시물은 다섯 가지 저평가된 Hub 도구와 무료 의미 검색 사용 사례를 강조합니다
Hugging Face는 ZeroGPU, 멀티프로세스 Docker, Gradio API, 웹훅, Nomic Atlas 등 다섯 가지 저평가된 Hub 도구를 발표하고, 이를 결합해 Reddit 데이터를 위한 무료 자동 업데이트 의미 검색 앱을 만드는 방법을 보여주었습니다.
Hugging Face 훈련 효율성: Flash Attention 2와 패킹
Hugging Face는 지시 튜닝 예제에 대한 경계 인식 패킹을 도입했으며, Flash Attention 2와 함께 사용할 경우 훈련 처리량을 최대 2배 증가시키고 피크 메모리를 20% 감소시킵니다.
Google Cloud Vertex AI에서 Meta Llama 3.1 405B 배포
Hugging Face는 Text Generation Inference(TGI)와 A3 머신 시리즈를 사용하여 Google Cloud Vertex AI에 Meta Llama 3.1 405B의 FP8 양자화 버전을 프로그래밍 방식으로 배포하는 가이드를 제공합니다.
Hugging Face Infini-Attention 재현 분석
Hugging Face가 Infini-Attention을 재현하려는 시도에서, 게이팅 수렴을 개선할 수는 있지만 메모리 압축이 증가함에 따라 성능이 저하되고 Ring Attention, YaRN, RoPE 스케일링보다 신뢰성이 낮다는 것을 발견했습니다.
ggml 소개
ggml은 트랜스포머 추론 및 다양한 하드웨어 백엔드에서 온-디바이스 LLM 실행을 위해 최적화된 가벼운 C/C++ 머신러닝 라이브러리입니다.
Hugging Face 통합 도구 사용 API
Hugging Face는 Mistral, Cohere, NousResearch, Llama 모델 전반에 걸쳐 도구 호출을 구현하기 위해 동일한 코드를 사용할 수 있도록 하는 통합 도구 사용 API를 도입했습니다.
Falcon Mamba 7B 릴리스 노트
Technology Innovation Institute (TII)는 Falcon Mamba 7B를 출시했습니다. 이는 대규모 순수 상태 공간 언어 모델(SSLM) 최초로, 최첨단 트랜스포머 모델의 성능에 필적하면서 어텐션 기반 메모리 스케일링 문제를 제거합니다.
Hugging Face, Hub 스토리지 및 협업을 업그레이드하기 위해 XetHub 인수
Hugging Face는 Git LFS를 보다 효율적인 스토리지 백엔드로 교체하기 위해 XetHub를 인수했으며, 이를 통해 점진적 업데이트, 트릴리언 파라미터 모델 지원, 대규모 AI 데이터셋에 대한 협업을 개선합니다.
Hugging Face TextImage Augmentation 파이프라인 릴리스
Hugging Face와 Albumentations AI는 문서 이미지와 텍스트를 동시에 수정하는 TextImage Augmentation 파이프라인을 출시했으며, 이를 통해 제한된 문서 데이터셋에서 현실적인 합성 데이터 생성 및 비전‑언어 모델의 강력한 파인‑튜닝이 가능해졌습니다.
Hugging Face 2024 보안 기능 하이라이트
Hugging Face는 2024년 보안 환경을 상세히 설명하며, 모든 사용자를 위한 기본 보호 기능 세트와 엔터프라이즈 Hub 사용자를 위한 고급 거버넌스 제어를 도입했습니다.
Google이 Gemma 2 2B, ShieldGemma 및 Gemma Scope를 출시했습니다
Google은 Gemma 2 2B, ShieldGemma 안전 분류기, 그리고 Gemma Scope 희소 오토인코더를 출시하여 오픈소스 LLM 기능, 검열 도구 및 해석 가능성 리소스를 확장했습니다.
Quanto 양자화가 Transformer 확산 파이프라인의 메모리를 절감합니다
Hugging Face 양자화(Quanto)는 Transformer 확산 모델의 GPU 메모리를 약 12 GB에서 약 5 GB로 줄이며 지연 시간과 품질 영향을 최소화합니다.
Hugging Face NVIDIA NIM API (serverless) 출시 및 폐지
Hugging Face는 Enterprise Hub 사용자를 위해 NVIDIA DGX Cloud H100 GPU에서 오픈소스 LLM을 OpenAI 호환 API로 사용량 기반(pay‑as‑you‑go) 서버리스 추론할 수 있는 **NVIDIA NIM API (serverless)** 를 출시했습니다.
LAVE: LLM을 활용한 Docmatix의 제로샷 VQA 평가
Hugging Face는 전통적인 VQA 메트릭의 경직성을 해결하기 위해 LAVE(LLM‑Assisted VQA Evaluation)를 도입했으며, Docmatix 데이터셋에서 제로샷 성능을 평가할 때 50% 수준의 정확도 향상을 입증했습니다.
Llama 3.1 출시 노트: 다국어 지원, 긴 컨텍스트 및 405B 모델
Meta는 8B, 70B, 405B 크기의 모델, 128K 컨텍스트 길이, 8개 언어에 대한 다국어 지원 및 합성 데이터 생성을 허용하는 관대한 라이선스를 특징으로 하는 Llama 3.1을 출시했습니다.