501

Optimum Intel으로 Intel Xeon에서 StarCoder 가속

Hugging Face와 Intel은 8비트 양자화와 보조 생성을 결합하여 4세대 Intel Xeon 프로세서에서 StarCoder-15B 모델에 대해 7배 이상의 추론 가속을 보여줍니다.

502

Hugging Face 환각 리더보드 출시 및 초기 결과

Hugging Face는 사실성 및 충실도 오류에 대한 LLM을 벤치마크하기 위해 여러 오픈소스 데이터셋을 활용한 Hallucinations Leaderboard를 출시했으며, 투명한 순위를 제공하여 모델 선택 및 연구를 안내합니다.

503

AI 보안 LLM 안전 리더보드

Hugging Face와 Secure Learning Lab은 DecodingTrust 프레임워크를 기반으로 LLM 안전 리더보드를 출시했으며, 이는 8가지 핵심 안전 차원에서 LLM의 신뢰성을 평가합니다.

504

Hugging Face와 Google Cloud 전략적 파트너십

Hugging Face와 Google Cloud가 전략적 파트너십을 맺어 오픈 모델을 Google Cloud의 AI 인프라와 하드웨어와 통합함으로써 머신러닝을 민주화합니다.

505

오픈소스 LLM을 LangChain 에이전트로 활용

Hugging Face는 오픈소스 LLM, 특히 Mixtral-8x7B가 이제 에이전트 워크플로우를 구동할 수 있을 정도로 성능이 향상되었으며, 일반 목적 추론 작업에서 GPT-3.5를 능가할 수 있음을 보여줍니다.

506

저자원 ASR을 위한 Wav2Vec2‑BERT 파인튜닝

Hugging Face는 Meta의 Wav2Vec2‑BERT 모델을 저자원 언어의 자동 음성 인식(ASR)용으로 파인튜닝하는 방법을 보여주며, Whisper‑large‑v3와 비슷한 성능을 달성하면서도 훨씬 빠르고 자원 효율이 높다는 점을 입증합니다.

507

PatchTSMixer가 Hugging Face Transformers에 추가되었습니다 – 릴리스 및 빠른 시작 가이드

PatchTSMixer는 IBM Research에서 개발한 경량 MLP‑Mixer 시계열 모델로, 이제 Hugging Face Transformers에 출시되어 훨씬 낮은 메모리와 실행 시간 비용으로 최첨단 예측을 제공합니다.

508

직접 선호 최적화 방법을 통한 LLM 선호 튜닝 – DPO, IPO, KTO의 실증 비교

Hugging Face는 두 개의 7B 챗 모델에 DPO, IPO, KTO 정렬 방법을 평가했으며, β 하이퍼파라미터를 적절히 조정하면 DPO가 일관되게 다른 방법보다 우수함을 보여주었습니다.

509

ONNX Runtime와 Olive를 사용한 SD Turbo 및 SDXL Turbo 추론 가속

Hugging Face와 Microsoft는 ONNX Runtime와 Olive를 사용한 최적화를 도입하여 PyTorch에 비해 SDXL Turbo는 최대 229%, SD Turbo는 120%까지 처리량을 향상시켰습니다.

510

Gradio를 사용하여 Hugging Face Spaces에서 ComfyUI 워크플로 실행하기

Hugging Face는 복잡한 ComfyUI 워크플로를 Gradio 애플리케이션으로 변환하여 Hugging Face Spaces ZeroGPU에서 무료 서버리스 배포하는 방법을 안내합니다.

511

Hugging Face 리더보드 템플릿: Vectara HHEM 리더보드 구현

Hugging Face는 개발자들이 동적인 LLM 평가 보드를 구축할 수 있도록 하는 오픈소스 리더보드 템플릿을 공개했으며, 이는 Vectara의 새로운 Hughes Hallucination Evaluation Model (HHEM) 리더보드에서 입증되었습니다.

512

Unsloth과 Hugging Face TRL 통합으로 더 빠른 LLM 파인튜닝

Unsloth은 LLM 파인튜닝 속도를 최대 2.7배 높이고 메모리 사용량을 최대 74% 줄이며 QLoRA 대비 0% 정확도 저하를 달성하는 경량 라이브러리입니다.

513

aMUSEd: 효율적인 텍스트-이미지 생성

Hugging Face가 Masked Image Modeling (MIM)을 기반으로 하고 Google의 MUSE를 오픈 재현한 효율적인 비확산 텍스트-이미지 모델 aMUSEd를 출시했습니다.

514

Hugging Face SDXL Dreambooth LoRA 고급 훈련 가이드

Hugging Face는 SDXL Dreambooth LoRA용 고급 훈련 스크립트를 소개하며, Pivotal Tuning과 Prodigy 옵티마이저를 결합해 개념 캡처와 이미지 품질을 향상시킵니다.

515

추측 디코딩으로 Whisper 추론 속도 2배 향상

Hugging Face는 추측 디코딩을 적용하면 Whisper 전사 지연 시간이 절반으로 줄어들면서도 출력과 정확도가 동일하게 유지된다고 입증했습니다.

516

2023년 오픈 LLM 리뷰

Hugging Face의 2023년 요약은 오픈소스 LLM 출시가 급증하고, 성능이 뛰어난 소형 모델과 새로운 파인튜닝 기법이 등장하여 접근성과 커뮤니티 참여를 크게 확대했음을 보여줍니다.

517

전문가 혼합(MoE) 설명

전문가 혼합(MoE)은 트랜스포머 모델이 매 토큰마다 신경망 전문가의 일부만 활성화함으로써 파라미터를 확장하면서도 효율적인 사전 학습과 더 빠른 추론을 유지하도록 합니다.

518

Mixtral 8x7B 릴리즈 노트

Mistral AI는 Mixtral 8x7B를 출시했습니다. 이 Mixture of Experts(MoE) 모델은 Llama 2 70B를 능가하고 대부분의 벤치마크에서 GPT-3.5와 동등한 성능을 보이며 Apache 2.0 하에 상업적으로 허용됩니다.

519

SetFitABSA: 소수 샷 기반 측면 감정 분석

Hugging Face와 Intel Labs는 SetFitABSA를 소개했습니다. 이는 프롬프트가 필요 없는 소수 샷 기반 측면 감정 분석 프레임워크로, 데이터가 적은 상황에서 Llama 2와 T5와 같은 대형 생성 모델보다 뛰어난 성능을 보입니다.

520

Optimum-NVIDIA 릴리즈 노트

Hugging Face는 FP8 양자화와 TensorRT-LLM을 사용하여 NVIDIA 플랫폼에서 LLM 추론을 최대 28배 가속하는 추론 라이브러리 Optimum-NVIDIA를 출시했습니다.

521

Hugging Face LoRA 동적 로딩으로 추론 속도 300% 향상 및 지연 시간 감소

Hugging Face는 워밍‑업 시간을 25 초에서 3 초로 줄이고, LoRA 추론을 최대 300 % 빠르게 만들며 전체 응답 시간을 35 초에서 13 초로 단축하는 동적 LoRA 로딩 시스템을 발표했습니다.

522

허깅 페이스와 AMD GPU 가속 for LLMs

허깅 페이스와 AMD는 Transformers 라이브러리와 Text Generation Inference에 AMD Instinct GPU에 대한 기본 제공 지원을 통합하여, 코드 변경 없이 고성능 LLM 실행을 가능하게 했습니다.

523

Hugging Face Open LLM Leaderboard DROP 벤치마크 분석

Hugging Face는 정규화와 종료 토큰 설정의 결함으로 대부분의 모델이 잘못 낮은 점수를 받게 된 것을 발견한 후, DROP 벤치마크를 Open LLM Leaderboard에서 제거했습니다.

524

SDXL과 Stable Diffusion을 위한 Latent Consistency LoRAs 기반 빠른 추론

Hugging Face는 SDXL과 Stable Diffusion 모델에서 4~8 단계로 고품질 이미지 생성을 가능하게 하는 LCM LoRAs라는 방법을 도입하여 추론 시간을 크게 줄였습니다.

525

Prodigy-HF 통합 릴리스 노트

Explosion은 주석이 달린 데이터에서 Hugging Face 트랜스포머 모델을 직접 미세 조정하고 Hugging Face Hub에 데이터셋을 직접 업로드할 수 있는 플러그인인 Prodigy-HF를 출시했습니다.

526

optimum-neuron을 사용하여 AWS Inferentia2에서 Llama 2 배포하기

Hugging Face는 optimum-neuron과 AWS Neuron SDK를 통합하여 AWS Inferentia2 가속기에서 Llama 2 모델을 배포하여 고성능 텍스트 생성을 가능하게 했습니다.

527

LoRA를 사용한 재난 트윗 분류에서 RoBERTa, Llama 2, Mistral 비교

비교 연구에서 LoRA를 사용한 미세 조정을 통해 더 작은 RoBERTa 모델이 재난 트윗의 이진 분류에서 Llama 2와 Mistral 7B보다 성능이 우수함을 보여준다.

528

Hugging Face 허브 스토리지 지역

허깅 페이스는 Enterprise Hub 고객을 위해 Storage Regions을 도입하여, 조직이 모델과 데이터셋을 저장할 위치를 선택하여 규제 준수 및 데이터 전송 성능을 향상시킬 수 있도록 했습니다.

529

개인용 코파일럿: 나만의 코딩 어시스턴트 훈련하기

Hugging Face는 특정 코드베이스에 StarCoder를 QLoRA와 전체 미세 조정 기법을 사용하여 미세 조정함으로써 맞춤형 코딩 어시스턴트인 HugCoder를 만드는 방법을 보여줍니다.

530

확장 가능한 데이터 검사를 위한 Hugging Face와 Renumics Spotlight 통합

Hugging Face는 Renumics Spotlight와 통합하여 ML 데이터셋의 인터랙티브한 한 줄 코드 시각화 및 검사를 가능하게 했으며, 멀티모달 데이터와 모델 결과도 지원합니다.

531

추론 속도 및 메모리 최적화를 위한 Stable Diffusion XL (SDXL) 최적화

Hugging Face는 Stable Diffusion XL (SDXL)을 위한 여러 최적화 기술을 탐구하며, 메모리 사용량을 28GB에서 최소 11.47GB까지 줄이고 추론 지연 시간을 72.2초에서 약 10.3초까지 단축하는 방법을 보여줍니다.

532

허깅페이스 인퍼런스 엔드포인트로 임베딩 모델 배포하기

허깅페이스는 인퍼런스 엔드포인트를 통해 Text Embeddings Inference(TEI)를 도입하여 RAG 및 의미 검색을 위한 오픈소스 임베딩 모델을 고성능かつ 비용 효율적으로 배포할 수 있는 방법을 제공합니다.

533

RLHF와 PPO의 N 구현 세부 사항 – Hugging Face 블로그 요약

Hugging Face 블로그 글은 OpenAI의 2019 RLHF 코드베이스를 재현하고, 학습 곡선을 일치시키며, N가지 구현 세부 사항을 설명합니다. 여기에는 더 공격적인 업데이트를 초래하는 핵심 PyTorch Adam 옵티마이저 차이도 포함됩니다.

534

Gradio-Lite: 브라우저 내에서 완전히 실행되는 서버리스 Gradio

Hugging Face는 웹 브라우저에서 직접 Gradio 애플리케이션을 실행하여 서버 측 인프라의 필요성을 제거하는 Pyodide를 사용하는 JavaScript 라이브러리인 Gradio-Lite (@gradio/lite)를 소개합니다.

535

ONNX Runtime을 사용한 Hugging Face 모델 가속화

Hugging Face와 ONNX Runtime은 130,000개 이상의 모델에 대한 성능 가속을 가능하게 하며, PyTorch와 비교하여 whisper-tiny 모델의 지연 시간이 최대 74.30% 감소하는 것을 포함합니다.

536

Hugging Face Chat Templates

Hugging Face는 채팅 모델이 학습 시와 정확히 일치하는 형식으로 입력을 받아 성능 저하가 발생하는 것을 방지하기 위해 Jinja 기반 시스템인 채팅 템플릿을 도입했습니다.

537

Cloud TPU v5e에서 JAX를 사용하여 Stable Diffusion XL 추론 가속화하기

Hugging Face Diffusers는 이제 Cloud TPU v5e에서 JAX를 사용하여 Stable Diffusion XL (SDXL)을 서빙하는 기능을 지원하며, 이는 TPU v4 대비 달러당 성능을 최대 2.4배 향상시킵니다.

538

Hugging Face Inference API를 통해 AI Comic Factory 배포하기

Hugging Face는 Inference API를 사용하여 AI Comic Factory의 개인 인스턴스를 배포하는 가이드를 제공하며, Llama-2 및 SDXL 1.0 모델을 활용합니다.

539

TRL을 통한 DDPO를 이용한 Stable Diffusion 파인튜닝

Hugging Face는 TRL 라이브러리에 Denoising Diffusion Policy Optimization(DDPO)를 통합하여 강화 학습을 사용하여 Stable Diffusion 모델을 인간 선호도에 맞출 수 있게 했습니다.

540

허깅 페이스 윤리와 사회 업데이트 여름 2023

허깅 페이스는 미국, EU, 영국에서 AI 규제에 영향을 미치기 위한 2023 여름 노력을 상세히 설명했으며, 공공 옹호와 기술 연구를 통해 오픈소스 윤리를 발전시켰습니다.

541

Hugging Face 가이드: 코드 없이 LLaMA 2 챗봇 훈련하기

Hugging Face는 Spaces, AutoTrain, ChatUI를 사용하는 노코드 워크플로를 제공하여 엔지니어가 아닌 사람들도 LLaMA 2를 미세 조정하고 기능적인 챗 애플리케이션으로 배포할 수 있도록 합니다.

542

Amazon SageMaker에서의 Llama 2 벤치마크

Hugging Face는 Amazon SageMaker에서의 Llama 2에 대해 60개의 배포 구성을 분석하여 비용, 처리량, 지연 시간에 대한 최적의 설정을 식별했습니다.

543

허깅 페이스 PROs용 추론

허깅 페이스는 PRO 사용자를 위한 Inference를 도입하여, 선별된 최첨단 모델에 대한 가속화된 API 엔드포인트와 무료 Inference API의 증가된 속도 제한을 제공합니다.

544

Rocket Money x Hugging Face: 프로덕션에서 변동성이 큰 ML 모델 확장

Rocket Money는 Hugging Face의 Inference API를 사용하여 레거시 regex 기반 시스템을 대체하고 월간 10억 건 이상의 거래를 처리하도록 거래 분류 시스템을 확장했습니다.

545

3D 가우시안 스플래팅 소개

3D 가우시안 스플래팅은 소수의 이미지에서 학습된 포토리얼리스틱 3D 장면을 실시간으로 렌더링할 수 있는 래스터화 기술입니다.

546

Hugging Face 객체 감지 리더보드

허깅 페이스는 COCO 스타일 메트릭스를 사용해 오픈소스 모델을 순위 매기는 객체 감지 리더보드를 출시하고, 평균 정밀도와 평균 재현율이 어떻게 계산되는지 및 결과에 영향을 줄 수 있는 요인을 설명하는 블로그를 게시했습니다.

547

프로덕션 환경에서의 LLM 최적화: 정밀도, 어텐션 및 아키텍처

Hugging Face는 저정밀도 양자화, 메모리 효율성을 위한 Flash Attention, 그리고 RoPE, ALiBi, MQA, GQA와 같은 아키텍처 최적화에 초점을 맞춘 효율적인 LLM 배포를 위한 핵심 기술들을 설명합니다.

548

PyTorch FSDP를 사용한 Llama 2 70B 파인튜닝

Hugging Face는 CPU RAM 병목 현상을 극복하고 VRAM 사용량을 최적화하기 위해 PyTorch Fully Sharded Data Parallelism (FSDP) 및 Accelerate를 사용하여 Llama 2 70B를 파인튜닝하는 방법을 보여줍니다.

549

Würstchen 소개: 이미지 생성을 위한 빠른 확산

Würstchen은 42x 공간 압축을 달성하여 훈련 및 추론 비용을 크게 줄이는 빠르고 효율적인 텍스트-이미지 확산 모델입니다.

550

Hugging Face Transformers 양자화 개요

Hugging Face는 소형 장치에서 대규모 모델 추론을 가능하게 하고 효율적인 어댑터 미세 조정을 지원하기 위해 bitsandbytes 및 auto-gptq 양자화 방식을 기본적으로 지원합니다.