VinAIResearch/PhoBERT

PhoBERT: Pre-trained language models for Vietnamese (EMNLP-2020 Findings)

해결하는 문제

PhoBERT는 베트남어 텍스트를 이해하는 데 있어 이전의 단언어 및 다언어 모델의 한계를 극복하기 위해 고성능의 사전 훈련된 언어 모델을 베트남어 전용으로 설계했습니다.

작동 방식

BERT 사전 훈련 절차를 최적화하기 위해 RoBERTa 기반 아키텍처를 사용합니다. 모델은 위키백과 및 뉴스 텍스트를 포함한 대규모 베트남어 코퍼스에서 훈련되었습니다. 정확성을 보장하기 위해 모델이 처리하기 전에 입력 텍스트는 단어 분할(예: VnCoreNLP 도구 사용)이 필요합니다.

대상 사용자

품사 태깅, 의존성 파싱, 명명된 엔티티 인식, 자연어 추론과 같은 베트남어 전용 애플리케이션을 개발하는 NLP 연구자 및 개발자에게 적합합니다.

주요 특징

  • 135M에서 370M 사이의 파라미터를 가진 "base" 및 "large" 버전 제공.
  • 여러 하류 베트남어 NLP 작업에서 이전의 단언어 및 다언어 접근 방식을 능가합니다.
  • Hugging Face transformers 라이브러리 및 fairseq와 호환됩니다.
  • v2 base 모델에서는 최대 140GB의 베트남어 텍스트로 사전 훈련되었습니다.

관련