VinAIResearch/PhoBERT
PhoBERT: Pre-trained language models for Vietnamese (EMNLP-2020 Findings)
해결하는 문제
PhoBERT는 베트남어 텍스트를 이해하는 데 있어 이전의 단언어 및 다언어 모델의 한계를 극복하기 위해 고성능의 사전 훈련된 언어 모델을 베트남어 전용으로 설계했습니다.
작동 방식
BERT 사전 훈련 절차를 최적화하기 위해 RoBERTa 기반 아키텍처를 사용합니다. 모델은 위키백과 및 뉴스 텍스트를 포함한 대규모 베트남어 코퍼스에서 훈련되었습니다. 정확성을 보장하기 위해 모델이 처리하기 전에 입력 텍스트는 단어 분할(예: VnCoreNLP 도구 사용)이 필요합니다.
대상 사용자
품사 태깅, 의존성 파싱, 명명된 엔티티 인식, 자연어 추론과 같은 베트남어 전용 애플리케이션을 개발하는 NLP 연구자 및 개발자에게 적합합니다.
주요 특징
- 135M에서 370M 사이의 파라미터를 가진 "base" 및 "large" 버전 제공.
- 여러 하류 베트남어 NLP 작업에서 이전의 단언어 및 다언어 접근 방식을 능가합니다.
- Hugging Face
transformers라이브러리 및fairseq와 호환됩니다. - v2 base 모델에서는 최대 140GB의 베트남어 텍스트로 사전 훈련되었습니다.
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- Dispatch