VinAIResearch/PhoBERT

PhoBERT: Pre-trained language models for Vietnamese (EMNLP-2020 Findings)

解決的問題

PhoBERT 專為越南語設計,旨在提供高效率的預訓練語言模型,克服以往單語與多語模型在理解越南語文字上的限制。

工作原理

採用基於 RoBERTa 的架構,優化 BERT 的預訓練程序。模型在大型越南語語料庫(包括維基百科與新聞文本)上進行訓練。為確保準確性,輸入文字必須先使用工具(如 VnCoreNLP)進行分詞處理,才能交由模型處理。

適用對象

適用於開發越南語專用應用的 NLP 研究人員與開發者,例如詞性標記、依存句法分析、命名實體辨識與自然語言推論等任務。

主要亮點

  • 提供「base」與「large」兩種版本,參數數量介於 135M 至 370M 之間。
  • 在多個下游越南語 NLP 任務中,表現優於以往的單語與多語方法。
  • 兼容 Hugging Face transformers 套件與 fairseq
  • v2 base 模型使用高達 140GB 的越南語文字進行預訓練。

相關