VinAIResearch/PhoBERT
PhoBERT: Pre-trained language models for Vietnamese (EMNLP-2020 Findings)
解決的問題
PhoBERT 專為越南語設計,旨在提供高效率的預訓練語言模型,克服以往單語與多語模型在理解越南語文字上的限制。
工作原理
採用基於 RoBERTa 的架構,優化 BERT 的預訓練程序。模型在大型越南語語料庫(包括維基百科與新聞文本)上進行訓練。為確保準確性,輸入文字必須先使用工具(如 VnCoreNLP)進行分詞處理,才能交由模型處理。
適用對象
適用於開發越南語專用應用的 NLP 研究人員與開發者,例如詞性標記、依存句法分析、命名實體辨識與自然語言推論等任務。
主要亮點
- 提供「base」與「large」兩種版本,參數數量介於 135M 至 370M 之間。
- 在多個下游越南語 NLP 任務中,表現優於以往的單語與多語方法。
- 兼容 Hugging Face
transformers套件與fairseq。 - v2 base 模型使用高達 140GB 的越南語文字進行預訓練。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- Dispatch