VinAIResearch/PhoBERT

PhoBERT: Pre-trained language models for Vietnamese (EMNLP-2020 Findings)

解决的问题

PhoBERT 专为越南语设计,旨在提供高性能的预训练语言模型,克服了以往单语和多语模型在理解越南语文本方面的局限性。

工作原理

采用基于 RoBERTa 的架构,优化 BERT 的预训练流程。模型在大规模越南语语料库(包括维基百科和新闻文本)上进行训练。为确保准确性,输入文本必须使用工具(如 VnCoreNLP)进行分词处理后,才能输入模型。

适用人群

适用于开发越南语专用应用的 NLP 研究人员和开发者,例如词性标注、依存句法分析、命名实体识别和自然语言推理等任务。

主要亮点

  • 提供 "base" 和 "large" 两种版本,参数量在 135M 到 370M 之间。
  • 在多个下游越南语 NLP 任务中,性能优于以往的单语和多语方法。
  • 兼容 Hugging Face transformers 库和 fairseq
  • 在 v2 base 模型中,使用高达 140GB 的越南语文本进行预训练。

相关