VinAIResearch/PhoBERT

PhoBERT: Pre-trained language models for Vietnamese (EMNLP-2020 Findings)

何を解決するか

PhoBERTは、ベトナム語の理解において従来の単言語および多言語モデルの限界を克服する高パフォーマンスな事前学習済み言語モデルを、ベトナム語専用に設計しています。

仕組み

RoBERTaベースのアーキテクチャを使用してBERTの事前学習プロセスを最適化しています。モデルは、Wikipediaやニュース記事を含む大規模なベトナム語コーパス上で訓練されています。正確性を確保するため、モデルが処理する前に入力テキストは単語分割(VnCoreNLPなどのツールを使用)が必要です。

対象ユーザー

ベトナム語固有のアプリケーション(品詞タグ付け、依存解析、固有表現抽出、自然言語推論など)を開発するNLP研究者および開発者向けです。

特徴

  • 135M~370Mパラメータを持つ「base」および「large」バージョンを提供。
  • 複数の下流タスクにおいて、従来の単言語および多言語アプローチを上回る性能を発揮。
  • Hugging Face transformersライブラリおよび fairseq と互換性あり。
  • v2 baseモデルでは最大140GBのベトナム語テキストで事前学習済み。

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch