messense/jieba-rs

The Jieba Chinese Word Segmentation Implemented in Rust

何を解決するか

中国語の単語分割は、中国語テキストを処理する上で基本的な要件です。このプロジェクトは、Rustで実装された高性能なJiebaアルゴリズムを提供し、中国語の文を効率的に個々の単語に分割できるようにします。

動作方法

RustでJieba中国語単語分割ロジックを実装しています。ライブラリは、入力文字列に対して単語切り分け(分割)を実行できるコアの Jieba オブジェクトを提供します。また、使いやすさを高めるために埋め込み辞書をサポートし、TF-IDFおよびTextRankアルゴリズムを用いたキーワード抽出も可能です。

対象ユーザー

Rustで高速かつ信頼性の高い中国語テキスト処理および分割が必要な開発者、または提供されているバインディング(NodeJS、PHP、Python、R、WASMなど)を通じて他の言語を使用する開発者。

特徴

  • 高速性: 速度最適化されており、cppjiebaよりもはるかに高速であることがベンチマークで確認されています。
  • 拡張性: TF-IDFおよびTextRankによるキーワード抽出のオプション機能を提供しています。
  • 広範なエコシステム: Python、NodeJS、PHPなど、多数の言語バインディングの基盤として利用可能です。
  • 簡単なインストール: Rust開発者向けにCargo経由で簡単に統合できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト