BUPTLdy/Sentiment-Analysis
Chinese Shopping Reviews sentiment analysis
何を解決するか
このプロジェクトは、中国語の製品レビューのセンチメントをポジティブまたはネガティブに分類するシステムを提供します。これは初期のセンチメント分析技術の歴史的記録として機能するだけでなく、センチメント分類の現代的で再現可能なベースラインとしても役立ちます。
動作方法
このプロジェクトは2つの主要な実装パスを提供しています:
- 現代ベースライン:Python 3互換のCLIツールで、中国語の単語分割辞書を必要とせずに文字レベルのTF-IDF(項頻度-逆文書頻度)でテキストを表現し、分類にLinear SVM(サポートベクターマシン)を使用します。
- レガシーアーキテクチャ:Word2Vec埋め込みを使用した歴史的コードで、RBF SVMまたはKeras LSTMネットワーク(Python 2.7およびTensorFlow 1用に設計)を組み合わせています。
対象ユーザー
中国語のセンチメント分析のシンプルで再現可能なベースラインを探している開発者や学生、またはWord2Vec/LSTMからTF-IDF/SVMへのセンチメント分類手法の進化を研究したい方。
特徴
- 辞書不要:現代の実装では文字レベルのTF-IDFを使用し、外部の中国語分割ツールへの依存を排除しています。
- 再現性:固定された乱数シードを使用してトレーニングと予測を行うCLIを含み、一貫した評価が可能になっています。
- 歴史的文脈:研究や比較の目的でレガシー実装を保存しています。
- メタデータ追跡:モデルとともにトレーニング時間、データ量、精度メトリクスを保存しています。
関連
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト