BUPTLdy/Sentiment-Analysis
Chinese Shopping Reviews sentiment analysis
解決的問題
本專案提供一個系統,可將中文產品評論的情感分類為正面或負面。它既是早期情感分析技術的歷史紀錄,也作為情感分類的現代、可重現的基準。
如何運作
本專案提供兩種主要實作路徑:
- 現代基準:一個相容 Python 3 的命令列工具,使用字元級 TF-IDF(詞頻-逆文件頻率)來表示文字,無需依賴中文分詞詞典,並搭配 Linear SVM(支援向量機)進行分類。
- 遺留實作:使用 Word2Vec 嵌入的歷史程式碼,結合 RBF SVM 或 Keras LSTM 網路(專為 Python 2.7 與 TensorFlow 1 設計)。
適用對象
尋找簡單、可重現的中文情感分析基準的開發者與學生,或研究從 Word2Vec/LSTM 到 TF-IDF/SVM 情感分類方法演進過程的人。
特色亮點
- 無需詞典:現代實作使用字元級 TF-IDF,消除對外部中文分詞工具的依賴。
- 可重現性:包含 CLI 工具,使用固定隨機種子進行訓練與預測,確保評估的一致性。
- 歷史脈絡:保留遺留實作,供研究與對比之用。
- 元資料追蹤:在儲存模型的同時,記錄訓練時間、資料量與準確率等指標。
相關
- Dispatch
- 專案
- 專案
- Dispatch
- 專案