dongrixinyu/JioNLP
中文 NLP 预处理、解析工具包,准确、高效、易用 A Chinese NLP Preprocessing & Parsing Package www.jionlp.com
解決的問題
JioNLP 是為處理中文自然語言處理(NLP)前處理與解析中繁瑣且耗時的任務而設計。它提供一整套工具,透過自動化通常需要大量手動編碼的常見資料清洗、萃取與分析任務,加速開發流程。
如何運作
該函式庫提供廣泛的專業功能,適用於不同 NLP 階段:
- 工具箱: 用於解析車牌、時間語意、身分證、位置資訊的工具,以及簡體與繁體中文之間的轉換,以及將文字轉為拼音的功能。
- 資料增強: 包含回譯、同音替代、NER 實體替換等文本增強方法。
- 正規表示式萃取: 用於清理文字並提取或移除特定模式(如電子郵件、URL、電話號碼、IP 位址)的工具。
- NER 與分類: 用於命名實體辨識(NER)標籤轉換、資料集分割,以及文本分類的朴素貝氏頻率分析工具。
- 詞典: 內建的停用詞、成語與中文地理資訊載入器。
- LLM 評估: 包含 MELLM(大語言模型互評),一種無需人工監督的 LLM 自動評估演算法。
適用對象
主要針對需要高效、高準確度前處理與解析工具的中文文本資料 NLP 開發者與研究人員。
特色亮點
- 豐富的中文專用工具: 深度支援中文身分證、車牌與地理資料。
- LLM 評估: 集成的大語言模型自動評估功能。
- 冷門中文語言學工具: 拼音轉換與漢字部首/結構分析。
- 全面的資料清洗: 一站式功能,用於標準化並移除敏感或重複資訊。
相關
- 專案
- 專案
- 專案
- 專案
- 專案