dongrixinyu/JioNLP
中文 NLP 预处理、解析工具包,准确、高效、易用 A Chinese NLP Preprocessing & Parsing Package www.jionlp.com
解决的问题
JioNLP 旨在处理中文自然语言处理(NLP)预处理和解析中的繁琐且耗时的任务。它提供了一套全面的工具,通过自动化通常需要大量手动编码的常见数据清洗、提取和分析任务,加速开发进程。
如何工作
该库为不同 NLP 阶段提供了广泛的专业功能:
- 工具箱: 用于解析车牌、时间语义、身份证、位置信息的工具,以及简体与繁体中文之间的转换,字符转拼音的功能。
- 数据增强: 包括回译、同音替换、NER 实体替换在内的文本增强方法。
- 正则表达式提取: 用于清理文本并提取或移除特定模式(如电子邮件、URL、电话号码、IP 地址)的工具。
- NER 与分类: 用于命名实体识别(NER)标签转换、数据集分割,以及文本分类的朴素贝叶斯频率分析工具。
- 词典: 内置的停用词、成语和中文地理信息加载器。
- LLM 评估: 包含 MELLM(大语言模型互评),一种无需人工监督的 LLM 自动评估算法。
适用人群
主要面向需要高效、高精度预处理和解析工具的中文文本数据 NLP 开发者和研究人员。
特色亮点
- 丰富的中文专用工具: 深度支持中文身份证、车牌和地理数据。
- LLM 评估: 集成的大语言模型自动评估功能。
- 冷门中文语言学工具: 拼音转换和汉字部首/结构分析。
- 全面的数据清洗: 一站式功能,用于标准化并移除敏感或冗余信息。
相关
- 项目
- 项目
- 项目
- 项目
- 项目