stanfordnlp/CoreNLP
CoreNLP: A Java suite of core NLP tools for tokenization, sentence segmentation, NER, parsing, coreference, sentiment analysis, etc.
解决的问题
Stanford CoreNLP 是一套自然语言分析工具,能将人类原始语言文本转换为结构化数据。它通过自动从文本中提取语言特征,为更高层级的文本理解应用程序提供了基础构建模块。
运作方式
它是一个以 Java 编写的集成框架,结合了基于规则的系统、概率机器学习和深度学习组件。系统可以进行配置,以在一段文本上运行一系列语言分析工具(annotators),从而提取各种语言属性。
适用对象
它被学术界、工业界和政府部门的研究人员广泛用于多种语言的自然语言处理任务,包括英语、阿拉伯语、中文、法语、德语、匈牙利语、意大利语和西班牙语。
亮点
- 全面分析:提取词汇的基本形式、词性、命名实体(公司、人物等)以及句法结构(短语或依存关系)。
- 规范化:解读并规范化日期、时间和数值量。
- 共指解析:识别哪些名词短语指向相同的实体。
- 多语言支持:对多种主要世界语言提供不同程度的支持。
- 易于集成:允许用户仅用两行代码即可运行全套分析工具。
相关
- 项目
- 项目
- 项目
- 项目