miso-belica/sumy
Module for automatic summarization of text documents and HTML pages.
解决的问题
提供一种从 HTML 页面或纯文本文档中自动提取摘要的方法,支持多种语言,并提供工具来评估这些摘要的质量。
工作原理
该库使用多种摘要方法(如 LexRank、LSA、Luhn 和 Edmundson)处理从 URL 或文件解析出的文本。它利用分词器和词干提取器来处理不同自然语言,既可作为命令行工具使用,也可作为 Python API 使用。
适用人群
需要将文本摘要功能集成到其应用程序中的开发者,或希望快速使用命令行工具压缩长文档的用户。
主要亮点
- 支持多语言,并提供简单路径以添加新语言。
- 支持 HTML 和纯文本输入。
- 内置评估框架,用于测试摘要质量。
- 可作为 Python 库、CLI 工具和 Docker 容器使用。
相关
- 项目
- 项目
- 项目
- 项目
- 项目