miso-belica/sumy
Module for automatic summarization of text documents and HTML pages.
解決的問題
提供一種自動從 HTML 頁面或純文字文件中提取摘要的方法,支援多種語言,並提供工具來評估這些摘要的品質。
工作原理
該程式庫使用多種摘要方法(如 LexRank、LSA、Luhn 和 Edmundson)處理從 URL 或檔案解析出的文字。它利用分詞器和詞幹提取器來處理不同自然語言,既可作為命令列工具使用,也可作為 Python API 使用。
適用對象
需要將文字摘要功能整合到其應用程式中的開發者,或希望快速使用命令列工具壓縮長文件的使用者。
主要亮點
- 支援多語言,並提供簡單途徑以新增語言。
- 支援 HTML 與純文字輸入。
- 內建評估框架,用於測試摘要品質。
- 可作為 Python 套件、CLI 工具和 Docker 容器使用。
相關
- 專案
- 專案
- 專案
- 專案
- 專案