urchade/GLiNER
Generalist and Lightweight Model for Named Entity Recognition (Extract any entity types from texts)
解決的問題
GLiNER 是為克服傳統命名實體辨識(NER)模型的限制而設計,這些模型通常需要大量標記資料以及針對每種新實體類型的特定訓練。它提供了一個輕量、通用的框架,可在不需新訓練資料的情況下,以零樣本方式提取任何實體類型。
工作原理
GLiNER 使用基於 Transformer 的架構進行詞元分類。它提供多種專用架構:
- Uni-encoder:原始架構,具備強大的零樣本能力。
- Bi-encoder:透過預先計算標籤嵌入,可擴展至數百或數千種實體類型。
- RelEx:聯合架構,用於同時提取實體及其之間的關係。
- GLiNER Decoder:混合架構,可生成實體類型以實現最大彈性。
- StreamingSpan:因果跨度模型,支援增量 NER 和持續預測更新。
為優化效能,支援 torch.compile、FP16 和 INT8 量化,以及 ONNX 導出,適用於 CPU 和消費級硬體部署。
適用對象
本工具適用於從事資訊萃取任務的開發者與資料科學家,例如 PII 檢測、知識圖譜建構,以及多語言環境下的領域特定 NER(如法律或生物醫學領域)。
主要亮點
- 零樣本識別:無需標記資料即可提取任意實體類型。
- 高可擴展性:Bi-encoder 架構支援數百萬標籤且效能不下降。
- 聯合抽取:單次處理即可同時提取實體與關係。
- 生產就緒:包含基於 Ray Serve 的服務層,支援動態批次處理與水平擴展。
- 硬體高效:透過量化與編譯優化,適用於 CPU 與消費級硬體。
相關
- 專案
- 專案
- 專案
- 專案
- 專案