google/langextract
A Python library for extracting structured information from unstructured text using LLMs with precise source grounding and interactive visualization.
解決的問題
LangExtract 旨在利用大型語言模型 (LLM) 從非結構化文本文件(如臨床筆記或報告)中提取結構化資訊。它特別解決了長文件中的「大海撈針」式提取挑戰以及對精確來源溯源 (grounding) 的需求,確保提取的每條數據都能追溯到原始文本中的確切位置。
工作原理
該函式庫結合使用使用者定義的提示詞與 few-shot 範例來引導 LLM 識別並組織關鍵細節。為了處理大型文件,它採用了文本分塊、並行處理和多次提取輪次策略,以提高召回率。它支援廣泛的模型,包括 Google Gemini 和 OpenAI 等雲端選項,以及透過 Ollama 實現的本地模型。系統會自動檢測提取內容是基於來源文本還是 LLM 從範例中產生了幻覺,並將後者標記為 null 字元間隔。
適用對象
適用於需要將非結構化文本轉換為結構化數據而無需微調模型的開發人員與研究人員,特別是處理長文件或在醫療保健等對可追溯性與驗證性要求極高的領域工作的人員。
亮點
- 精確的來源溯源: 將每次提取都映射到來源文本中的確切字元範圍,以便於驗證。
- 可靠的結構化輸出: 使用受控生成與 few-shot 範例來強制執行一致的輸出模式。
- 長文件優化: 透過並行處理與分塊技術,在大型文本中保持高召回率。
- 互動式視覺化: 生成自包含的 HTML 檔案,以便在原始上下文中直觀地查看提取的實體。
- 靈活的模型支援: 相容 Gemini、OpenAI 與透過 Ollama 實現的本地 LLM,並具有用於自定義提供者的外掛系統。
相關
- 專案
- 專案
- 專案
- 專案
- 專案