XLSCOUT ParaEmbed 2.0 發布
XLSCOUT 開發了 ParaEmbed 2.0,一個專為智慧財產(IP)與專利分析設計的專有嵌入模型。該模型與 Hugging Face 的 Expert Support Program 合作開發,並在由人類專家策劃的高品質、多領域專利資料上進行微調,以提升對複雜專利文件、術語與關係的分析。
效能提升與準確度
相較於於 2023 年 10 月發布的 ParaEmbed 1.0,ParaEmbed 2.0 提升了 23% 的準確度。此改進使模型能更精確地捕捉語境,並將專利與先前技術、產品、概念或標準進行對映。
從封閉到開源的技術演進
XLSCOUT 從專有的封閉源碼模型轉向開源基礎,以更好地捕捉技術專利權利要求的細微語境。
- Initial Models: 團隊發現像 GPT-4 與 text-embedding-ada-002 等模型在處理專業的專利權利要求時表現不佳。
- Open-Source Integration: XLSCOUT 使用專有的專利資料整合並微調了包括 BGE-base-v1.5、Llama 2 70B、Falcon 40B 與 Mixtral 8x7B 在內的模型。
基礎設施與吞吐量最佳化
透過 Hugging Face Expert Support Program,XLSCOUT 優化了推論管線,顯著提升了吞吐量:
- Early Implementation: 最初在 Google Cloud Platform (GCP) 上使用 Distributed Data Parallel (DDP) 與 ONNX 最佳化的自訂 TorchServe 推論伺服器,達到約每秒 300 個嵌入。
- Production Scaling: 透過遷移至 Hugging Face Inference Endpoints 並使用 Text Embedding Inference (TEI) 與內建負載平衡,系統現在可提供約每秒 2,700 個嵌入。
LLM 整合於專利工作流程
除了嵌入之外,合作亦聚焦於提升生成式 AI 在專利撰寫方面的能力:
- Prompt Engineering: 使用專門的提示工程,確保生成的專利草稿具備連貫性、完整性且符合法律要求。
- Instruction Fine-tuning: XLSCOUT 透過使用 Meta 與 Mistral 的模型,實施指令資料格式化與微調,以提升專利撰寫過程中特定部分的精確度。
AI 驅動的 IP 解決方案
ParaEmbed 2.0 與相關的 LLM 工作流程支援 XLSCOUT 的三大核心產品:
- Novelty Checker LLM: 透過檢索專利與非專利文獻,驗證創意並提供排序的先前技術參考與關鍵特徵分析報告。
- Invalidator LLM: 執行高速的專利無效搜尋,協助律師事務所與企業挑戰現有專利的有效性。
- Drafting LLM: 一個自動化平台,可生成初步的專利草稿,包含權利要求、摘要、圖紙、背景說明與說明書。
策略夥伴關係
XLSCOUT 執行長 Sandeep Agarwal 表示,這項夥伴關係結合了 Hugging Face 的開源工具與模型,以及 XLSCOUT 的專利專業知識:
"此夥伴關係結合了 Hugging Face 開源模型、工具與團隊的無與倫比能力,以及我們在專利領域的深厚專業。透過以我們的專有資料微調這些模型,我們正準備徹底改變專利的撰寫、分析與授權方式。"