XLSCOUT ParaEmbed 2.0 发布

XLSCOUT 开发了 ParaEmbed 2.0,这是一款专为知识产权(IP)和专利分析设计的专有嵌入模型。该模型与 Hugging Face 的 Expert Support Program 合作开发,经过人类专家策划的高质量、多领域专利数据微调,以提升对复杂专利文档、术语和关系的分析。

性能提升与准确性

与 ParaEmbed 1.0(2023 年 10 月发布)相比,ParaEmbed 2.0 的准确率提升了 23%。此改进使模型能够更精确地捕捉上下文,并将专利映射到现有技术、产品、创意或标准上。

从闭源到开源的技术演进

XLSCOUT 从专有闭源模型转向开源基础,以更好地捕捉技术专利权利要求的细微语境。

  • 初始模型: 团队发现诸如 GPT-4 和 text-embedding-ada-002 等模型在处理专业专利权利要求时表现不佳。
  • 开源集成: XLSCOUT 使用专有专利数据集成并微调了包括 BGE-base-v1.5、Llama 2 70B、Falcon 40B 和 Mixtral 8x7B 在内的模型。

基础设施与吞吐量优化

通过 Hugging Face Expert Support Program,XLSCOUT 优化了推理流水线,显著提升了吞吐量:

  • 早期实现: 在 Google Cloud Platform(GCP)上使用分布式数据并行(DDP)和 ONNX 优化的自定义 TorchServe 推理服务器,达到了约每秒 300 次嵌入。
  • 生产扩展: 通过迁移到带有文本嵌入推理(TEI)和内置负载均衡的 Hugging Face Inference Endpoints,系统现在可提供约每秒 2,700 次嵌入。

LLM 在专利工作流中的集成

除了嵌入之外,合作还专注于提升用于专利撰写的生成式 AI 能力:

  • 提示工程: 使用专门的提示工程,确保生成的专利草稿连贯、完整且符合法律要求。
  • 指令微调: XLSCOUT 使用来自 Meta 和 Mistral 的模型实施指令数据格式化和微调,以提升专利撰写过程中特定环节的精确度。

AI 驱动的 IP 解决方案

ParaEmbed 2.0 及其相关的 LLM 工作流为三款主要的 XLSCOUT 产品提供动力:

  • 新颖性检查 LLM: 通过检索专利和非专利文献,对创意进行验证,提供排序的现有技术参考和关键特征分析报告。
  • 无效化 LLM: 进行高速专利无效检索,帮助律所和企业质疑现有专利的有效性。
  • 撰写 LLM: 一个自动化平台,可生成初步的专利草稿,包括权利要求、摘要、图纸、背景和说明。

战略合作伙伴关系

XLSCOUT 首席执行官 Sandeep Agarwal 表示,此合作将 Hugging Face 的开源工具和模型与 XLSCOUT 的专利专长相结合:

"此合作将 Hugging Face 开源模型、工具和团队的无与伦比的能力与我们在专利领域的深厚专长相结合。通过使用我们的专有数据对这些模型进行微调,我们有望彻底改变专利的撰写、分析和授权方式。"

Sources