XLSCOUT ParaEmbed 2.0 发布
XLSCOUT 开发了 ParaEmbed 2.0,这是一款专为知识产权(IP)和专利分析设计的专有嵌入模型。该模型与 Hugging Face 的 Expert Support Program 合作开发,经过人类专家策划的高质量、多领域专利数据微调,以提升对复杂专利文档、术语和关系的分析。
性能提升与准确性
与 ParaEmbed 1.0(2023 年 10 月发布)相比,ParaEmbed 2.0 的准确率提升了 23%。此改进使模型能够更精确地捕捉上下文,并将专利映射到现有技术、产品、创意或标准上。
从闭源到开源的技术演进
XLSCOUT 从专有闭源模型转向开源基础,以更好地捕捉技术专利权利要求的细微语境。
- 初始模型: 团队发现诸如 GPT-4 和 text-embedding-ada-002 等模型在处理专业专利权利要求时表现不佳。
- 开源集成: XLSCOUT 使用专有专利数据集成并微调了包括 BGE-base-v1.5、Llama 2 70B、Falcon 40B 和 Mixtral 8x7B 在内的模型。
基础设施与吞吐量优化
通过 Hugging Face Expert Support Program,XLSCOUT 优化了推理流水线,显著提升了吞吐量:
- 早期实现: 在 Google Cloud Platform(GCP)上使用分布式数据并行(DDP)和 ONNX 优化的自定义 TorchServe 推理服务器,达到了约每秒 300 次嵌入。
- 生产扩展: 通过迁移到带有文本嵌入推理(TEI)和内置负载均衡的 Hugging Face Inference Endpoints,系统现在可提供约每秒 2,700 次嵌入。
LLM 在专利工作流中的集成
除了嵌入之外,合作还专注于提升用于专利撰写的生成式 AI 能力:
- 提示工程: 使用专门的提示工程,确保生成的专利草稿连贯、完整且符合法律要求。
- 指令微调: XLSCOUT 使用来自 Meta 和 Mistral 的模型实施指令数据格式化和微调,以提升专利撰写过程中特定环节的精确度。
AI 驱动的 IP 解决方案
ParaEmbed 2.0 及其相关的 LLM 工作流为三款主要的 XLSCOUT 产品提供动力:
- 新颖性检查 LLM: 通过检索专利和非专利文献,对创意进行验证,提供排序的现有技术参考和关键特征分析报告。
- 无效化 LLM: 进行高速专利无效检索,帮助律所和企业质疑现有专利的有效性。
- 撰写 LLM: 一个自动化平台,可生成初步的专利草稿,包括权利要求、摘要、图纸、背景和说明。
战略合作伙伴关系
XLSCOUT 首席执行官 Sandeep Agarwal 表示,此合作将 Hugging Face 的开源工具和模型与 XLSCOUT 的专利专长相结合:
"此合作将 Hugging Face 开源模型、工具和团队的无与伦比的能力与我们在专利领域的深厚专长相结合。通过使用我们的专有数据对这些模型进行微调,我们有望彻底改变专利的撰写、分析和授权方式。"