XLSCOUT ParaEmbed 2.0 リリース
XLSCOUTは、知的財産(IP)および特許分析専用に設計された独自の埋め込みモデル、ParaEmbed 2.0を開発しました。Hugging FaceのExpert Support Programと協力して開発され、このモデルは人間の専門家がキュレーションした高品質かつマルチドメインの特許データでファインチューニングされ、複雑な特許文書、用語、関係性の分析を向上させます。
パフォーマンス向上と精度
ParaEmbed 2.0は、ParaEmbed 1.0(2023年10月リリース)と比較して精度が23%向上しています。この改善により、モデルは文脈をより正確に捉え、特許を先行技術、製品、アイデア、標準とマッピングできるようになります。
クローズドからオープンソースへの技術的進化
XLSCOUTは、独自のクローズドソースモデルからオープンソースの基盤へと移行し、技術的特許クレームの微妙な文脈をより適切に捉えるようにしました。
- Initial Models: チームは、GPT-4やtext-embedding-ada-002などのモデルが専門的な特許クレームで苦戦することを確認しました。
- Open-Source Integration: XLSCOUTは、BGE-base-v1.5、Llama 2 70B、Falcon 40B、Mixtral 8x7Bなどのモデルを独自の特許データで統合・ファインチューニングしました。
インフラストラクチャとスループット最適化
Hugging Face Expert Support Programを通じて、XLSCOUTは推論パイプラインを最適化し、スループットを大幅に向上させました:
- Early Implementation: Google Cloud Platform(GCP)上のカスタムTorchServe推論サーバーを、Distributed Data Parallel(DDP)とONNX最適化で使用した初期実装では、約1秒あたり300件の埋め込みを実現しました。
- Production Scaling: Text Embedding Inference(TEI)と組み込みロードバランシングを備えたHugging Face Inference Endpointsへ移行することで、システムは現在約1秒あたり2,700件の埋め込みを提供しています。
特許ワークフロー向けLLM統合
埋め込みに加えて、今回の協業は特許ドラフト作成向けの生成AI機能の強化に焦点を当てました:
- Prompt Engineering: 生成された特許ドラフトが一貫性、包括性、法的妥当性を備えるよう、専門的なプロンプトエンジニアリングが使用されました。
- Instruction Fine-tuning: XLSCOUTは、MetaおよびMistralのモデルを用いて指示データのフォーマットとファインチューニングを実施し、特許ドラフト作成プロセスの特定部分の精度を向上させました。
AI駆動型IPソリューション
ParaEmbed 2.0と関連するLLMワークフローは、XLSCOUTの主要な3つの製品を支えています:
- Novelty Checker LLM: 特許文献と非特許文献を横断してアイデアを検証し、ランク付けされた先行技術参照と主要特徴分析レポートを提供します。
- Invalidator LLM: 高速な特許無効化検索を実施し、法律事務所や企業が既存特許の有効性に挑戦できるよう支援します。
- Drafting LLM: 請求項、要約、図面、背景、説明などを含む予備的な特許ドラフトを自動生成するプラットフォームです。
戦略的パートナーシップ
XLSCOUTのCEOであるSandeep Agarwalは、今回のパートナーシップがHugging FaceのオープンソースツールとモデルをXLSCOUTの特許専門知識と組み合わせたものだと述べました:
"このパートナーシップは、Hugging Faceのオープンソースモデル、ツール、チームの比類なき能力と、当社の深い特許専門知識を組み合わせたものです。これらのモデルを当社の独自データでファインチューニングすることで、特許の作成、分析、ライセンスの方法を革命的に変える準備が整いました。"
SUMMARY: XLSCOUTは、専門家がキュレーションした特許データでファインチューニングされた独自の埋め込みモデル、ParaEmbed 2.0をリリースしました。これにより、ParaEmbed 1.0に比べて精度が23%向上しています。
TITLE: XLSCOUT ParaEmbed 2.0 リリース