XLSCOUT ParaEmbed 2.0 릴리스

XLSCOUT는 지식재산(IP) 및 특허 분석을 위해 특별히 설계된 독점 임베딩 모델인 ParaEmbed 2.0을 개발했습니다. Hugging Face의 Expert Support Program과 협업하여 개발된 이 모델는 인간 전문가가 선별한 고품질 다도메인 특허 데이터를 기반으로 미세 조정되어 복잡한 특허 문서, 용어 및 관계 분석을 향상시킵니다.

성능 향상 및 정확도

ParaEmbed 2.0은 ParaEmbed 1.0(2023년 10월 출시) 대비 정확도가 23% 향상되었습니다. 이 개선을 통해 모델은 컨텍스트를 보다 정밀하게 포착하고 특허를 선행 기술, 제품, 아이디어 또는 표준과 매핑할 수 있습니다.

폐쇄형에서 오픈소스로의 기술 진화

XLSCOUT는 독점 폐쇄형 모델에서 오픈소스 기반으로 전환하여 기술 특허 청구항의 미묘한 컨텍스트를 더 잘 포착하고자 했습니다.

  • Initial Models: 팀은 GPT-4 및 text-embedding-ada-002와 같은 모델이 특수한 특허 청구항을 처리하는 데 어려움을 겪는다는 것을 발견했습니다.
  • Open-Source Integration: XLSCOUT는 BGE-base-v1.5, Llama 2 70B, Falcon 40B, Mixtral 8x7B 등 모델을 독점 특허 데이터를 사용해 통합 및 미세 조정했습니다.

인프라 및 처리량 최적화

Hugging Face Expert Support Program을 통해 XLSCOUT는 추론 파이프라인을 최적화하여 처리량을 크게 증가시켰습니다.

  • Early Implementation: Google Cloud Platform (GCP)에서 Distributed Data Parallel (DDP) 및 ONNX 최적화를 적용한 맞춤형 TorchServe 추론 서버를 초기 구축하여 초당 약 300개의 임베딩을 생성했습니다.
  • Production Scaling: Hugging Face Inference Endpoints와 Text Embedding Inference (TEI)를 활용하고 내장 로드 밸런싱을 적용함으로써 현재 시스템은 초당 약 2,700개의 임베딩을 제공하고 있습니다.

특허 워크플로우를 위한 LLM 통합

임베딩 외에도, 이번 협업은 특허 초안 작성을 위한 생성 AI 기능 강화에 초점을 맞추었습니다.

  • Prompt Engineering: 특수한 프롬프트 엔지니어링을 적용해 생성된 특허 초안이 일관되고 포괄적이며 법적으로 타당하도록 했습니다.
  • Instruction Fine-tuning: XLSCOUT는 Meta와 Mistral의 모델을 활용해 지시 데이터 포맷팅 및 미세 조정을 수행하여 특허 초안 작성 과정의 특정 부분에 대한 정확성을 높였습니다.

AI 기반 IP 솔루션

ParaEmbed 2.0과 연계된 LLM 워크플로우는 XLSCOUT의 주요 제품 세 가지를 구동합니다.

  • Novelty Checker LLM: 특허 및 비특허 문헌을 탐색해 아이디어를 검증하고, 순위가 매겨진 선행 기술 참고문헌 및 핵심 특징 분석 보고서를 제공합니다.
  • Invalidator LLM: 고속 특허 무효화 검색을 수행해 로펌 및 기업이 기존 특허의 유효성을 도전할 수 있도록 지원합니다.
  • Drafting LLM: 청구항, 초록, 도면, 배경 및 설명을 포함한 초기 특허 초안을 자동으로 생성하는 플랫폼입니다.

전략적 파트너십

XLSCOUT의 CEO인 Sandeep Agarwal는 이번 파트너십이 Hugging Face의 오픈소스 도구와 모델을 XLSCOUT의 특허 전문성과 결합한다고 밝혔습니다:

"이 파트너십은 Hugging Face의 오픈소스 모델, 도구 및 팀이 제공하는 뛰어난 역량을 우리의 깊은 특허 전문성과 결합합니다. 독점 데이터를 사용해 이러한 모델을 미세 조정함으로써 특허 초안 작성, 분석 및 라이선스 방식을 혁신할 준비가 되었습니다."

Sources