InternScience/GraphGen
GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation
해결하는 문제
GraphGen은 고품질의 지식 기반 합성 데이터를 생성하여 대형 언어 모델(LLM)의 지도 미세 조정(SFT)을 개선하기 위해 설계된 프레임워크입니다. 특히 고가치의 롱테일 지식에 대한 QA 쌍 생성을 우선시함으로써 LLM의 '지식 격차', 즉 모델이 정보가 부족하거나 보정이 제대로 되지 않은 영역의 문제를 구체적으로 해결합니다.
작동 방식
GraphGen은 합성 훈련 데이터를 생성하기 위해 구조화된 파이프라인을 따릅니다:
- 지식 그래프 구축: 소스 텍스트(PDF, JSON, TXT 등) 또는 외부 데이터베이스(UniProt, NCBI, Wikipedia)로부터 세밀한 지식 그래프를 구축합니다.
- 격차 식별: 기대 보정 오차 지표를 사용하여 LLM이 지식이 부족한 곳을 식별합니다.
- 타겟 생성: 지식 그래프를 기반으로 QA 쌍을 생성하며, 복잡한 관계를 포착하기 위해 멀티 홉 이웃 샘플링을 사용하고 다양성을 위해 스타일 제어 생성을 사용합니다.
- 데이터 증강: 사전 학습 중 중복성을 피하기 위해 LLM 기반 재구성을 사용하여 동일한 코퍼스의 다양한 변형을 만드는 재구문 파이프라인을 포함합니다.
대상 독자
이 도구는 LLM을 위한 고품질 훈련 데이터를 합성해야 하는 AI 연구원 및 개발자, 특히 의학, 법률 또는 생물학(예: 식물 과학)과 같은 지식 집약적 도메인에서 작업하는 사용자를 위한 것입니다.
하이라이트
- 다양한 데이터 유형: Atomic, Aggregated, Chain-of-Thought (CoT), Multi-hop, VQA(시각적 질문 응답) 및 벤치마크 스타일 데이터(객관식, 빈칸 채우기, 참/거짓) 생성을 지원합니다.
- 광범위한 통합: 다양한 추론 백엔드(vLLM, SGLang, HuggingFace) 및 API 서버(OpenAI, Azure, Ollama)와 호환됩니다.
- 유연한 데이터 소스: 파일, 검색 엔진(Google, Bing) 및 전문 생물정보학 데이터베이스에서 데이터를 수집할 수 있습니다.
- 확장 가능한 아키텍처: 분산 실행을 위해 Ray를 활용하며, 효율적인 스토리지를 위해 KuzuDB 및 RocksDB를 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트