atomicstrata/llm-wiki-compiler
The knowledge compiler. Raw sources in, interlinked wiki out. Inspired by Karpathy's LLM Wiki pattern.
What it solves
llmwiki는 PDF, 웹 페이지, 노트, 전사본 등 원시 비구조화 데이터를 구조화되고 상호 연결된 마크다운 위키로 변환합니다. 전통적인 RAG(Retrieval‑Augmented Generation)가 질의 시점에 원시 청크를 검색하는 것과 달리, llmwiki는 지식을 한 번만 컴파일하여 인용이 포함된 영구적이고 타입이 지정된 페이지로 저장합니다. 이를 통해 에이전트와 인간이 원시 파일에서 관계를 반복적으로 재발견할 필요가 없어지며, 시간이 지남에 따라 누적되는 안정적이고 감사 가능한 지식 베이스를 구축할 수 있습니다.
How it works
시스템은 두 단계 LLM 파이프라인을 사용해 개념을 추출하고(예: 개념, 엔터티, 비교) 타입이 지정된 페이지를 생성합니다. "컴파일 타임" 접근 방식을 구현하여, 소스가 수집·처리되어 YAML front‑matter가 포함된 마크다운 파일 형태의 위키 구조로 저장됩니다.
주요 아키텍처 구성 요소는 다음과 같습니다:
- Configurable Lifecycle Profiles (CLP): JSON 기반 계약으로 엔터티 스키마, 관계, 신뢰 게이트를 정의하며, 런타임에 프롬프트 관례가 아닌 도메인‑특화 규칙을 강제합니다.
- Hybrid Retrieval: 의미론적 청크 검색, BM25 재정렬, wikilink 그래프 확장을 결합해 질의용 컨텍스트 팩을 구축합니다.
- Quality Gates: 인용 및 링크 검증을 위한 린팅 시스템과, 건강 점수 및 인용 정확도를 측정하는 평가 하니스가 포함됩니다.
- Integration Layers: CLI, TypeScript SDK, MCP(Model Context Protocol) 서버를 제공해 에이전트가 위키와 상호 작용할 수 있게 합니다.
Who it’s for
원시 자료로부터 지속 가능하고 감사 가능한 지식 베이스를 필요로 하는 사용자에게 설계되었습니다. 예를 들어 autosci 템플릿을 사용하는 연구자, newsroom 템플릿을 사용하는 편집 팀, 그리고 안정적이고 인용을 인식하는 컨텍스트가 필요한 AI 에이전트를 개발하는 개발자들이 해당됩니다.
Highlights
- Citation‑Traceable Output: 모든 주장과 단락에 구체적인 소스 파일 및 라인 범위가 인용됩니다.
- Domain Templates: 연구 및 편집 워크플로우를 위한 사전 구축 프로파일로, 특정 엔터티 타입과 라이프사이클을 정의합니다.
- MCP Server: AI 에이전트가 위키를 직접 수집, 컴파일, 질의 및 관리할 수 있게 합니다.
- Open Knowledge Format (OKF): 휴대 가능한 마크다운 번들 형태로 지식의 가져오기·내보내기를 지원합니다.
- Incremental Compilation: 변경된 소스만 처리해 시간과 API 비용을 절감합니다.
- Review Policy: 신뢰도 또는 출처 규칙에 따라 생성된 페이지를 인간 승인 대기 상태로 유지할 수 있습니다.