atomicstrata/llm-wiki-compiler

The knowledge compiler. Raw sources in, interlinked wiki out. Inspired by Karpathy's LLM Wiki pattern.

What it solves

llmwiki は、PDF、ウェブページ、ノート、文字起こしといった生の非構造化データを、構造化された相互リンク付き Markdown Wiki に変換します。従来の RAG(Retrieval‑Augmented Generation)がクエリ時に生データの断片を取得するのに対し、llmwiki は知識を一度だけコンパイルし、引用付きの永続的かつ型付けされたページとして保存します。これにより、エージェントや人間が生ファイル内の関係性を何度も再発見する必要がなくなり、時間とともに蓄積される安定かつ監査可能なナレッジベースが構築できます。

How it works

システムは 2 段階の LLM パイプラインを用いて概念を抽出し、概念・エンティティ・比較といった型付けページを生成します。"コンパイル時" のナレッジアプローチを実装しており、ソースは取り込まれ、YAML front‑matter を持つ Markdown ファイルとして Wiki 構造に加工されます。

主なアーキテクチャコンポーネントは次のとおりです:

  • Configurable Lifecycle Profiles (CLP): JSON ベースの契約で、エンティティスキーマ、リレーション、トラストゲートを定義し、実行時にプロンプトの慣例に依存せずドメイン固有のルールを適用します。
  • Hybrid Retrieval: セマンティックチャンク検索、BM25 リランク、wikilink グラフ展開を組み合わせ、クエリ用のコンテキストパックを構築します。
  • Quality Gates: 引用とリンクを検証するリントシステムと、ヘルススコアや引用精度を測定する評価ハーネスを含みます。
  • Integration Layers: CLI、TypeScript SDK、MCP(Model Context Protocol)サーバーを提供し、エージェントが Wiki とやり取りできるようにします。

Who it’s for

生素材から永続的で監査可能なナレッジベースを構築したいユーザー向けです。例として autosci テンプレートを使う研究者や、newsroom テンプレートを使う編集チーム、安定した引用対応コンテキストを必要とする AI エージェントを開発する開発者が挙げられます。

Highlights

  • Citation‑Traceable Output: すべての主張と段落に、具体的なソースファイルと行範囲が引用として付与されます。
  • Domain Templates: 研究・編集ワークフロー向けに事前構築されたプロファイルで、特定のエンティティタイプとライフサイクルを定義します。
  • MCP Server: AI エージェントが Wiki を直接取り込み、コンパイル、クエリ、管理できるようにします。
  • Open Knowledge Format (OKF): ポータブルな Markdown バンドルとしてナレッジのインポート・エクスポートをサポートします。
  • Incremental Compilation: 変更されたソースのみを処理し、時間と API コストを削減します。
  • Review Policy: 信頼度や出典ルールに基づき、生成ページを人間の承認待ちにできる仕組みを提供します。