Open-Source-Legal/OpenContracts

The open document intelligence platform for builders and hackers - DMS for the agentic world

What it solves

OpenContracts 提供文件庫的可程式化引用圖。它解決了文件被儲存為孤立檔案(葉節點)而非相互連結的節點的問題,這常導致 AI 代理人產生幻覺式引用或無法解析引用。透過建立結構化的引用基底與人工驗證的註釋,讓團隊能以高精度在複雜的文件網路中導航——例如法律檔案、研究圖書館或內部政策。

How it works

系統將文件語料庫轉換為可導航的圖形,文件為節點,引用為邊。它使用模組化的管線進行解析、嵌入與縮圖,並支援可插拔的架構以加入自訂元件。

主要技術面包括:

  • AI Agents:基於 Python 的代理人,於引用圖上推理並提供有根據、帶引用的答案。
  • MCP Server:Model Context Protocol 伺服器,讓 Claude、Cursor 等 AI 工具能搜尋語料庫並沿引用邊走訪,無需自訂 glue code。
  • Structured Extraction:使用 Celery 工作者在數百份文件上執行自然語言查詢,將結果填入類試算表的格子供人工審核。
  • API Layer:型別化的 GraphQL 與 REST API,為 React UI 與外部應用提供動力。

Who it’s for

  • Legal and Research Teams:管理大量法規、法院意見或合約檔案,需要精確交叉參照的團隊。
  • Developers:構建 AI 驅動文件智慧工具,需要有根據基底供代理人使用的開發者。
  • Knowledge Managers:維護內部政策庫或工程知識庫,文件間關係至關重要的團隊。

Highlights

  • Human-in-the-Loop:將人工註釋視為真實資料,讓 AI 在驗證過的資料上建構,而非取代。
  • MCP Integration:原生支援 Model Context Protocol,實現無縫的代理存取。
  • Version-Controlled Corpuses:支援分支、分叉與歷史追蹤,類似 git 的文件集合管理。
  • Layout-Faithful Annotation:對 PDF 進行精確的文字‑座標映射,確保註釋與原始版面保持一致。
  • Multimodal Search:結合向量嵌入與全文搜尋,跨文件與註釋進行多模態檢索。