run-llama/llama_index
LlamaIndex is the leading document agent and OCR platform
What it solves
LlamaIndex 是一個旨在通過使用私有數據增強大型語言模型 (LLM) 的數據框架。它通過提供一個用於攝取、結構化和檢索私有信息的工具包,解決了 LLM 僅限於其預訓練公共數據的問題。
How it works
LlamaIndex 提供了一套工具來彌合您的數據與 LLM 之間的差距:
- Data Connectors: 攝取來自各種來源和格式的數據 (PDFs, APIs, SQL, 等)。
- Data Structuring: 將數據組織成索引或圖,使其準備好供 LLM 使用。
- Retrieval/Query Interface: 一個高級接口,它接收 LLM 提示詞 (prompt) 並根據檢索到的私有數據返回上下文增強的輸出。
- Integrations: 無縫連接到其他應用程序框架,如 LangChain, Flask, 或 Docker。
Who it’s for
- Beginners: 可以使用高層級 API 攝取和查詢數據,只需幾行代碼即可完成的人。
- Advanced Users: 需要自定義和擴展模組,如檢索器 (retrievers)、查詢引擎 (query engines) 和重排序模組 (reranking modules) 的開發者。
Highlights
- 超過 300 個用於 LLM, embeddings, 和 vector stores 的集成包。
- 支持入門包 (
llama-index) 和自定義核心包 (llama-index-core)。 - 能夠將數據持久化到磁盤,以實現高效的重新加載。
- 與 LlamaParse 集成,用於代理式 OCR 和結構化數據提取。