amitshekhariitbhu/ai-system-design

AI System Design - Learn how to design AI systems built on LLMs, RAG, and AI Agents step by step.

AI System Design – 此儲存庫的內容

類型: 開放原始碼學習指南(以 Markdown 為主的儲存庫)
範圍: 涵蓋整個 AI 系統設計 領域 – 從 LLM 推論機制、硬體選擇、快取、路由、RAG,到代理、多代理協調、多模態/語音管道、安全護欄、可觀測性、成本最佳化及面試準備。

為何納入範圍: 此儲存庫是一個精心策劃、持續更新的文章、圖表及連結集合,教導如何建置生產級 AI 服務。所有主題都與現代 AI/LLM 工程直接相關,因此符合真正的 AI 導向教育專案資格。


快速摘要

  • 一份逐步指南,適用於想要設計、部署及擴展以大型語言模型為核心之 AI 系統的工程師。
  • 組織為一份長篇 Markdown 文件,包含詳細的目錄,連結至每個子主題的深入部落格文章。
  • 涵蓋基礎(token、GPU、推論伺服器)→ 核心工程(擴展、快取、路由、RAG)→ 進階層(代理、多代理系統、多模態、安全性、可觀測性、成本、微調)→ 面試框架。
  • 為初學者撰寫,避免行話,並包含真實世界的數字、工具及架構圖。
  • 由 Amit Shekhar(Outcome School 創辦人)維護,並交叉連結至其教學平台及相關 AI 工程課程。

誰可能使用此資源

受眾 他們獲得什麼
轉入 AI 的軟體工程師 從基本 token 經濟學到生產級管道的清晰藍圖。
後端 / 行動 / 前端開發人員 關於整合 LLM 推論、串流、速率限制及閘道的實用指引。
ML / 資料科學家 將模型從研究轉移至可擴展服務堆疊的步驟(GPU 尺寸調整、量化等)。
工程經理與架構師 針對硬體、平行處理、快取及成本最佳化的決策框架。
學生與面試準備者 一個專門章節,使用可重複的 8 步驟方法解決 AI 系統設計面試問題。

核心內容重點

  1. LLM 推論機制 – Prefill 與 decode、TTFT、TPS、KV-cache、chunked prefill 及 disaggregation。
  2. 擴展策略 – 垂直與水平擴展、tensor 與 pipeline 平行處理、自動擴展暖池。
  3. 快取層 – KV-cache、prompt cache、semantic cache、embedding cache 及壓縮技術。
  4. 路由與負載平衡 – 基於規則、基於分類器、基於 embedding、LLM-as-router 及串聯路由。
  5. RAG 與向量資料庫 – 索引類型、混合搜尋、HyDE 查詢轉換、重新排序、GraphRAG、無向量 RAG。
  6. 上下文管理 – 視窗輪替、RoPE 衰減、摘要、階層式記憶體。
  7. 代理架構 – 五個核心部分、迴圈工程、工具呼叫、Model Context Protocol (MCP)、記憶體堆疊。
  8. 多代理系統 – 協調模式、A2A 協定、子代理、取捨。
  9. 多模態與語音 – 邊緣 AI、延遲預算、barge-in、透過 SSE/WebSockets 串流。
  10. 安全性與合規 – 護欄、提示注入、紅隊測試、浮水印、PII 編輯、稽核日誌。
  11. 可觀測性與評估 – 追蹤、span、LLM-as-judge、代理評估管道。
  12. 成本最佳化 – 模型選擇、快取、批次推論、更便宜的檢索、自架。
  13. 面試框架 – 8 步驟問題解決方法、真實世界案例研究(Claude Code、Cursor、語音 AI)、常見問題。

如何開始

  1. 複製儲存庫並開啟 README.md – 目錄讓您跳至任何主題。
  2. 遵循學習路徑(Mermaid 圖表),如果您是新手:從基礎 → LLM 推論 → 擴展 → … → 面試。
  3. 深入部落格從每個章節連結;閱讀以取得具體範例、程式碼片段及架構圖。
  4. 應用:每個章節後,嘗試用自己的話解釋概念,或原型化一個小型版本(例如 KV-cache 示範或簡單的 RAG 管道)。

授權

此儲存庫以開放原始碼授權發布(請參閱 README 結尾的 License 章節),允許自由重用與修改。


底線: AI System Design 是一份全面、對初學者友善、開放原始碼的指南,教導工程師如何建置、擴展及維護以 LLM 和代理為核心的生產 AI 系統。這是一個在 AI 系統領域中真正的教育專案。

相關

  • 專案
  • 專案
  • 專案
  • 專案