amitshekhariitbhu/ai-system-design
AI System Design - Learn how to design AI systems built on LLMs, RAG, and AI Agents step by step.
AI System Design – 此仓库的内容
类型: 开源学习指南(以 Markdown 为主的仓库)
范围: 涵盖整个 AI 系统设计 领域 – 从 LLM 推理机制、硬件选择、缓存、路由、RAG,到代理、多代理协调、多模态/语音管道、安全护栏、可观测性、成本优化及面试准备。
为何纳入范围: 此仓库是一个精心策划、持续更新的文章、图表及链接集合,教导如何构建生产级 AI 服务。所有主题都与现代 AI/LLM 工程直接相关,因此符合真正的 AI 导向教育项目资格。
快速摘要
- 一份逐步指南,适用于想要设计、部署及扩展以大型语言模型为核心的 AI 系统的工程师。
- 组织为一份长篇 Markdown 文档,包含详细的目录,链接至每个子主题的深入博客文章。
- 涵盖基础(token、GPU、推理服务器)→ 核心工程(扩展、缓存、路由、RAG)→ 进阶层(代理、多代理系统、多模态、安全性、可观测性、成本、微调)→ 面试框架。
- 为初学者撰写,避免行话,并包含真实世界的数字、工具及架构图。
- 由 Amit Shekhar(Outcome School 创始人)维护,并交叉链接至其教学平台及相关 AI 工程课程。
谁可能使用此资源
| 受众 | 他们获得什么 |
|---|---|
| 转入 AI 的软件工程师 | 从基本 token 经济学到生产级管道的清晰蓝图。 |
| 后端 / 移动 / 前端开发人员 | 关于整合 LLM 推理、流式、速率限制及网关的实用指引。 |
| ML / 数据科学家 | 将模型从研究转移至可扩展服务堆栈的步骤(GPU 尺寸调整、量化等)。 |
| 工程经理与架构师 | 针对硬件、并行处理、缓存及成本优化的决策框架。 |
| 学生与面试准备者 | 一个专门章节,使用可重复的 8 步骤方法解决 AI 系统设计面试问题。 |
核心内容重点
- LLM 推理机制 – Prefill 与 decode、TTFT、TPS、KV-cache、chunked prefill 及 disaggregation。
- 扩展策略 – 垂直与水平扩展、tensor 与 pipeline 并行处理、自动扩展暖池。
- 缓存层 – KV-cache、prompt cache、semantic cache、embedding cache 及压缩技术。
- 路由与负载均衡 – 基于规则、基于分类器、基于 embedding、LLM-as-router 及串联路由。
- RAG 与向量数据库 – 索引类型、混合搜索、HyDE 查询转换、重新排序、GraphRAG、无向量 RAG。
- 上下文管理 – 窗口轮替、RoPE 衰减、摘要、层级式内存。
- 代理架构 – 五个核心部分、循环工程、工具调用、Model Context Protocol (MCP)、内存堆栈。
- 多代理系统 – 协调模式、A2A 协议、子代理、取舍。
- 多模态与语音 – 边缘 AI、延迟预算、barge-in、通过 SSE/WebSockets 流式。
- 安全性与合规 – 护栏、提示注入、红队测试、水印、PII 编辑、审计日志。
- 可观测性与评估 – 追踪、span、LLM-as-judge、代理评估管道。
- 成本优化 – 模型选择、缓存、批量推理、更便宜的检索、自托管。
- 面试框架 – 8 步骤问题解决方法、真实世界案例研究(Claude Code、Cursor、语音 AI)、常见问题。
如何开始
- 克隆仓库并打开
README.md– 目录让您跳至任何主题。 - 遵循学习路径(Mermaid 图表),如果您是新手:从基础 → LLM 推理 → 扩展 → … → 面试。
- 深入博客从每个章节链接;阅读以获取具体示例、代码片段及架构图。
- 应用:每个章节后,尝试用自己的话解释概念,或原型化一个小型版本(例如 KV-cache 演示或简单的 RAG 管道)。
许可证
此仓库以开源许可证发布(请参阅 README 结尾的 License 章节),允许自由重用与修改。
底线: AI System Design 是一份全面、对初学者友好、开源的指南,教导工程师如何构建、扩展及维护以 LLM 和代理为核心的生产 AI 系统。这是一个在 AI 系统领域中真正的教育项目。
相关
- 项目
- 项目
- 项目
- 项目