跳转至

PERSONAL KNOWLEDGE SYSTEM · AI INFRA

从 GPU 到 Token,建立完整系统视角

一套面向学习、面试与工程实践的 AI 基础设施知识库:理解计算底座,掌握分布式训练,设计高效推理服务,并用可观测性把系统真正运行起来。

ComputeGPU · CUDA · Kernel
ScaleDDP · FSDP · TP/PP
ServeKV Cache · Batching
OperateSLO · Metrics · Cost

知识地图

  • 全景与路线


    从工作负载、资源与控制面三个视角理解 AI Infra,建立可复用的学习顺序。

    进入全景图

  • 计算底座


    GPU 内存层次、互连拓扑、PCIe/NVLink、RDMA、数据与检查点 I/O。

    GPU 与系统

  • 分布式训练


    DDP、FSDP、张量/流水线并行,以及通信计算重叠与性能定位。

    并行策略

  • 推理与平台


    Prefill/Decode、KV Cache、动态批处理、Kubernetes GPU 调度与模型服务。

    LLM 推理服务

  • 稳定性工程


    从请求、模型到 GPU 的统一观测,配合容量模型、SLO 与分层排障。

    可观测性

  • 面试速查


    高频问题、回答骨架与容易混淆的术语,帮助把知识讲清楚。

    高频问题

推荐使用方式

先读全景图,再选一条主线深入;遇到新概念时,不要只记定义,始终追问它在 性能、可靠性、成本 三个维度造成了什么影响。

核心思维模型

flowchart LR
    A[工作负载<br/>训练 / 推理] --> B[并行与调度]
    B --> C[GPU / 网络 / 存储]
    C --> D[吞吐与时延]
    D --> E[可靠性与成本]
    E --> F[指标 / Trace / 日志]
    F -. 反馈优化 .-> A

知识库内容是可演进的工程笔记:每次排障补一条现象—证据—结论,每次压测记录工作负载与版本,每个架构选择都写清适用边界。