跳转至

Silicon Architecture / GPGPU System Atlas

GPU System Atlas

从芯片原厂视角出发,系统梳理 GPU 从 SIMT 微架构、Warp 调度与 Tensor Core,到 HBM3e/GDDR7 显存系统、PCIe/NVLink 高速互联、Linux KMD/UMD 驱动、PTX/SASS 编译器后端,再到 NCCL 多卡集群与算子极致性能调优的全栈工程地图。

11核心模块 100篇文档 52张架构图 3个实验

Hardware Flow / 01

看一个 Kernel 指令与张量数据如何流过整颗 GPU。

这是以 NVIDIA 术语为例的阅读路径,不是全部数据必经的串行通路。Copy Engine 的并发能力、MMU/UVM 的地址与驻留管理、跨卡互联及功耗控制,需要按目标设备分别确认。

Reading Routes / 02

按工程角色与研发场景,选择最适合的学习路线。

Core Modules / 03

十一个模块,拼合现代高性能 GPU 的完整硅片画像。

Practice / 04

把微架构理论放回全链路端到端案例与可复现源码实验。

文档约定与原厂工程“七问”

先从 知识体系与面试复习 检查掌握标准,再用 GEMM 完整证据链 串联章节。文档计数包含首页、模块索引与实验说明,不代表全部都是独立深度文章。

本知识库以以下 7 个问题作为持续完善标准,不代表每篇现有笔记都已经完成全部工程验证:

  1. 硬件解决什么问题:该模块在算力吞吐、访存带宽、功耗控制或互联扩展中的根本职责。
  2. 硬件微架构与组成:数字电路模块如何划分,与 NoC/Crossbar/总线如何连接。
  3. 软件可见接口:KMD/UMD/编译器能看到的寄存器、BAR 空间、指令格式与描述符结构。
  4. 四流全链路分析:地址流、数据流、控制流、事件/中断/DMA 流如何在硬件管道中流转。
  5. 软硬件设计约束:面积(PPA)、时序收敛、功耗上限、Bank 冲突与一致性限制。
  6. 现场排错与调试清单:面对硬件 Hang 死、数据踩踏(Mismatch)、性能断崖时的系统化排查步骤。
  7. 实验与验证推演:如何通过 C-Model / 周期精确仿真器(GPGPU-Sim / Accel-Sim)或实卡验证。

阅读说明与免责声明

文档中的地址、寄存器偏移和微架构参数若无特别说明,均用于解释工业界通用 GPU 架构机制,不对应特定商业芯片私密设计。实际工程项目应以目标 GPU 芯片的 TRM、官方数据手册、架构白皮书和勘误表(Errata)为准。