Silicon Architecture / GPGPU System Atlas
GPU System Atlas
从芯片原厂视角出发,系统梳理 GPU 从 SIMT 微架构、Warp 调度与 Tensor Core,到 HBM3e/GDDR7 显存系统、PCIe/NVLink 高速互联、Linux KMD/UMD 驱动、PTX/SASS 编译器后端,再到 NCCL 多卡集群与算子极致性能调优的全栈工程地图。
11核心模块
100篇文档
52张架构图
3个实验
Hardware Flow / 01
看一个 Kernel 指令与张量数据如何流过整颗 GPU。
这是以 NVIDIA 术语为例的阅读路径,不是全部数据必经的串行通路。Copy Engine 的并发能力、MMU/UVM 的地址与驻留管理、跨卡互联及功耗控制,需要按目标设备分别确认。
Reading Routes / 02
按工程角色与研发场景,选择最适合的学习路线。
Core Modules / 03
十一个模块,拼合现代高性能 GPU 的完整硅片画像。
01GPU 总体架构GPC · BAR · Bring-up
02计算核心与 SIMTWarp · Scoreboard · TensorCore
03显存系统与存储层次HBM3e · Bank Conflict · Coalescing
04地址空间与统一内存GPU MMU · Page Fault · ATS
05片上与片间高速互联PCIe 6 · NVLink · NVSwitch
06异步数据搬运与 DMACopy Engine · GPUDirect · Graph
07频率功耗与电源管理DVFS · PMU · Throttling
08图形视频与专用引擎Raster · RT Core · NVENC
09驱动与软件运行时体系DRM/KMS · UMD · PTX/SASS
10调试性能与故障分析Roofline · NSight · Xid Hang
11多卡集群与分布式并行NCCL · 3D 并行 · RoCEv2
Practice / 04
把微架构理论放回全链路端到端案例与可复现源码实验。
文档约定与原厂工程“七问”¶
先从 知识体系与面试复习 检查掌握标准,再用 GEMM 完整证据链 串联章节。文档计数包含首页、模块索引与实验说明,不代表全部都是独立深度文章。
本知识库以以下 7 个问题作为持续完善标准,不代表每篇现有笔记都已经完成全部工程验证:
- 硬件解决什么问题:该模块在算力吞吐、访存带宽、功耗控制或互联扩展中的根本职责。
- 硬件微架构与组成:数字电路模块如何划分,与 NoC/Crossbar/总线如何连接。
- 软件可见接口:KMD/UMD/编译器能看到的寄存器、BAR 空间、指令格式与描述符结构。
- 四流全链路分析:地址流、数据流、控制流、事件/中断/DMA 流如何在硬件管道中流转。
- 软硬件设计约束:面积(PPA)、时序收敛、功耗上限、Bank 冲突与一致性限制。
- 现场排错与调试清单:面对硬件 Hang 死、数据踩踏(Mismatch)、性能断崖时的系统化排查步骤。
- 实验与验证推演:如何通过 C-Model / 周期精确仿真器(GPGPU-Sim / Accel-Sim)或实卡验证。
阅读说明与免责声明
文档中的地址、寄存器偏移和微架构参数若无特别说明,均用于解释工业界通用 GPU 架构机制,不对应特定商业芯片私密设计。实际工程项目应以目标 GPU 芯片的 TRM、官方数据手册、架构白皮书和勘误表(Errata)为准。