跳转至
GPU 芯片全栈知识体系(原厂视角)
实验概览
正在初始化搜索引擎
GPU 芯片全栈知识体系(原厂视角)
首页
总览与路线
知识体系与面试复习
01 GPU 总体架构
01 GPU 总体架构
GPU 芯片定义与 PPA
Block Diagram 与 GPC/SM 拓扑
PCIe BAR 空间与 MMIO 映射
架构启动与 Bring-up 故障案例
算力、面积与显存带宽推演
Clock Power Domains 时钟电源域
软硬件交互边界与执行模型
流片与 Bring-up 方法论
审阅、调试与自测
02 计算核心与 SIMT
02 计算核心与 SIMT
SIMT 执行模型与线程映射
Warp 调度器与 Scoreboard
寄存器堆微架构与 Spill
ALU FPU 与 Tensor Core
分支分化与重聚机制
计算核心工程问题与规避
03 显存系统与存储层次
03 显存系统与存储层次
HBM3e 与 GDDR7 显存物理层
L2 Cache 与 Shared Memory
Bank Conflict 与 Coalescing
显存系统故障案例与排查
显存容量与 Bank 冲突定量计算
Cache 一致性与原子操作
存储系统工程问题与规避
04 地址空间与统一内存
04 地址空间与统一内存
GPU MMU 与 TLB 架构
UVM 与 Page Fault 处理
ATS PASID 与异构共享 SVM
地址翻译工程问题与规避
UVM 缺页风暴与 Fault 现场定位
页表层级与 TLB 命中率定量推演
05 片上与片间高速互联
05 片上与片间高速互联
PCIe Gen5/Gen6 物理与事务层
NVLink 与 Infinity Fabric
NVSwitch 交换架构与拓扑
高速互联工程问题与规避
互联链路协商与 CRC 错误排查
NVLink 传输开销与带宽推导
06 异步数据搬运与 DMA
06 异步数据搬运与 DMA
Copy Engine 硬件架构
GPUDirect RDMA 与 Storage
异步 Stream 与 CUDA Graph
DMA 搬运工程问题与规避
GPUDirect 死锁与 DMA 同步案例
Copy Engine 重叠效率定量推导
07 频率功耗与电源管理
07 频率功耗与电源管理
DVFS 与 P-States 状态机
Thermal Throttling 与温控
PMU 固件与 Power Capping
电源功耗工程问题与规避
浪涌电流掉电与过温降频案例
DVFS 功耗能效与热阻定量模型
08 图形与专用引擎
08 图形与专用引擎
光栅化与 RT Core 光追
NVENC NVDEC 视频编解码器
Display Engine 显示引擎
专用引擎工程问题与规避
编解码器死锁与显示撕裂排查
RT Core 求交与编解码吞吐推导
09 驱动与软件运行时
09 驱动与软件运行时
Linux KMD DRM/KMS 架构
UMD Ring Buffer 与命令提交
LLVM 后端与 PTX/SASS 编译
驱动与运行时工程问题与规避
Fence 超时与 Kernel Panic 诊断
UMD 零系统调用提交延迟计算
10 调试性能与故障分析
10 调试性能与故障分析
Roofline 算力与带宽分析
NSight 性能计数器采样
GPU Hang 与 XID 故障诊断
性能调优工程问题与规避
GPU 故障诊断 Xid 报错定位实战
采样与 Warp Occupancy 理论建模
11 多卡集群与分布式并行
11 多卡集群与分布式并行
NCCL 集合通信与拓扑算法
3D 并行与大模型训练映射
Scale-Out 集群网络与 RoCE
集群通信工程问题与规避
集群 NCCL Timeout 卡死定位实战
3D 并行显存占用与通信量推导
跨模块工程案例
跨模块工程案例
FlashAttention 硬件执行路径
PCIe P2P 零拷贝事务流
8卡 GPU AllReduce 通信流
GEMM 从提交到性能证据
横向专题
横向专题
GPU 虚拟化与 MIG 切分
PTX 弱内存模型与 Barrier
机密计算与显存硬件加密
芯片 RAS 与坏块自愈
实验
实验
CUDA GEMM 算子极致调优
NSight Roofline 实战分析
开源 GPU 驱动提交跟踪
术语表
文档站使用说明
可复现实战实验
¶
lab01: CUDA GEMM 算子极致调优
lab02: NSight Roofline 实战分析
lab03: 开源 GPU 驱动提交跟踪
回到页面顶部