03 8卡 GPU AllReduce 集合通信数据流全链路推演¶ 1. 通信与计算阶段状态机¶ 以 8 卡 NVLink 环形拓扑为例,分为两个核心阶段: 1. Reduce-Scatter 阶段:各 GPU 顺时针传递分片并在本地执行向量累加,经过 7 步后,每张卡获得全局累加结果的 $rac{1}{8}$。 2. All-Gather 阶段:各 GPU 继续顺时针广播自己持有的这 $rac{1}{8}$ 结果,再经过 7 步后,所有 8 张卡均持有完整的全量同步数据。