NVIDIA GB300 NVL72 创下 MoE 预训练世界纪录

NVIDIA Developer Blog 2026-07-22T05:18:35.987745

前沿模型的预训练已经全面转向混合专家(MoE)架构,这从根本上改变了大规模AI训练的瓶颈所在。当每个 token 的计算量不断下降时,通信效率就越来越成为决定模型能否在数千块 GPU 上高效扩展的关键因素。NVIDIA GB300 NVL72 在预训练 DeepSeek-V3 671B 时创下了世界纪录,每块 GPU 达到 1,648 TFLOPs,展示了整个 AI 系统层面的协同进步如何带来性能突破。

查看原文