IT之家 7 月 22 日消息,英伟达昨日(7 月 21 日)发布博文,宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录,每 GPU 算力达 1648 TFLOPs(每秒万亿次浮点运算)。
IT之家注:MoE(混合专家模型)是一种机器学习模型架构。它将大型模型分割为多个更小的“专家”子网络,每次推理或训练时仅激活其中一部分。该架构旨在以更低的计算成本实现更大规模的模型容量,常用于大语言模型以提升效率。

模型预训练是指在大规模无标注数据集上,利用自监督学习方法让模型初步掌握通用的语言规律、视觉特征或常识。
在最新博文中,英伟达表示:
使用 256 块 GPU 预训练 DeepSeek-v3 671B 模型,GB300 NVL72 实现了每 GPU 吞吐 1648 TFLOPs 的全新世界纪录。在相同训练任务上,GB300 NVL72 用更少的 GPU 硬件,达到了相同的性能。
英伟达表示在过去 6 个多月时间里,通过模拟超过 25 万种不同配置,为 Blackwell 摸索发现了 38 项重大优化方案,累计进行了 140 万小时的 GPU 优化测试。

相比较 2025 年 11 月的预训练测试(1088 TFLOPs)结果,GB300 NVL72 系统性能优化提升 50%。

与上一代 GB200 每 GPU 606 TFLOPs 的成绩相比,GB300 实现了约 3 倍的性能跃升。



