Nvidia 的新型 Rubin GPU 利用软件模拟来增强 HPC 的 FP64 性能,挑战 AMD 最近在该领域的领先地位,尽管 AMD 对该方法的实际适用性表示保留。
双精度浮点计算 (FP64) 对于现代 HPC 和科学计算应用至关重要。 Nvidia 新推出的 Rubin GPU 在没有仿真的情况下提供了 33 teraFLOPS 峰值 FP64 性能,比推出四年的 H100 少了 1 teraFLOP。据报道,通过 Nvidia CUDA 库中启用的软件模拟,该芯片可以实现高达 200 teraFLOPS 的 FP64 矩阵性能。这比即将推出的 Blackwell 加速器的硬件功能提高了 4.4 倍。
Nvidia 超级计算产品高级总监 Dan Ernst 表示:“通过与合作伙伴的大量研究以及我们自己的内部调查,我们发现,我们从仿真中获得的精度至少与我们从张量核心硬件中获得的精度一样好。”
AMD 研究员 Nicholas Malaya 指出:“它在某些基准测试中相当不错,但在真实的物理科学模拟中并不明显。” Malea 建议 FP64 仿真需要进一步研究和实验。
由于其动态范围,FP64 仍然是科学计算的标准,能够表达超过 18.44 quintillion (264) 的唯一值。相反,像 DeepSeek R1 这样的现代 AI 模型经常在 FP8 上进行训练,它可以表达 256 个唯一值。与 AI 工作负载不同,HPC 模拟依赖于基本的物理原理,因此具有容错能力。马来亚解释说:“一旦开始出现错误,这些有限的错误就会传播,并导致爆炸等事情。”
使用低精度数据类型来模拟 FP64 的概念并不新鲜。 Ernst 提到,“仿真非常古老。我们在 50 年代中期就有了仿真,当时我们还没有浮点硬件。” 2024 年初,东京和芝浦理工学院的研究人员发表了一篇探讨这一概念的论文。他们的方法表明,FP64 矩阵运算可以分解为多个 INT8 运算,从而在 Nvidia 张量核心上实现高于本机的性能。这种方法被称为 Ozaki 方案,构成了去年年底发布的 Nvidia FP64 仿真库的基础。 Ernst 澄清说:“它仍然是 FP64。它不是混合精度。它只是从硬件角度以不同的方式完成和构建。”
现代 GPU 包含低精度张量核心。例如,Rubin 的张量核心能够进行 35 petaFLOPS 的密集 FP4 计算。在 FP64 中,这些芯片的速度慢了 1,000 倍以上。 Ernst 解释说,构建和运行这些低精度张量核心的效率促使人们探索它们在 FP64 计算中的使用。 “我们有硬件,让我们尝试使用它。这就是超级计算的历史,”他说。
AMD 对 FP64 模拟的准确性表示担忧。 Malea 引用高性能 Linpack (HPL) 基准表示,FP64 仿真对于条件良好的数值系统表现良好。然而,“当你研究材料科学、燃烧代码、带状线性代数系统等时,你会发现它们并不是条件良好的系统,突然间它开始崩溃,”他说。 Malea 指出,FP64 仿真并不完全符合 IEEE 标准,因为 Nvidia 的算法没有考虑正零、负零、数字错误或无限数字错误等细微差别。仿真中间操作中的小错误可能会导致不准确。增加操作来缓解这种情况可能会抵消性能优势。 Malaya 还报道说,“我们有数据显示,您使用 Ozaki 大约两倍的内存容量来模拟 FP64 矩阵。”因此,AMD 专注于双精度和单精度专用硬件,即将推出的 MI430X 利用小芯片架构来增强性能。
恩斯特承认英伟达的实施存在缺陷。他认为正/负零对于大多数 HPC 从业者来说并不重要。 Nvidia 开发了补充算法来检测和缓解非数字和无限数字等问题。关于内存消耗,Ernst 承认内存消耗可能会更高,但表示此开销与操作相关,而不是与应用程序相关,通常涉及几 GB 的矩阵。他还认为,在矩阵乘法情况下通常不会出现 IEEE 合规性问题。 “大多数使用 IEEE 合规性排序规则的用例都不会出现在矩阵、矩阵乘法的情况下。无论如何,没有一个 DGEMM 会真正遵循该规则,”Ernst 分享道。
FP64 仿真主要对依赖密集通用矩阵乘法 (DGEMM) 运算的 HPC 应用程序子集有效。马laya 估计,对于 60% 到 70% 的 HPC 工作负载,仿真带来的好处微乎其微。 “根据我们的分析,绝大多数实际 HPC 工作负载依赖于矢量 FMA,而不是 DGEMM,”他说。对于计算流体动力学等矢量密集型任务,Rubin GPU 在 CUDA 内核内速度较慢的 FP64 矢量加速器上运行。 Ernst 强调,较高的 FLOPS 并不总是等于有用的 FLOPS,因为内存带宽通常会限制实际性能。他引用了 TOP500 的向量密集型高性能共轭梯度基准测试,其中 CPU 通常由于其内存子系统的每 FLOPS 位数较高而领先。
随着集成 Nvidia Blackwell 和 Rubin GPU 的新型超级计算机的出现,FP64 仿真的可行性将得到测试。该算法与特定硬件的固有独立性允许随着时间的推移进行潜在的改进。 Malaya 证实,AMD 也在探索 MI355X 等芯片上的 FP64 仿真,通过软件标志来识别合适的应用程序。他表示,IEEE 合规性将通过确保仿真和专用芯片之间的结果一致来验证该方法。马拉亚表示,“如果我可以去找一个合作伙伴并说运行这两个二进制文件:这个给你的答案与另一个相同,而且速度更快,是的,在幕后我们正在做一些计划——认为这是一个令人信服的论点,已经为黄金时间做好了准备。”他补充说,特定的应用程序通过仿真可能会更可靠,并建议“作为一个社区,我们应该构建一篮子应用程序来查看。”
<小时/>








