返回前沿 AI

四个算力难题:HPC 与 AI 融合到底卡在哪一层

四个算力难题:HPC 与 AI 融合到底卡在哪一层
AI 生成摘要

茶思屋「算力会战」榜单一次性抛出分布式线性求解、稀疏矩阵混合精度、HPC+AI 实时训练、高阶 PDE 收敛加速四道题。本文只讲问题本身:为什么是这四道,它们共同的难点在哪。

此摘要由 AI 生成,仅供参考,观点与事实以正文为准。

本文是问题侧的解读笔记。榜单转述自公开渠道,文中不复述任何声称的「破解效果」数字——那些多为自媒体推断,缺乏官方口径与第三方复现。

一、四道题的原始形状

按题目本身的表述,四道题分别卡在数值计算的四个不同环节:

  1. 大规模稀疏线性方程组的分布式迭代求解与预条件子自动优选 工业仿真(CFD、结构力学)内核最终都会归约到解一次大型稀疏线性系统。难点不在迭代格式,而在「给定矩阵,自动挑出合适的预条件子」——今天仍大量依赖专家手工调参。
  2. 高鲁棒性稀疏矩阵混合精度求解 混合精度(fp16/bf16 参与部分运算)能换吞吐和显存,但稀疏矩阵一旦病态,低精度会直接让迭代崩溃。要的是一边降精度一边保证不炸。
  3. HPC + AI 协同的实时训练 科学模型(气象、环境、航天测控)要求训练/推理与物理时间步同步推进,而不是离线批量。CPU 与 NPU 的算力如何同时喂满,是调度问题而不是模型问题。
  4. 高阶 PDE(偏微分方程)的混合精度收敛加速 高阶格式在湍流、声学、高超声速仿真里是刚需,精度阶数一高,混合精度的误差传播路径就变复杂,收敛性证明随之变难。

二、为什么是这四道

把这四题并列看,会发现问题选择的内在一致性:它们全是「求解器层」的问题,而不是「模型层」或「芯片层」的问题。

  • 芯片层(NPU、超节点互连)华为这些年公开讲得很多。
  • 模型层(大模型、多模态)是全行业热点。
  • 中间的数值求解内核反而长期被 CUDA 生态和国外商业求解器(以及 OpenFOAM、SU2 这类开源 CFD 工具)的实际主导权压着。

也就是说,这四道题不是「最前沿」的问题,而是国产算力栈上最先漏水的地方:硬件买不到 / 追不上时,软件栈的每一分利用率都变成产能。

三、共同难点:误差可控性

四题里有三题直接涉及混合精度。它们共享同一个矛盾:

浮点精度是数值方法正确性证明的一部分,而不只是性能参数。

单精度迭代能不能收敛,取决于矩阵条件数、误差传播路径、迭代格式对扰动的敏感度。传统分析都建立在「舍入误差足够小可忽略」的前提上;一旦主动放大这个误差换性能,整套收敛性保证需要重建。这就是为什么这几道题在学术界也不是新问题,但工业界始终没有通用解——学术上能做特例分析,工程上要求对任意输入矩阵都稳定。

至于第一题的「自动优选」,本质是把一个 算法选择 问题转成 元学习 问题:用矩阵谱特征、稀疏结构作为输入,输出预条件子与迭代参数。这恰好是 AI 能插进 HPC 的少数几个位置之一,也解释了第三题为什么会和前两题一起出现。

四、一个可跟踪的判断标准

这四道题值不值得投入注意力,我建议看三个代理指标,而不是看任何一方的效果宣称:

  1. 有没有公开的基准算例集与参考实现。 没有可复现的题目,就没有真正的社区攻坚。
  2. 主流开源求解器是否合并相关补丁。 OpenFOAM、PETSc、Trilinos 的提交记录比新闻稿诚实。
  3. 论文里是否出现「在国产加速器上」的实测表格。 混合精度收敛性工作若只在 NVIDIA 平台上评估,说明栈仍未打通。

五、参考与延伸

本文首发于 Wentao's blog,永久链接:https://fanwentao.cn/posts/hpc-ai-four-problems/

评论