
文章目录一、英伟达五大核心架构演进图二、数据中心HBM旗舰训练GPU三、数据中心GDDR推理专用GPU四、GraceGPU一体化超级芯片机架集群五、专业工作站本地AI开发GPU六、分场景选型速查表七、Hopper架构完全解析H100家族6款详解1Hopper相比前代Ampere有4个关键技术升级1.突破1第4代Tensor Core支持FP8精度2.突破2第一代Transformer Engine3.突破3HBM3显存带宽3.35TB/s4.突破4NVLink 4.0带宽900GB/s2H100 SXM vs PCIe40%性能差异的真相3H100 NVL双芯卡的94GB统一显存4H200显存升级到141GB HBM3e5H800留算力砍互联的特供逻辑6H20深度阉割的低价入门版7H100家族选型决策树八、Ampere架构全家桶A100到A2的8款选型九、Ada Lovelace L系列推理专用5款十、Blackwell家族2026旗舰三剑客十一、老架构遗留V100/T4/P系列6款十二、工作站卡RTX A/Ada系列6款十三、综合卡选型建议本文完整覆盖英伟达面向AI场景全产品线分为数据中心HBM训练旗舰、数据中心GDDR推理卡、Grace-GPU一体化超级芯片、专业工作站GPU四大板块。同时概述英伟达五大核心架构演进及针对不同应用场景的产品选型。一、英伟达五大核心架构演进图右下角是推理token成本降至Blackwell 1/10二、数据中心HBM旗舰训练GPU三、数据中心GDDR推理专用GPU四、GraceGPU一体化超级芯片机架集群五、专业工作站本地AI开发GPU六、分场景选型速查表七、Hopper架构完全解析H100家族6款详解1Hopper相比前代Ampere有4个关键技术升级1.突破1第4代Tensor Core支持FP8精度Ampere的Tensor Core只支持到FP16Hopper往下砍一半到FP8。FP8算力达到1979 TFLOPS是FP16(989T)的2倍。原理和Blackwell的FP4一样精度降低同一个周期可以算更多数。2.突破2第一代Transformer Engine这是Hopper最大的创新。Transformer Engine是硬件层面的自动混合精度引擎专门为Transformer模型优化每一层网络动态选择FP8或FP16精度硬件实时统计数值分布避免FP8溢出相比纯FP16训练速度快2倍精度损失0.1%3.突破3HBM3显存带宽3.35TB/sA100用HBM2e带宽2.0TB/s。H100升级到HBM3带宽3.35TB/s提升67%。推理场景下带宽提升直接转化为tokens/s提升。4.突破4NVLink 4.0带宽900GB/sA100的NVLink 3.0是600GB/sH100的NVLink 4.0升级到900GB/s。8卡训练时NVLink负责卡间通信带宽越高多卡扩展效率越高。3和4不同虽然都叫带宽2H100 SXM vs PCIe40%性能差异的真相H100有两个接口版本SXM和PCIe。看参数表算力差24%但实际训练性能差距更大。为什么实际性能差距比账面大单卡推理带宽瓶颈PCIe的2.0TB/s比SXM慢40%推理tokens/s也慢约18%实测82%相对性能单卡训练算力和带宽双重影响PCIe慢22%左右实测78%相对性能8卡训练没有NVLink只能走PCIe 5.0128GB/s卡间通信慢7倍。多卡扩展效率从SXM的90%掉到PCIe的40%整体性能只有SXM的45%3H100 NVL双芯卡的94GB统一显存H100 NVL是特殊的双芯卡一张卡上封装2颗H100芯片用NVLink桥接成统一显存。H100 NVL的独特之处两颗芯片用NVLink-C2C桥接形成188GB统一显存对软件透明看起来就像一张188GB显存的单卡专为超大模型推理设计Llama-70B FP16需140GBH100 SXM装不下NVL可以训练场景不推荐 两芯片之间有NVLink延迟不如2张独立SXM灵活实战案例某公司部署Llama-70B推理服务FP16权重需140GB显存。H100 SXM只有80GB必须用2张做张量并行通信开销大。换H100 NVL单卡188GB装下整个模型推理速度快35%省了张量并行的卡间通信。但NVL价格是SXM的1.8倍适合对延迟敏感的场景。4H200显存升级到141GB HBM3eH200是H100的显存升级版算力不变显存从80GB升级到141GB。H200的设计逻辑算力不变专注解决显存瓶颈HBM3e是HBM3的改进版容量提升76%带宽提升43%推理场景受益最大带宽提升43%推理tokens/s也提升40%左右训练场景可以用更大的batch size或者跑更大的模型H200 vs H100 NVL的选择H200141GB单卡带宽4.8TB/s价格30万H100NVL188GB双芯总带宽6.7TB/s但芯片间有NVLink延迟价格45万推理70B模型H200够用性价比更高推理175B模型H200装不下需350GB必须用NVL或多卡5H800留算力砍互联的特供逻辑H800是针对中国市场的特供版核心设计思路保留算力砍掉高速互联。为什么这么设计单卡算力保留推理和单卡微调不受影响NVLink砍到400GB/s多卡训练扩展效率从90%降到70%左右8卡以下规模影响不大64卡以上规模性能明显下降限制超大规模集群训练能力但不影响常规应用实际影响选型建议H800适合推理和中小规模训练8卡以下。如果要训练千亿参数模型需要64卡以上H800的NVLink瓶颈会导致35%性能损失这时候改用昇腾910B或海光DCU性价比更高。6H20深度阉割的低价入门版H20是H800的进一步阉割版砍算力到30%但保留96GB显存。H20的设计逻辑算力砍到296T比A100还低A100是312T显存反而加到96GB比H100多20%带宽提升到4.0TB/s推理不完全受算力瓶颈定位推理专用的低价选择H20 vs L40S对比H20的96GB显存可以跑Llama-70B FP16需140GB但用量化到INT8只需70GBL40S的48GB装不下。推理带宽H20是L40S的4.6倍tokens/s也快4倍左右。选型建议H20适合推理70B模型显存够用带宽高。但训练场景算力太低296T比昇腾910B的384T还低不推荐。如果推理40B以下模型L40S性价比更高价格便宜4万。H800的思路是留算力砍互联——单卡989 TFLOPS一分没少NVLink从900GB/s砍到400GB/s。单卡和小集群几乎无感一上多机多卡的大规模训练就露馅。H20反过来砍算力留显存——FP16只剩148 TFLOPS是H100的1/6还不到但96GB显存、4.0TB/s带宽都比H100 SXM更高。这个设计其实很懂行推理速度由带宽决定而不是算力第2篇讲过。H20砍掉的是训练最吃的算力保住的是推理最吃的带宽。所以它在国内被大量买去做推理是合规限制下的理性选择7H100家族选型决策树场景1推理7B-13B模型优先L4(72W低功耗)或L40S(48GB显存)H100系列性能过剩不划算场景2推理70B模型预算充足H100 SXM或H200带宽最高tokens/s最快预算有限H2096GB显存4.0TB/s带宽价格12万不推荐H100 PCIe带宽2.0TB/s太低场景3推理175B模型单卡方案H100 NVL188GB统一显存多卡方案2-4张H200做张量并行H100 SXM需要3张做张量并行通信开销大场景4训练70B以下模型8卡以下H800够用性价比高单卡微调H100 PCIe或H20都可以省电费不需要上H100 SXM场景5训练175B以上模型64卡以上规模必须H100 SXM或H200NVLink 900GB/sH800的400GB/s NVLink会导致35%性能损失或者改用国产方案昇腾910C或海光DCU场景6预算紧张推理H2012万或二手A1008万训练二手A1008万或昇腾910B10万H100 PCIe不推荐20万但多卡训练性能崩盘快速决策公式单卡推理 → 看带宽H200 H100 SXM H20 H100 PCIe单卡训练 → 看算力H100/H200/H800 H100 PCIe H208卡训练 → 看NVLinkH100 SXM(900) H800(400) H100 PCIe(无)64卡训练 → 必须H100 SXM或H200其他都不行超大模型推理 → 看显存H100 NVL(188GB) H200(141GB) H20(96GB) H100(80GB)八、Ampere架构全家桶A100到A2的8款选型Ampere架构2020-2021是上一代通用GPU覆盖从数据中心训练到边缘推理的全场景。A16的特殊设计一张卡上4颗GPU各带16GB不是给单任务用的是给4个虚拟机分的。做云桌面、多用户共享的场景才用得上拿来跑大模型反而不如一张A10。选型建议A100至今仍是主力训练卡二手市场价格合理。A10是云推理的绝对主力性价比高。A2适合边缘部署功耗只有60W。九、Ada Lovelace L系列推理专用5款L系列是Ada Lovelace架构的数据中心版本专门为推理优化不适合训练。L系列的推理优势Ada架构的Tensor Core针对INT8/FP8推理优化L40S的INT8算力高达1466 TOPS。功耗比Ampere低30%适合大规模推理集群。L20/L2中国特供版和H20同批推出思路一致降低算力以符合出口管制。国内云厂商的推理实例里能看到它们。十、Blackwell家族2026旗舰三剑客Blackwell架构是NVIDIA 2026年的新旗舰核心升级是第二代Transformer Engine支持FP4精度算力直接翻倍。常见误解B100和B200的显存容量完全相同都是192GB HBM3e、8TB/s带宽。两者差的是功耗墙——B100限在700W能沿用H100的风冷机架B200放到1000W算力更高但必须上液冷。所以B100不是低配版是能塞进你现有机房的版本。GB200的定位特殊它不是一张卡是1颗Grace CPU配2颗B200的超级芯片模组。再往上是NVL72整机柜36个GB200共72颗GPU。这一层已经不按卡卖了按机柜卖起步就是千万级预算。选型建议2026年新项目如果预算充足B200是首选——算力4500 TFLOPSFP8是H100的2.3倍。如果现有机房只有风冷选B100。GB200只适合超大规模训练集群。十一、老架构遗留V100/T4/P系列6款这些是2017-2019年的老架构产品新项目不建议采购但二手市场和遗留部署仍然活跃。V100Volta16/32GB HBM2第一代Tensor Core125 TFLOPS FP16跑7B-13B微调还够用。缺点是不支持BF16新框架的算子逐渐不再优化它T4 / T4GTuring16GB GDDR670W半高卡曾是云推理的绝对主力视频转码能力强。现在被L4取代但存量巨大云上仍是最便宜的GPU选项P100Pascal16GB HBM2有FP16支持但没有Tensor Core跑Transformer效率很低P40 / P4Pascal24GB/8GB GDDR5只有INT8推理能力无FP16 Tensor Core。P40曾用于推理部署现在已被淘汰二手市场建议V100如果价格在A100的1/4以下可以考虑做小模型微调开发机。T4适合极致省电的边缘部署。P系列不建议为AI用途新购。二手市场建议V100如果价格在A100的1/4以下可以考虑做小模型微调开发机。T4适合极致省电的边缘部署。P系列不建议为AI用途新购。十二、工作站卡RTX A/Ada系列6款这些是专业工作站显卡支持CUDA和Tensor Core单机开发可以生产集群会翻车。工作站卡的两个坑没有NVLinkAda代取消了——多卡只能走PCIe扩展效率很差。A6000两张卡做70B训练扩展效率只有单卡的60%。涡轮散热不适合7×24——工作站卡用涡轮散热在密集机架里容易过热降频。数据中心卡是被动散热能7×24跑。选型建议做开发机可以价格比数据中心卡低30%。但做生产集群会后悔——散热、多卡扩展都是问题。十三、综合卡选型建议步骤1确定应用场景千亿参数训练H100/H200/B200必须SXM版本70B以下训练A100 80GB或H100 PCIe大模型推理70BH200显存够或H100 NVL双卡模组中小模型推理7B-30BL40S/L40/A10边缘推理7B以下L4/T4/A2本地开发调试RTX A6000/A5000步骤2检查地域合规如果在中国大陆部署H100→H800或H20L40S→L20L4→L2。H800适合小规模训练H20适合推理。步骤3算显存和算力需求用第20篇的公式显存 参数量×2FP16算力 (2×参数量)÷延迟。确保选的卡两个指标都满足。步骤4看预算和可用性2026年H100/H200供应紧张交付周期3-6个月。A100现货充足二手市场成熟。B200要等到2026年Q3。