FEATURED · 精选文章

AMD EPYC 9005系列与Altus HPC服务器:Zen 5架构的全面升级

发布时间 / 2026/8/28 20:12:33
来源 / 创域科博编辑部
栏目 / 资讯中心
AMD EPYC 9005系列与Altus HPC服务器:Zen 5架构的全面升级 1. 看懂这次升级的分量EPYC 9005系列到底改了什么先说结论这次Penguin Solutions更新的Altus HPC服务器产品线本质上是一套围绕AMD新一代EPYC 9005系列处理器代号TurinZen 5架构做的全面整机方案升级。如果你常年混迹HPC圈子应该对Penguin这个名字不陌生。这家公司前身是Penguin Computing后来归入SGHSmart Global Holdings旗下一直专注在高性能计算集群和超算整机交付的方向。它的Altus系列服务器其实核心就做一件事把高密度的计算节点、高速互联网络、存储和集群管理软件打包成一套能直接交付给科研院所、超算中心和大型企业的整机方案。所以看到Next-Gen Altus HPC Servers这个新闻时第一反应不是哦又有新服务器了而是要去看清楚——EPYC 9005系列本身到底带来了什么变化才值得整条产品线更新一遍。1.1 从Genoa到TurinZen 5架构带来的核心变化AMD EPYC 9005系列代号Turin是继GenoaEPYC 9004系列之后的新一代数据中心处理器。这一代最核心的变化是全线换上了Zen 5架构。Zen 5相比Zen 4在IPC每时钟周期指令数上的提升AMD官方的数据是约16%如果是单线程应用场景部分负载下提升幅度还会更大。这个数字看起来不是那种翻倍式的惊艳但落实到HPC场景里意义非常实际很多科学计算程序、CAE仿真软件、分子动力学代码瓶颈并不在多核并行而在于单核性能和多核间的调度效率。IPC提升16%意味着同一个License授权下原来跑24小时的仿真作业现在可能缩短到20小时出头这对企业用户来说节省的是真金白银的机时成本。另外一个关键变化是AVX-512。Zen 5上AMD把AVX-512指令的处理通路从Zen 4的两个256-bit组合升级成了完整的512-bit数据通路。这对HPC太重要了。很多科学计算核心库——比如Intel MKL、AMD BLIS、OpenBLAS、FFTW——在高精度矩阵运算和傅里叶变换里都会走到AVX-512这条指令路径上。Zen 5的完整512-bit AVX-512意味着执行这类指令时不再需要拆分成两个周期完成寄存器压力更小功耗表现也更稳定。实测下来对以浮点运算为核心的负载这一项的收益通常比理论IPC提升还要明显。1.2 核心数、内存带宽与平台延续性数字背后意味着什么除了架构升级EPYC 9005系列的规格上限也进一步拉高了。以旗舰型号EPYC 9965为例做到了192核心384线程基础频率2.25GHz最大TDP 500W。对比上一代Genoa最高96核核心数整整翻了一倍。如果单纯看多核跑分可能觉得只是数字变了。但从系统集成商的角度这个变化带出了一连串连锁问题单节点能承载的虚拟机/容器密度更高、单机箱能替代过去两台甚至三台服务器的算力、机架内的计算密度大幅提升但与此同时供电和散热的压力也集中到了单个机箱上。内存方面EPYC 9005系列继续采用12通道DDR5设计支持DDR5-6000。这不是新的变化但值得强调的是12通道DDR5-6000能提供约576GB/s的内存带宽。在HPC里内存带宽往往是比峰值算力更实际的约束——很多真实世界的科学计算程序远没有到CPU算力瓶颈而是卡在数据搬运上。带宽越大内存密集型负载的收益越直接。再说一个容易被忽略但非常重要的点EPYC 9005系列依然沿用SP5平台。这就意味着如果你现在手里有基于EPYC 9004Genoa的服务器节点在多数情况下可以通过更新BIOS和固件直接换成新的9005系列处理器而不需要更换主板、机箱和大部分基础设施。这种平台兼容性直接影响的是新一代Altus服务器的工程难度和交付周期——Penguin不用从零设计主板和机箱结构可以把更多精力投入到散热、存储和网络等系统的优化上。对比维度EPYC 9004 (Genoa)EPYC 9005 (Turin)架构Zen 4Zen 5最高核心数96核192核内存通道12通道DDR5-480012通道DDR5-6000AVX-512数据通路2x256-bit512-bit插槽SP5SP5IPC提升基准约16%2. Altus服务器的形态选择为什么整机方案比攒机更适合HPCAltus系列在Penguin的产品线里从来不是一款单一的服务器型号而是一个覆盖不同应用场景的家族。这次更新的Next-Gen Altus HPC Servers核心是在统一的AMD EPYC 9005平台上提供多种节点形态——从面向通用计算的2U双路风冷节点到面向高密度AI训练场景的4U八卡GPU节点再到整柜交付的液冷方案。2.1 液冷不再是可选配件而是高密度节点的刚需如果你过去几年一直在关注HPC服务器的演进肯定会注意到一个趋势单节点功耗的增速远超机柜散热能力的提升速度。EPYC 9965这种500W TDP的处理器配合高功耗GPU比如单卡350W以上的加速卡一台4U节点轻松突破3kW-4kW。传统风冷机柜满打满算散热能力大约在15-20kW左右。如果你想在一个机柜里塞进8台这样的高密度节点风冷是完全扛不住的。这就是为什么新一代Altus服务器的液冷方案不再是选配而是高密度场景下的刚需。从工程角度看冷却液分配单元CDU、冷板、管路快速接头和漏液检测这些都是需要在整机设计阶段就考虑进去的而不是到了机房现场再想办法改造。Penguin这类老牌HPC集成商的价值恰恰体现在这里——他们能把液冷基础设施和节点做成一个整体方案交付而不是让用户自己拼凑。我一贯的看法是如果你部署密度没有超过15kW/柜风冷仍然是成本更低、运维更简单的选择但一旦超过这个阈值液冷带来的不只是散热能力的提升还有功耗的下降——因为风冷风扇的功耗在高转速下相当可观而液冷系统整体PUE可以做得更低。2.2 计算、存储、网络的集成深度才是Altus真正要解决的问题HPC整机方案和普通服务器攒机最大的区别是存储和网络。单台服务器的算力再强如果数据喂不进去或者搬不出来整个系统都是空转。EPYC 9005系列支持128条PCIe 5.0通道这对存储和网络拓展来说是巨大的优势。PCIe 5.0的单条通道带宽是32GT/s约4GB/s单向128条通道意味着总双向带宽超过1TB/s。这些通道可以灵活分配给高性能网卡比如InfiniBand NDR 400Gbps或RoCE v2、NVMe存储阵列以及GPU加速卡。Altus新一代节点的典型配置思路通常会这样做计算网络使用InfiniBand NDR或400G RoCE保证多节点MPI通信不卡脖子。存储网络独立的NVMe-oF架构避免计算流量和存储流量互相干扰。管理网络低带宽的千兆或万兆网口用于IPMI/Redfish带外管理。这些设计经验不是看参数表能看出来的。你做单节点测试时可能完全感受不到差异但一到大规模集群100节点同时跑MPI作业时网络拓扑和存储路径设计的优劣立刻见分晓。3. 对HPC负载的实际价值别被核心数骗了很多人在看EPYC 9005参数时注意力全被192核心吸引过去了但实际部署HPC应用时核心数不是衡量收益的唯一指标。我接触过不少用户从老的EPYC 7002/7003系列甚至Intel Xeon平台迁移过来第一反应是核多了这么多性能应该翻倍了吧实际上往往达不到预期。这里必须说清楚一个道理HPC负载的收益提升取决于你的应用是计算密集型、内存密集型还是通信密集型。三种类型的负载表现完全不一样。3.1 计算密集型核心数和IPC是双刃剑对CAE仿真、结构分析这类计算密集型负载比如Ansys Mechanical、Abaqus、LS-DYNAEPYC 9005带来的提升确实是立竿见影的。原因有两个一是核心数翻倍多核并行场景下能同时处理更多单元二是Zen 5的单核性能提升让串行阶段的处理速度也变快了——很多CAE软件在网格划分、接触定义等前处理阶段是串行的这部分吃的是单核性能。但要注意一个问题很多CAE软件的License是按核心数收费的。Abaqus、Ansys这类商业软件如果你买的是固定核心数的License那么192核心的节点并不能让你榨干所有算力——软件只会用License允许的核数。这种情况下高主频比多核心更有价值。所以我的建议是如果单位用的是按核心授权的商业CAE软件优先关注高主频型号比如96核或64核但频率更高而不是无脑冲192核。如果是开源科学计算软件无License限制那核心数拉满确实划算。3.2 内存密集型带宽和容量有时比核数更关键对分子动力学比如GROMACS、NAMD、计算化学、气象预报这类负载数据量往往非常大而且动不动就要在几十上百GB的数据集上反复搬运数据。这时候单核算力反而变得次要内存带宽和内存容量才是主要矛盾。EPYC 9005的12通道DDR5-6000设计4TB内存容量支持2DPC时48条内存插槽这些规格确保了大内存配置成为可能。像GROMACS这种对内存延迟和带宽都极其敏感的应用如果你从16通道的竞品平台迁移过来即使核心数相同性能也可能有明显差距。实测中常见的效果是内存带宽直接决定了分子动力学模拟的ns/day每天模拟纳秒数指标。带宽越高同等计算量下每天能跑的模拟步数越多。所以选型时多组内存到底能不能跑满12通道是很关键的配置细节。3.3 AI训练与科学计算混合负载CPU不该被忽视现在很多HPC集群已经不是纯粹的MPI科学计算了而是AI训练、推理和传统数值仿真的混合负载。在这个场景下CPU的职责发生了明显变化数据预处理、模型分发的协调、以及小规模模型的推理任务往往都在CPU上完成。如果CPU性能太弱即使GPU再强整个流水线也会卡在数据准备和传输环节。EPYC 9005系列能支持PCIe 5.0GPU单卡16GT/s的上行带宽加上足够多的PCIe通道可以让CPU-GPU之间的数据传输效率大幅提升。你再配合高核心数同时处理多个数据预处理任务整个混合负载流水线的吞吐效率会有明显改观。4. 采购和部署前的关键考量我给准备上Altus的人几条实操建议谈完架构和应用价值最后这部分是纯实操经验分享。这些都是常规新闻稿和参数表里不会告诉你的细节但恰恰是决定系统实际使用体验和交付周期的地方。4.1 内存通道必须配满吗EPYC 9005支持12通道DDR5这12个Channel最好一次性配满。原因很简单HPC应用对内存带宽极度敏感少配一个Channel内存带宽就少十二分之一。举个例子如果你买了一台192核的EPYC 9965双路服务器每颗CPU只配6条DDR5内存只占一半通道那内存带宽就会从满血的576GB/s直接砍到288GB/s单CPU视角左右。这带来的后果是跑内存密集型科学计算时实际性能可能只有满配状态的70%-80%甚至更低。所以我建议预算再紧张内存通道数也不能省。优先用单条容量大的内存模组比如单条64GB/128GB配满12通道后期再根据需要加容量。4.2 供电和散热基础设施提前算好账EPYC 9005系列的功耗密度比上一代高了不少。特别是192核这一档TDP 500W意味着一个双路节点光CPU就是1000W的功耗。再加上GPU、内存、风扇、存储一个满配4U节点功率很可能在4kW以上。这就引出一个经常被忽略的问题机柜的供电能力。很多老旧机房的机柜单柜供电能力只有4-8kW。如果换算下来只能塞一两台满配节点这个部署密度就非常尴尬了。所以采购前一定要先做一次机房基础设施的盘点确认PDU容量、UPS余量、散热能力这几项是不是够用。如果不够要么选择低功耗型号比如TDP 350W档的处理器要么提前规划机柜改造方案。另外如果你的部署密度超过15kW/柜务必认真考虑液冷方案。Altus新一代产品线里已经有成熟的液冷整柜方案不要等到节点上了架、发现风冷压不住再返工那代价就大了。4.3 功耗档位与业务匹配TDP不是死的EPYC 9005系列在很多型号上支持cTDP可配置TDP调节。这意味着即使你买的是500W TDP的192核旗舰也可以通过BIOS把它配置成更低功耗的运行模式比如350W或400W换取更低的功耗噪声和散热压力。反过来如果你对性能的要求是能拉满就拉满也可以把一些默认功耗较低的型号解锁到更高的P-state释放更多性能。这里要分享一个我踩过的坑集群调度器比如Slurm在分配资源和计费时是按CPU的名义功率来估算节点能耗的。如果你在BIOS里改了cTDP但调度器配置没同步更新会出现整个集群的能耗统计严重失真。所以改完BIOS之后记得同步更新Slurm或PBS的节点配置。4.4 调优的方向从BIOS到调度器都要动很多用户把服务器买回来插上电、装完系统就直接跑作业了完全不做调优。这等于买了一辆好车但一直用经济模式开。EPYC 9005平台以下几个BIOS设置项值得花时间研究NUMA策略对于多路配置调整NUMA per socket或NPS的拓扑模式对内存访问延迟有明显影响。建议实测对比NPS1/NPS2/NPS4的差异。SMT开关科学计算负载通常建议关掉SMT同步多线程因为对浮点密集型作业来说SMT带来的收益有限反而可能因为资源竞争把性能拉低。P-state和cTDP按供电散热情况和业务需求设置最优档位。安全启动和虚拟化选项如果业务不需要可以考虑关闭部分安全特性换取性能。调优不是一次就能做好的事。我的经验是每个新集群上线至少预留两周的时间做应用层面的基准测试和参数调整针对你的典型负载比如用你们平时跑的作业作为基准测试样例逐一验证不同配置的效果。5. 老集群升级还是新局面更换我的一些体会最后聊一点实际判断。如果你现在已经有EPYC 9004Genoa平台的旧集群要不要为了Turin专门换新节点我的看法是要看你的核心瓶颈在哪。如果你的瓶颈在核心数——比如节点数量固定但作业排队严重那么多核带来的节点密度提升会直接降低排队时间。这种情况升级到9005系列价值非常明显。如果你瓶颈在单核性能——比如跑串行占比较高的商业仿真软件那Zen 5的IPC提升也会有帮助但幅度可能没有你想象得那么夸张。可以先用一段时间评估不用急着全量更换。如果你是第一次采购HPC集群直接选9005系列的新节点是合理的选择。SP5平台的延展性意味着未来1-2年内如果AMD再出新的兼容处理器你的基础设施大概率还能复用不需要整体推倒重来。这套Altus新一代产品线跟EPYC 9005的组合目前看是HPC市场上一个非常均衡的选项——有高核心数做大规模并行有完整AVX-512做科学计算加速有液冷方案应对高密度部署还有PCIe 5.0保证存储和网络的扩展空间。当然具体适不适合你还得拿自己真实的业务负载跑一轮基准测试再拍板。厂商的宣传参数可以参考但请记得找一个靠谱的集成商做一次POC实测让数据说话。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻