FEATURED · 精选文章

一文读懂 HCCL Reduce:集合通信里的多卡归约接口

发布时间 / 2026/9/12 1:39:53
来源 / 创域科博编辑部
栏目 / 资讯中心
一文读懂 HCCL Reduce:集合通信里的多卡归约接口 一文读懂 HCCL Reduce集合通信里的多卡归约接口【免费下载链接】runner-imagesGitHub Actions runner images项目地址: https://gitcode.com/GitHub_Trending/ru/runner-imagesHcclReduce 是 HCCL 集合通信中的归约算子多台 NPU 各持一份数据逐元素求和等归约后结果只写进 root 卡的 recvBuf。分布式训练的梯度聚合、跨卡特征汇总靠的就是它。它到底在做什么N 张卡各有一块形状相同的数据每张卡就是一个 rank通信里给卡排的座位号。HcclReduce 把每个位置上的 N 个值按你指定的 op 归约求和、求积、取大、取小都可以。关键是最后一步结果不做广播只写进 root 卡那块 recvBuf其他卡拿不到。先确认你的硬件能不能跑硬件平台是否支持备注Ascend 950PR / 950DT支持op 只有 sum / max / min类型多了 bfp16 和 uint64但 int64 / uint64 / float64 仅限单节点Atlas A3训练 / 推理系列支持prod 不吃 int16 和 bfp16Atlas A2训练 / 推理系列支持限型号只认三种机型800T A2、900 A2 PoD、200T A2 Box16prod 同样排除 int16 和 bfp16int64 有性能损耗Atlas 推理系列不支持推理卡没这条归约路径Atlas 训练系列支持数据类型只有 int8 / int32 / int64 / float16 / float32一句话总结推理卡直接排除训练卡和 950 这类高端 NPU 基本随便上A2 先对一下你的机型。接口签名与参数速查原型长这样HcclResult HcclReduce(void *sendBuf, void *recvBuf, uint64_t count, HcclDataType dataType, HcclReduceOp op, uint32_t root, HcclComm comm, aclrtStream stream);返回值是 HcclResult拿到 HCCL_SUCCESS 说明提交成功拿不到就是出事了建议立刻打日志排查。参数方向一句话作用关键约束sendBuf输入本卡源数据所在的 Device buffer地址对齐跟 dataType 走见坑一节recvBuf输出归约结果落地的 Device buffer对齐要求和 sendBuf 一样count输入参与归约的元素个数8 个 float 就是 8所有卡必须取同一个值dataType输入元素的数据类型各平台支持范围不同见下方列表op输入归约方式sum / prod / max / min950 只有 sum / max / minprod 在 A2、A3 上不吃 int16、bfp16root输入接收结果的 root 卡的 rank 编号完整结果只在这张卡上comm输入通信域多卡之间的通话频道先用初始化接口建好再传进来stream输入本卡跑任务用的任务流NPU 上的执行队列提交后记得同步再读 recvBuf各平台能用的 dataType口语版950 全系最齐float16 / float32 / float64 / int8 / int16 / int32 / int64 / uint64 / bfp16 都能上就是 int64 / uint64 / float64 别跨节点。A3float16 / float32 / int8 / int16 / int32 / int64 / bfp16。A2和 A3 一样int64 会有性能损耗心里有数就行。Atlas 训练系列float16 / float32 / int8 / int32 / int64就这几个。多卡 Reduce 完整代码示例思路不复杂先在 Device 侧备好两块内存把通信域和任务流建起来调一次 HcclReduce同步完再收尾。// 1. Device 侧备好两块内存一块放本卡输入一块接归约结果 float *mySend NULL; float *myRecv NULL; const uint64_t elemNum 8; // 每卡参与归约的元素个数 const uint32_t homeRank 0; // 结果落到哪张卡 const size_t bufBytes elemNum * sizeof(float); aclrtMalloc((void **)mySend, bufBytes, ACL_MEM_MALLOC_HUGE_ONLY); aclrtMalloc((void **)myRecv, bufBytes, ACL_MEM_MALLOC_HUGE_ONLY); // 2. 建通信域多卡靠它互相连线 const uint32_t worldSize 8; // 参与归约的卡总数 HcclRootInfo rankInfo; // 各 rank 的登记信息 HcclComm myComm; HcclCommInitRootInfo(worldSize, rankInfo, 0, myComm); // 3. 开一条独立任务流 aclrtStream myStream; aclrtCreateStream(myStream); // 4. 发起归约各卡同位置元素求和结果只写 homeRank 的 myRecv HcclReduce(mySend, myRecv, elemNum, HCCL_DATA_TYPE_FP32, HCCL_REDUCE_SUM, homeRank, myComm, myStream); // 5. 等这条流上的通信任务跑完再谈读数据 aclrtSynchronizeStream(myStream); // 6. 收尾内存、任务流、通信域依次归还 aclrtFree(mySend); aclrtFree(myRecv); aclrtDestroyStream(myStream); HcclCommDestroy(myComm);跑完之后别忘的事mySend、myRecv 两块 Device 内存都要用 aclrtFree 归还。myStream 这条任务流要销毁。myComm 这个通信域要销毁。清点一下内存两块、流一条、通信域一个漏哪样都是泄漏。容易踩的坑⚠️三件套对不齐count、dataType、op 是所有卡共同的约定一张卡偷偷改掉整组通信要么卡死要么出脏数据。上产线前建议在每张卡上先断言一遍。⚠️地址对齐不够sendBuf 和 recvBuf 的起始地址要按类型对齐差一个字节都可能报错int8 → 1B int16/float16/bfp16 → 2B int32/float32 → 4B int64/uint64/float64 → 8B大块内存走 aclrtMalloc 一般天然对齐手工拼 buffer 时最容易翻车。⚠️prod 不是万能的A2 和 A3 上prod 不吃 int16 和 bfp16950 上干脆没有 prod。要做乘积归约先确认型号。⚠️宽类型别跨节点950 的 int64 / uint64 / float64 只在单节点内有效多机场景建议换 float32 / float16 再上量。⚠️没同步就读结果忘了 aclrtSynchronizeStream 就去读 recvBuf通信任务可能还没落地你拿到的是半截甚至全脏的数据。接下来可以看看Reduce 只是 HCCL 集合通信算子家族的一员。梯度同步更常用 AllReduce参数下发看 Broadcast想拼各卡结果就用 AllGather都可以接着读。【免费下载链接】runner-imagesGitHub Actions runner images项目地址: https://gitcode.com/GitHub_Trending/ru/runner-images创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻