
如何看懂 oMLX 集群仪表盘实时分片图与 15 项性能指标完整指南oMLX 是运行在 Apple Silicon 上的 LLM 推理服务器支持连续批处理与 SSD 缓存通过 macOS 菜单栏一键管理当多台 Mac或 Mac CUDA 机器组成集群时集群仪表盘就是整个系统的驾驶舱——它以实时分片图展示模型每一层落在哪台机器上并用 15 项性能指标告诉你集群此刻有多快、还剩多少余量。这篇文章面向新手带你从零看懂这个仪表盘。一、集群仪表盘能帮你做什么 oMLX 的分布式推理把一个下载好的模型按连续层段切开分摊到集群里的每台机器上内存大的 Mac 多分几层内存小的少分几层不需要 50/50 均分。切分、校验、启动全部自动完成而仪表盘把结果可视化分片图Shard Map每一台机器负责模型的第几层到第几层本地机器高亮显示内存预算每台机器装了多少权重、还剩多少余量headroom实时指标首字延迟、解码速度、缓存命中率等 15 项数据滚动刷新。相关设计文档见 docs/distributed-cluster.md 与 docs/heterogeneous-cluster.md仪表盘前端实现位于 omlx/admin/templates/dashboard/_cluster.html。二、实时分片图模型层如何安家到每台机器 ️打开仪表盘的状态页你可以看到服务版本、运行状态与内存占用总览进入集群视图后最醒目的就是Neural fabric环形拓扑图前端逻辑见 dashboard.js每个节点 一台机器。Mac 显示笔记本/显示器图标CUDA 机器显示 NVIDIA 标识本机高亮。每台 Mac 的仪表盘都展示完整分片图但只有住在本机的那片分片会高亮方便你确认自己负责哪一段层段比例条。一条横向色带按模型层从早到晚的顺序排列色带宽度与该 rank 承担的层数成正比——一眼看出谁干得更多内存余量滑块。未启动集群时可以为每台机器拖动可用内存上限系统据此自动重新规划分片。KV 缓存始终留在拥有对应层的那台机器上不会集中到某一台 Mac 上读写——这是分片图里标注 KV local 的原因也是集群快于单机拼接的关键。三、15 项性能指标逐一解读 集群运行后仪表盘会把测量数据分成三类展示。以下按链路 → 请求 → 资源的顺序拆解全部 15 项1. 链路与通信类#指标含义怎么读1Ring 延迟启动探测测得的环上最慢一跳延迟越低越好反映 Thunderbolt/网络质量2集合通信吞吐 / 链路容量1 MiB all-reduce 实测带宽未测量时显示协商链路速率实测值带measured容量值只是理论上限3提示词缓存命中率命中前缀缓存的请求 token 占比越高说明重复前缀越多、重复提问越便宜2. 请求性能类端到端测量#指标含义怎么读4TTFT首字延迟请求发出到第一个 token 返回的总耗时衡量用户等多久才开始看到字5Prefill tok/s提示词预填充吞吐长 prompt 场景的关键数字6Decode tok/s单请求最近一次请求的逐 token 解码速度决定打字机速度7Aggregate Decode tok/s会话平均整个会话所有并发请求的平均解码速度多路并发时的总产能8活跃请求数当前正在处理的请求数量结合并发配置判断是否打满9累计生成 token本次部署累计产出的 token 总量观察整体吞吐规模⚠️ 注意TTFT、prefill、decode 都是整条流水线的端到端测量描述的是协作后的集群而不是单台机器的独立速度。3. 资源与预测类#指标含义怎么读10常驻权重 / 容量该 rank 已加载权重 ÷ 集群可用容量判断模型是否真的住进去了11内存余量Headroom每台机器扣除权重后还剩多少余量太小意味着长上下文会受挤压12KV 归属各 rank 本地持有的 KV 缓存范围确认没有跨机集中读写13预测阶段时间规划器预测的最慢阶段耗时与实测对比差距大说明切分不佳14预测计算 传输拆分每个 stage 的计算时间 vs 激活传输时间传输占比高 → 链路是瓶颈15流水线利用率流水线忙碌时间占比低利用率 高活跃请求 存在等待性能指标的测量逻辑校准矩阵、fail-soft 策略等在后端 omlx/cluster/performance.py 中实现分布式引擎核心在 omlx/engine/distributed.py集群控制面代码集中在 omlx/cluster/ 目录。oMLX 性能指标面板展示吞吐、延迟与缓存效率等实测数据四、用指标定位瓶颈3 个实用场景 ️场景 1首字慢生成快。TTFT 高、decode 正常 → 看 Prefill tok/s 与预测传输时间若传输占比高说明大激活跨链路慢可考虑更靠近的直连Thunderbolt RDMA。场景 2打字机变慢。Decode tok/s 持续走低 → 看活跃请求数与会话平均解码若单请求慢而会话平均也慢多半是某段分片成为最慢阶段对照预测阶段时间找出是哪个 rank。场景 3重复提问没变快。提示词缓存命中率上不去 → 检查请求前缀是否一致缓存亲和机制会让相同模型请求固定在同一组 rank 上复用本地缓存改动过多前缀会破坏命中。五、小结oMLX 集群仪表盘把模型切在哪、每台机器装多少、跑得多快三件事摊在一张图上分片图回答结构15 项指标回答健康度。新手只需记住一句话——先看分片图确认切分合理再对照预测 vs 实测找差距就能快速定位绝大多数集群问题。创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考