FEATURED · 精选文章

Exo 分布式推理集群完整实践:用几台 Mac 跑动 671B 大模型

发布时间 / 2026/8/31 14:03:22
来源 / 创域科博编辑部
栏目 / 资讯中心
Exo 分布式推理集群完整实践:用几台 Mac 跑动 671B 大模型 Exo 分布式推理集群完整实践用几台 Mac 跑动 671B 大模型【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExo 是一个 AI 集群管理平台能把多台 Mac 等消费级设备自动发现并组网做跨设备的分布式推理。它要解决的核心问题很具体单台设备内存装不下超大模型——于是用张量并行把模型切分到多台机器再靠 Thunderbolt 上的 RDMA 压低节点间延迟让设备越多、跑得越快。适合手上已有闲置 Apple 设备、想低成本部署前沿大模型推理的个人和团队。 单机装不下超大模型为什么不再买一张卡先说痛点。235B、671B 这个量级的模型8-bit 权重要几百 GB 内存单台消费级设备基本放不下。传统解法是堆 GPU 服务器成本高、机房互联、运维都重。另一条路是消费级设备分布式推理把几台现成的 Mac 拼起来用总内存换单卡容量。维度传统 GPU 集群Exo Mac 集群硬件投入采购专用 GPU 服务器复用现有 Mac 设备可用内存受单卡显存限制多机内存池化4×512GB 起步组网方式机房级互联雷雳直连设备自动发现适合场景大规模生产训练与推理研究验证、中小团队本地推理Exo 的定位就是后者的操作系统设备自动发现、模型放置自动决策、推理任务跨机调度全程不用手写网络配置。换句话说你只需要把机器插上线、装上软件剩下的它自己谈。 用 3 条命令启动第一台节点前置依赖是 uv、node、rust 三个工具具体安装方式看仓库 README。然后是三步git clone https://gitcode.com/GitHub_Trending/exo8/exo克隆仓库代码里唯一需要外部地址的地方。cd exo/dashboard npm install npm run build构建内置的 Web 管理面板只在首次需要。uv run exo启动 Exo 节点。浏览器打开http://localhost:52415/就能看到面板。在第二台机器上重复后两步两台设备会自动发现彼此并组网没有任何手动配网环节。每个节点都自带独立的 API 和面板连到任意一台都能看到全集群状态。想要更省心的方式可以直接装 macOS 菜单栏应用需 macOS 26.2brew install --cask exo它会在后台常驻并替系统装好网络配置。⚡ 让 4 台 Mac 跑动 671B 模型并行策略与 RDMA模型怎么切Exo 是自动决策的。它维护一份实时设备拓扑视图——像调度系统盯着实时路况派车——综合每台设备的内存余量、每条链路的带宽和延迟算出当前最优的切分方案节点上下线都会重算。两种切法值得区分管道并行按层把模型拆到不同机器实现简单张量并行把同一层权重拆散、多机同步计算通信更重收益也更大。官方数据是张量并行在 2 台设备最高提速 1.8 倍4 台最高 3.2 倍。通信侧的关键是 RDMA over Thunderbolt。普通网络传输要逐包经过操作系统协议栈像每份快递都回快递站重新分拣RDMA 让一台机器的数据直接写进另一台机器的内存相当于点对点专线。macOS 26.2 起支持该特性需 Thunderbolt 5 设备官方数据称设备间延迟降低 99%。在 4×512GB M3 Ultra Mac Studio、张量并行 RDMA 的实测条件下结果如下模型量化硬件结果Qwen3-235B8-bit4× M3 Ultra31.9 tokens/s比单节点基线快 56%DeepSeek v3.1 671B8-bit4× M3 Ultra完成加载与推理Kimi K2 Thinking原生 4-bit4× M3 Ultra完成加载与推理 从演示到生产API 接入与日常运维对接现有工具不用改代码。Exo 同时兼容 OpenAI Chat Completions、Claude Messages、OpenAI Responses 和 Ollama 四套 API现有客户端把 base URL 指过来即可。实例生命周期走标准流程先调/instance/previews预览所有可行放置方案挑一个创建实例用/instance/await等待状态变为 ready再发推理请求用完按 ID 删除集群整体状态看/state。运维上几个常用开关开启 RDMA关机进恢复模式终端执行rdma_ctl enable重启生效。前提是节点间两两直连、用 TB5 线且所有节点 macOS 版本必须完全一致连 beta 编号都要对齐集群隔离同一网络跑多个集群时用EXO_LIBP2P_NAMESPACE设命名空间防止节点误加入别人的集群模型存储EXO_MODELS_DIRS把权重放到外挂 SSDEXO_OFFLINEtrue支持纯离线运行适合没有外网的机房。面板上每台节点的内存、温度、功耗实时可见想深入定制的可以看 集群调度与放置源码。 架构速览五个模块如何兜底可靠性底层是事件溯源加 Erlang 风格消息传递所有状态变更都先记录成事件由单一写入器统一排序任何节点重启后从事件流重建状态——像游戏录像回放而不是把状态寄存在某台主存上。五个模块各司其职模块职责Master模型放置决策事件排序Worker节点内任务调度、系统信息采集Runner独立进程跑推理崩溃不拖垮集群APIWeb 服务器对外暴露状态与命令Election网络不稳定时的主节点选举推理跑在独立 Runner 进程里是关键设计模型 OOM 或进程崩溃只会重启该进程控制面和其余节点不受影响。需要留意的是Linux 节点目前走 CPU 推理GPU 支持在开发中想复现前文的基准数据可以直接跑 基准测试脚本。 适合谁以及下一步做什么适合手上有 2 台以上 Apple Silicon 设备、想本地跑 100B 模型做研究验证或团队内部服务的场景。不适合需要 GPU 加速的 Linux 生产环境。三条可以直接动手的路径先单台跑通挑一个 4-bit 小模型创建实例用 OpenAI 兼容接口写一段脚本验证 API 全链路两台 Thunderbolt 直连做张量并行和单机吞吐对比拿到第一手并行收益数据读bench/目录的方法论文档按自己的硬件复现一组基准再决定要不要扩到 4 台。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻