
4 台 Mac 拼成一台本地 AI 集群Exo 分布式推理 10 分钟上手指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExo 是一个开源的分布式 AI 计算框架它把局域网里的 Mac、PC、平板拼成一个集群让单台设备装不下的大模型也能在本地跑起来。面向想用自有硬件运行几百 B 级大模型的开发者与 AI 爱好者。单台机器跑 235B为什么总是差一截内存算一笔账Qwen3 235B 做 8-bit 量化后权重约 250GB再留给 KV cache 和激活值基本要 512GB 统一内存的机器才塞得下DeepSeek V3.1 的 671B 则差得更多单台 512GB 不够官方基准里用了 4 台。多数人第一反应是买 8 卡 GPU 服务器成本和功耗都是另一个量级。Exo 的思路是把手头已有的设备用起来每台机器装一个 exo它们自动互相发现把内存和算力合成一个池子。推理后端是 MLXmacOS 上有桌面应用也可以从源码以命令行方式跑。集群背后的三个机制设备自动发现不用手配网络exo 启动后同网段设备会自动组群不需要手填 IP 或端口同一个 LAN 上还能用命名空间把多个集群隔离开避免误连。拓扑感知自动切分先决定怎么切再开始跑加载模型前exo 会根据各节点内存、负载以及链路间实测的延迟和带宽生成放置方案两种切法流水线并行每个节点负责几层token 依次流过各节点和张量并行一层内的权重切开多节点同时算再同步。一句话概括流水线解决模型放哪张量并行解决算得快不快。README 给出的数据是张量并行在 2 台设备最高 1.8 倍加速4 台 3.2 倍。放置逻辑可以看 src/exo/master/placement.py 源码。RDMA over Thunderbolt加机器为什么反而更快传统多机推理走 TCP 网络栈数据要在内核与用户态之间反复拷贝每一步都花时间。RDMA 让设备直接读写对方内存绕过大部分操作系统开销——好比去邻居家直接把文件拿走而不是先走一圈马路寄副本。macOS 26.2 提供了这项能力exo 对 Thunderbolt 5 是 day-0 支持官方口径是设备间延迟降低约 99%。代价也有节点要用 TB5 线缆两两全互联且各机 macOS 版本必须完全一致。从零到第一个集群4 步每台设备装好 exomacOSTahoe 26.2 及以上可直接用桌面应用也可装好依赖后从源码运行Linux 目前仅支持 CPU 推理。需要源码方式时先克隆代码git clone https://gitcode.com/GitHub_Trending/exo8/exo进程启动后局域网设备自动组群内置 dashboard 在 http://localhost:52415 能看到每个节点的内存占用、温度和功耗。在 dashboard 里选模型创建实例或直接用现成工具对接API 兼容 OpenAI Chat Completions、Claude Messages、OpenAI Responses 和 Ollama 四种格式现有客户端不用改。效果RDMA 对上 TCP数据怎么说4 台 M3 Ultra Mac Studio、8-bit 量化的实测t/s 为每秒生成 token 数模型节点数Exo (RDMA)llama.cpp (TCP)Qwen3 235B119.520.4Qwen3 235B431.915.2DeepSeek V3.1 671B432.514.6值得注意的是单机上两者基本持平llama.cpp 加节点后吞吐反而下降2 台 17.2、4 台 15.2而 Exo 从单机的 19.5 升到 2 台 26.2、4 台 31.94 节点约为 llama.cpp 的 2.1 倍。加机器就变快这件事取决于互联延迟够不够低。适合谁哪些场景先别急适合手里有 2~4 台 M 系 Mac 的人尤其带 TB5 的 M3 Ultra / M4 Pro 机型想给现有工作流接一个本地 OpenAI 兼容 API 的开发者想多模型、图文模型一起试的人。不适合或需要留意Linux 用户目前只有 CPU 路径、没有 GPU 加速非 TB5 机器或走低带宽 WiFi 的组网能跑但同步会成为瓶颈几十台以上的大规模集群也不在它的设计目标内exo 面向家庭和小型实验室规模。家里如果有 3~4 台 M 系 Mac 和几根 Thunderbolt 5 线可以今晚就试接口细节见官方 docs/api.md。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考