ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

3步搭起分布式AI推理集群:用Exo让多台设备协同跑大模型

3步搭起分布式AI推理集群:用Exo让多台设备协同跑大模型 3步搭起分布式AI推理集群用Exo让多台设备协同跑大模型【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExo 是一个分布式AI推理框架能把多台 Mac 或 PC 连成一个 AI 集群在本地完成多机协同的大模型推理。本文面向新手讲清集群内部如何分工、如何三步搭建、怎么发出第一个推理请求以及实测速度和新手要避开的坑。 用现有设备拼一个AI推理集群很多人手里其实有算力但用不上一台跑不动大模型的 Mac mini几台闲置的台式机或者数据不想出本地网络的业务。单台机器内存装不下几百亿参数的模型传统做法只能租云 GPU而 Exo 的思路是把模型切片摊到多台机器上一起跑——它基于张量并行官方数据是 2 台设备最多提速 1.8 倍、4 台设备最多提速 3.2 倍。对新手来说有两个省事的地方一是设备之间自动发现不需要手动填 IP 或配置二是每台机器都自带一个 dashboard 和 API默认http://localhost:52415浏览器打开就能管集群、直接聊天。️ 集群内部如何分工Exo 的每台节点内部由五个角色协作参考 src/exo/master/ 与 src/exo/worker/ 的源码角色干什么Master主控维护全局集群状态决定模型切到哪几台机器、怎么切Worker节点工人每台机器上的执行端下载模型、拉起推理、采集本机硬件信息Runner推理进程真正执行推理的独立进程崩了也不会拖垮节点主进程API接口层对外提供 OpenAI 兼容的 REST 接口和内置 dashboardElection选举主控节点掉线时用 bully 算法自动选出新的 Master 3步搭起集群节点三步走装依赖 → 每台机器加入集群 → 启动服务。因为设备会自动发现彼此加入就是把 exo 跑起来不需要额外配对步骤。git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo uv sync uv run exouv run exo会同时拉起 Master、Worker 和 API浏览器打开http://localhost:52415即可看到集群视图。macOS 上也可直接用官方 App 后台常驻Linux 上目前跑 CPUGPU 支持还在开发中。 发起第一次推理上手只需要认识两个端点完整清单见 API 文档GET/v1/models列出当前可用的模型及状态。想只看已下载的加?statusdownloaded。POST/v1/chat/completions请求格式和 OpenAI 完全一致填model和messages即可支持流式返回。已有的 OpenAI 客户端、以及 Ollama 生态工具把 base URL 指过来就能用。一个细节创建模型实例是异步的选中的模型在集群里准备好之前别急着发推理请求可以先用/instance/await等它就绪。⚡ 实测有多快RDMA与TCP的吞吐差异在 4 台 M3 Ultra Mac Studio 上跑 Qwen3-235B8-bit走 Thunderbolt 5 的 RDMA 模式时生成速度约31.9 tokens/秒同样的四机配置如果走传统 TCP只有15.2 tokens/秒左右——快了一倍。差别来自 RDMA 本身它让设备之间直接读写对方内存绕过操作系统内核的网络栈官方称设备间延迟降低约 99%。想吃到这个红利注意几件事机器要支持 Thunderbolt 5M4 Pro Mac mini、M4 Max Mac Studio、M3 Ultra Mac Studio 等线缆必须是 TB5macOS 26.2 需要在恢复模式执行rdma_ctl enable四台机器要两两直连成全网所有机器的系统版本必须完全一致连 beta 号都要一样。 支持哪些模型、怎么管拓扑模型库覆盖主流开源大模型Qwen3235B、DeepSeek v3.1671B、Kimi K2 Thinking 等都有现成基准参考也可以从 HuggingFace 上通过/models/add追加任意 MLX 格式的自定义模型。拓扑方面dashboard 会把整个集群画成一张连线图每台节点的内存占用、温度、功耗都是实时刷新的。放置决策也由它驱动Exo 根据各设备剩余内存和链路的实际带宽/延迟自动选择流水线并行还是张量并行来切模型你只需要在界面上点选。⚠️ 新手最常踩的3个坑1. 分片内存没预留够。每台节点不仅要装得下模型权重分片还要给 KV cache 和活动缓冲留余量。部署前先查/instance/previews它会给出每个节点预计新增的内存占用memory_delta_by_node确认都装得下再动手。2. 网络选型想当然。两三台、不追求极限速度时普通 TCP 就够用一旦加机器发现吞吐上不去多半是网络成了瓶颈——此时才值得上 Thunderbolt 5 RDMA而不是反过来一上来就折腾全网直连。3. 不设负载阈值闷头跑。建议盯住 dashboard 上的内存、温度和功耗曲线并设告警某台节点温度过高或内存吃紧整个集群的推理速度都会被拖慢提前发现比事后排查省事得多。总结Exo 把多台设备跑一个超大模型这件过去需要专业集群的事简化成了装依赖、跑起来、发请求三步。对想在本地做私有化大模型推理的个人和小团队来说它的自动发现、拓扑感知放置和 RDMA 支持是目前相当顺手的一套组合。先拿两台机器跑通一个小模型再逐步加节点是最稳妥的路径。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表