GitHub Stars
47.1K
Forks数量
3.5K
贡献者数量
107
许可证
Apache-2.0
收录理由
exo 能把你自己手头的几台设备拼成一个分布式推理集群,让原本单机装不下的超大模型——比如 600B 参数级别——跑在多台 Mac Studio 或工作站上。它会在网络上自动发现其他 exo 节点,然后根据实时的设备拓扑,综合考虑每台机器的资源和链路延迟,把模型切分到各个设备上。推理由 MLX 负责,张量并行把权重分片,而 Thunderbolt 上的 RDMA 支持把设备间延迟压得很低,所以加机器是提速而不是拖后腿。它兼容 OpenAI、Claude 和 Ollama 的 API,你现有的客户端和工具不用改就能直接用,内置的仪表盘还能管理集群、提供聊天界面。自定义模型可以从 Hugging Face 加载。对于想在自己硬件上跑前沿模型、又不想租云 GPU 的团队,或者想折腾多设备推理的人来说,这是一条很实际的路。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。