GitHub Stars
2.2K
Forks数量
373
贡献者数量
24
许可证
MIT
收录理由
大多数vLLM教程都默认你只有一台GPU服务器,如果你有一台DGX Spark,想把模型分散到两台或三台机器上跑,通常得自己动手把集群连起来。这个仓库正好补上这块缺口,提供了Docker镜像和启动脚本,既能在单台Spark上跑vLLM,也能让多台机器通过InfiniBand或RoCE互联,用Ray或者vLLM自带的PyTorch分布式模式都行。那些麻烦事已经帮你处理好了:节点间免密SSH、把下载好的模型复制到每台机器避免重复下载、用fastsafetensors和InstantTensor加速加载,还有固定的容器镜像,让模型和经过测试的构建版本配对。构建时可以选择用预编译的wheel包,也可以从源码完整编译,如果你想追vLLM主分支的新特性,这个选项就很重要。这是一个社区项目,不是NVIDIA官方出品,所以偶尔出点小问题也正常,毕竟你要的是在这块硬件上用到最新的vLLM功能。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。