#183 · 主分类: 推理与本地部署

vllm-cli

llm llm-inference llm-tools vllm

一个使用vLLM为LLM提供服务的命令行工具。

项目最后更新:01/25/26

GitHub Stars

506

Forks数量

29

贡献者数量

2

许可证

MIT

收录理由

手动跑 vLLM 往往要在命令行里堆一长串参数,重启服务时还得反复确认 GPU 上到底加载了哪些模型,稍不留神就乱了。这个命令行工具提供两种操作方式:日常使用可以进入菜单驱动的终端界面,实时查看 GPU 占用和系统状态;需要写脚本或做自动化时,也可以直接用简洁的命令行指令。它顺手解决了不少琐碎环节,比如自动发现本机已通过 HuggingFace 或 Ollama 下载的模型,为不同硬件准备现成的配置方案,启动前还会检查 GPU、内存和 CUDA 是否兼容。新加入的实验性功能还能把多个模型集中在一个 API 端点后面,根据请求压力动态唤醒或休眠 GPU。对于在单机或小型 GPU 设备上跑 vLLM 的人来说,这层轻量封装确实让引擎的日常运维省心很多。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目