#103 · 主分类: 推理与本地部署
club-3090
在RTX 3090/4090/5090 CUDA GPU上部署LLM的社区方案。多引擎(vLLM、llama.cpp、ik_llama)且模型无关。目前提供Qwen3.6-27B、Qwen3.6 35B、Gemma 4 26B、Gemma 4 31B的配置,适用于单卡和双卡。
项目最后更新:08/27/26
GitHub Stars
2.1K
Forks数量
128
贡献者数量
24
许可证
Apache-2.0
收录理由
如果你手头有一两张高显存消费级显卡,无论是放在家里跑 homelab 还是当开发后端,这个仓库能帮你省掉伺候开源大模型推理服务时最磨人的调参环节。它直接给出能跑通的配置,而不是让你从零折腾各个引擎。里面整理了 vLLM、llama.cpp、ik_llama 的 Docker Compose 方案,都在 localhost 上暴露 OpenAI 兼容接口,而且对取舍讲得很实在——实测基准会告诉你哪个配置在真实工具调用的 agent 负载下会崩,哪个能干净地填满 200K 上下文窗口;FAQ 里还把 3090、4090、5090 各自的小坑列得清清楚楚。配套脚本和交互式向导会一步步带着你下载并校验模型权重、按显卡数量选变体、启动服务、做端点冒烟测试、跑基准。想要一个可复现的本地推理基线又不想手动调引擎的话,那些精选默认配置和能感知硬件的选择器确实能省下不少时间。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。