推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 101 |
Bonsai-demo
Bonsai 演示 |
2.3K | 233 | 08/28/26 | Apache-2.0 |
| 102 |
spark-vllm-docker
用于在双DGX Sparks上运行VLLM的Docker配置 |
2.2K | 373 | 08/27/26 | MIT |
| 103 |
club-3090
在RTX 3090/4090/5090 CUDA GPU上部署LLM的社区方案。多引擎(vLLM、llama.cpp、ik_llama)且模型无关。目前提供Qwen3.6-27B、Qwen3.6 35B、Gemma 4 26B、Gemma 4 31B的配置,适用于单卡和双卡。 |
2.1K | 128 | 08/27/26 | Apache-2.0 |
| 104 |
vllm-metal
社区维护的适用于Apple Silicon的vLLM硬件插件。 |
1.7K | 233 | 08/29/26 | Apache-2.0 |
| 105 |
lorax
多LoRA推理服务器,可扩展到数千个微调LLM |
3.8K | 326 | 05/28/26 | Apache-2.0 |
| 106 |
FastFlowLM
在AMD Ryzen™ AI NPU上几分钟内运行LLM;专为AMD NPU打造并深度优化。 |
1.8K | 145 | 08/28/26 | MIT |
| 107 |
FastFlowLM
在AMD Ryzen™ AI NPU上运行LLM,几分钟即可完成;专为AMD NPU打造并深度优化。 |
1.8K | 145 | 08/28/26 | MIT |
| 108 |
GPTQModel
LLM模型量化(压缩)工具包,通过HF、vLLM和SGLang支持Nvidia、AMD、Intel GPU及Intel/AMD/Apple CPU的硬件加速。 |
1.2K | 204 | 08/28/26 | Other |
| 109 |
react-native-executorch
在React Native设备上运行AI模型的声明式方式,由ExecuTorch驱动。 |
1.7K | 95 | 08/28/26 | Other |
| 110 |
truss
在生产环境中服务 AI/ML 模型的最简单方式 |
1.2K | 122 | 08/28/26 | MIT |
| 111 |
vllm-mlx
适用于Apple Silicon的高性能OpenAI和Anthropic兼容LLM推理服务器。原生MLX、连续批处理、多模态模型、MCP工具调用和Claude Code支持。 |
1.6K | 219 | 08/26/26 | Apache-2.0 |
| 112 |
auto-round
SOTA量化工具包,用于高精度低比特LLM推理,无缝优化CPU/XPU/CUDA,支持多种数据类型,并与vLLM、SGLang和Transformers完全兼容。 |
1.6K | 168 | 08/29/26 | Apache-2.0 |
| 113 |
nndeploy
一款简单易用和高性能的AI部署框架 |
1.9K | 233 | 08/15/26 | Apache-2.0 |
| 114 |
node-llama-cpp
通过llama.cpp的node.js绑定在本地运行AI模型,并在生成层面对模型输出强制执行JSON模式。 |
2.2K | 215 | 08/11/26 | MIT |
| 115 |
distributed-llama
分布式LLM推理。将家用设备连接成强大的集群,加速LLM推理。设备越多,推理越快。 |
3.0K | 248 | 07/05/26 | MIT |
| 116 |
uzu
高性能AI模型推理引擎 |
1.7K | 73 | 08/29/26 | MIT |
| 117 |
sonar
大规模LLM推理引擎 |
1.8K | 208 | 08/13/26 | AGPL-3.0 |
| 118 |
local-studio
VLLM、Sglang、llama.cpp、exllamav3 的控制面板 |
1.7K | 155 | 08/28/26 | Apache-2.0 |
| 119 |
ComfyUI-Docker
🐳用于🎨ComfyUI的Dockerfile | 容器镜像与启动脚本 |
1.6K | 232 | 08/26/26 | Other |
| 120 |
mllm
移动设备上的快速多模态大语言模型 |
1.6K | 213 | 08/19/26 | MIT |