推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 1 |
ollama
快速上手使用 Kimi-K2.6、GLM-5.2、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma 等模型。 |
179.7K | 17.6K | 08/29/26 | MIT |
| 2 |
llama.cpp
基于C/C++的LLM推理 |
126.3K | 22.4K | 08/29/26 | MIT |
| 3 |
vllm
面向LLM的高吞吐量、内存高效的推理与服务引擎。 |
90.4K | 21.4K | 08/29/26 | Apache-2.0 |
| 4 |
gpt4all
GPT4All:在任何设备上运行本地大语言模型。开源且可用于商业用途。 |
77.4K | 8.3K | 05/27/25 | MIT |
| 5 |
LocalAI
LocalAI 是开源 AI 引擎。可在任何硬件上运行任何模型——LLM、视觉、语音、图像、视频。无需 GPU。 |
48.8K | 4.4K | 08/29/26 | MIT |
| 6 |
textgen
开源桌面应用,用于本地LLM。支持文本、视觉、工具调用,兼容OpenAI/Anthropic API。100%私密。 |
47.6K | 6.0K | 08/17/26 | AGPL-3.0 |
| 7 |
exo
本地运行前沿AI |
47.1K | 3.5K | 08/25/26 | Apache-2.0 |
| 8 |
sglang
SGLang 是一个用于大型语言模型和多模态模型的高性能服务框架。 |
32.8K | 8.3K | 08/29/26 | Apache-2.0 |
| 9 |
BitNet
1比特大语言模型的官方推理框架 |
40.2K | 3.7K | 07/27/26 | MIT |
| 10 |
llmfit
数百个模型和提供商。一条命令即可找到适配您硬件的运行方案。 |
34.5K | 2.2K | 08/28/26 | MIT |
| 11 |
airllm
AirLLM 70B 推理,单张4GB GPU |
33.1K | 3.5K | 08/29/26 | Apache-2.0 |
| 12 |
modular
模块化平台(包含 MAX 和 Mojo) |
29.3K | 3.1K | 08/29/26 | Other |
| 13 |
onnxruntime
ONNX Runtime:跨平台、高性能的机器学习推理和训练加速器 |
21.7K | 4.2K | 08/29/26 | MIT |
| 14 |
ncnn
ncnn是一个为移动平台优化的高性能神经网络推理框架 |
23.8K | 4.5K | 08/28/26 | Other |
| 15 |
llamafile
通过单个文件分发和运行LLM。 |
25.7K | 1.6K | 08/26/26 | Other |
| 16 |
mlc-llm
通用LLM部署引擎,支持ML编译 |
23.1K | 2.1K | 08/17/26 | Apache-2.0 |
| 17 |
omlx
适用于Apple Silicon的LLM推理服务器,支持连续批处理和SSD缓存,可从macOS菜单栏管理。 |
21.0K | 1.8K | 08/29/26 | Apache-2.0 |
| 18 |
ktransformers
一个灵活的框架,用于体验异构LLM推理/微调优化。 |
19.3K | 1.5K | 08/28/26 | Apache-2.0 |
| 19 |
web-llm
高性能浏览器内LLM推理引擎 |
18.6K | 1.4K | 08/04/26 | Apache-2.0 |
| 20 |
TensorRT-LLM
在NVIDIA GPU上优化和部署大语言模型,实现最先进的推理性能。 |
14.5K | 2.7K | 08/29/26 | Other |