推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 21 |
MNN
MNN:一个极速、轻量级的推理引擎,由阿里巴巴实战检验,驱动高性能端侧大语言模型和边缘AI。 |
16.0K | 2.4K | 08/28/26 | Apache-2.0 |
| 22 |
openvino
OpenVINO™ 是一个用于优化和部署AI推理的开源工具包。 |
10.8K | 3.3K | 08/28/26 | Apache-2.0 |
| 23 |
TensorRT
NVIDIA® TensorRT™ 是一个用于在 NVIDIA GPU 上进行高性能深度学习推理的 SDK。该仓库包含 TensorRT 的开源组件。 |
13.3K | 2.4K | 08/25/26 | Apache-2.0 |
| 24 |
LMCache
LMCache:以最快的KV缓存层加速你的大语言模型 |
11.6K | 1.8K | 08/29/26 | Apache-2.0 |
| 25 |
WasmEdge
WasmEdge 是一个轻量级、高性能、可扩展的 WebAssembly 运行时,适用于云原生、边缘和去中心化应用。它为无服务器应用、嵌入式函数、微服务、智能合约和物联网设备提供支持。 |
10.8K | 1.2K | 08/28/26 | Apache-2.0 |
| 26 |
OpenLLM
在云端运行任何开源LLM(如DeepSeek和Llama),作为OpenAI兼容的API端点。 |
12.5K | 836 | 08/24/26 | Apache-2.0 |
| 27 |
nano-vllm
Nano vLLM |
15.2K | 2.5K | 04/26/26 | MIT |
| 28 |
server
Triton推理服务器为云端和边缘提供优化的推理解决方案。 |
10.9K | 1.8K | 08/28/26 | BSD-3-Clause |
| 29 |
llama-cpp-python
llama.cpp 的 Python 绑定 |
10.6K | 1.5K | 08/17/26 | MIT |
| 30 |
inference
通过更改一行代码,即可将GPT替换为任何LLM。Xinference让您可以在云端、本地或笔记本电脑上运行开源、语音和多模态模型——全部通过一个统一的、生产就绪的推理API。 |
9.5K | 865 | 08/29/26 | Apache-2.0 |
| 31 |
runanywhere-sdks
本地运行AI的生产就绪工具包 |
10.3K | 370 | 08/29/26 | Other |
| 32 |
BentoML
服务AI应用和模型的最简单方式 - 构建模型推理API、任务队列、LLM应用、多模型流水线等! |
8.8K | 1.0K | 08/28/26 | Apache-2.0 |
| 33 |
serve
☁️ 使用云原生技术栈构建多模态AI应用 |
21.9K | 2.2K | 03/24/25 | Apache-2.0 |
| 34 |
ollama-python
Ollama Python 库 |
10.5K | 1.2K | 08/12/26 | MIT |
| 35 |
PowerInfer
高速大语言模型本地部署推理服务 |
9.8K | 597 | 05/11/26 | MIT |
| 36 |
cog
用于机器学习的容器 |
9.5K | 697 | 08/26/26 | Apache-2.0 |
| 37 |
ik_llama.cpp
llama.cpp 的分支,带有额外的 SOTA 量化和改进的性能 |
3.1K | 444 | 08/28/26 | MIT |
| 38 |
executorch
在移动、嵌入式及边缘设备上运行PyTorch的AI |
5.0K | 1.1K | 08/29/26 | Other |
| 39 |
vllm-omni
用于全模态模型高效推理的框架 |
6.5K | 1.6K | 08/29/26 | Apache-2.0 |
| 40 |
lmdeploy
LMDeploy 是一个用于压缩、部署和服务 LLM 的工具包。 |
8.0K | 733 | 08/28/26 | Apache-2.0 |