推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 1–20 项,共 183 个

排名 项目 Stars Forks
1 ollama

快速上手使用 Kimi-K2.6、GLM-5.2、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma 等模型。

179.7K 17.6K
2 llama.cpp

基于C/C++的LLM推理

126.3K 22.4K
3 vllm

面向LLM的高吞吐量、内存高效的推理与服务引擎。

90.4K 21.4K
4 gpt4all

GPT4All:在任何设备上运行本地大语言模型。开源且可用于商业用途。

77.4K 8.3K
5 LocalAI

LocalAI 是开源 AI 引擎。可在任何硬件上运行任何模型——LLM、视觉、语音、图像、视频。无需 GPU。

48.8K 4.4K
6 textgen

开源桌面应用,用于本地LLM。支持文本、视觉、工具调用,兼容OpenAI/Anthropic API。100%私密。

47.6K 6.0K
7 exo

本地运行前沿AI

47.1K 3.5K
8 sglang

SGLang 是一个用于大型语言模型和多模态模型的高性能服务框架。

32.8K 8.3K
9 BitNet

1比特大语言模型的官方推理框架

40.2K 3.7K
10 llmfit

数百个模型和提供商。一条命令即可找到适配您硬件的运行方案。

34.5K 2.2K
11 airllm

AirLLM 70B 推理,单张4GB GPU

33.1K 3.5K
12 modular

模块化平台(包含 MAX 和 Mojo)

29.3K 3.1K
13 onnxruntime

ONNX Runtime:跨平台、高性能的机器学习推理和训练加速器

21.7K 4.2K
14 ncnn

ncnn是一个为移动平台优化的高性能神经网络推理框架

23.8K 4.5K
15 llamafile

通过单个文件分发和运行LLM。

25.7K 1.6K
16 mlc-llm

通用LLM部署引擎,支持ML编译

23.1K 2.1K
17 omlx

适用于Apple Silicon的LLM推理服务器,支持连续批处理和SSD缓存,可从macOS菜单栏管理。

21.0K 1.8K
18 ktransformers

一个灵活的框架,用于体验异构LLM推理/微调优化。

19.3K 1.5K
19 web-llm

高性能浏览器内LLM推理引擎

18.6K 1.4K
20 TensorRT-LLM

在NVIDIA GPU上优化和部署大语言模型,实现最先进的推理性能。

14.5K 2.7K
< 上一页
/ 10
下一页 >