推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 141 |
ollama-docker
欢迎使用Ollama Docker Compose设置!此项目简化了使用Docker Compose部署Ollama的过程,使您能够轻松地在容器化环境中运行Ollama及其所有依赖项。 |
1.4K | 254 | 05/26/26 | Other |
| 142 |
SageAttention
[ICLR2025, ICML2025, NeurIPS2025 Spotlight] 量化注意力相比FlashAttention实现了2-5倍的加速,同时不损失语言、图像和视频模型的端到端指标。 |
3.7K | 493 | 01/17/26 | Apache-2.0 |
| 143 |
TensorRT-YOLO
🚀 更简单更快速的 NVIDIA YOLO 部署工具包 🛠️ |
1.9K | 194 | 03/22/26 | GPL-3.0 |
| 144 |
turboquant
TurboQuant:面向LLM推理的近最优KV缓存量化(3位键,2位值),包含Triton内核与vLLM集成。 |
1.7K | 195 | 03/27/26 | GPL-3.0 |
| 145 |
rotorquant
通过块对角旋转实现KV缓存压缩。优于TurboQuant:更好的PPL(6.91 vs 7.07),解码速度提升28%,预填充速度提升5.3倍,参数量减少44倍。可无缝集成到llama.cpp中。 |
1.0K | 89 | 04/23/26 | Other |
| 146 |
deepseek-ocr.rs
Rust多后端OCR/VLM引擎(DeepSeek-OCR-1/2、PaddleOCR-VL、DotsOCR),支持DSQ量化,提供OpenAI兼容服务器和CLI,无需Python即可本地运行。 |
2.2K | 169 | 02/21/26 | Apache-2.0 |
| 147 |
gaianet-node
安装、运行和部署你自己的去中心化AI代理服务 |
5.0K | 326 | 10/13/25 | GPL-3.0 |
| 148 |
picolm
在256MB内存的10美元开发板上运行10亿参数的大语言模型 |
1.9K | 240 | 02/22/26 | MIT |
| 149 |
LLMFarm
使用GGML库在iOS和MacOS上离线运行llama及其他大型语言模型。 |
2.1K | 180 | 01/30/26 | MIT |
| 150 |
LlamaEdge
在本地或边缘运行定制和微调LLM的最简单、最快的方式 |
1.7K | 149 | 02/08/26 | Apache-2.0 |
| 151 |
comfyui-deploy
一个开源的类似Vercel的部署平台,用于Comfy UI |
1.5K | 219 | 11/13/25 | AGPL-3.0 |
| 152 |
hummingbird
Hummingbird 将训练好的机器学习模型编译为张量计算,以加速推理。 |
3.5K | 292 | 07/17/25 | MIT |
| 153 |
Jlama
Jlama 是一个面向 Java 的现代 LLM 推理引擎 |
1.3K | 164 | 10/12/25 | Apache-2.0 |
| 154 |
dalai
在本地机器上运行LLaMA的最简单方式 |
12.9K | 1.3K | 06/18/24 | Other |
| 155 |
petals
🌸 在家运行LLM,BitTorrent风格。微调和推理比卸载快10倍。 |
10.5K | 643 | 09/07/24 | MIT |
| 156 |
DeepSpeed-MII
MII 借助 DeepSpeed 实现低延迟和高吞吐量的推理。 |
2.1K | 192 | 06/30/25 | Apache-2.0 |
| 157 |
Tengine
Tengine 是一个轻量、高性能、模块化的嵌入式设备推理引擎。 |
4.5K | 982 | 03/06/25 | Apache-2.0 |
| 158 |
TurboTransformers
一个快速且易于使用的Transformer推理运行时,支持CPU和GPU,适用于Bert、Albert、GPT2、解码器等模型。 |
1.5K | 208 | 07/18/25 | Other |
| 159 |
uTensor
TinyML AI推理库 |
1.9K | 250 | 05/10/25 | Apache-2.0 |
| 160 |
rwkv.cpp
在CPU上对RWKV语言模型进行INT4/INT5/INT8和FP16推理 |
1.6K | 129 | 03/23/25 | MIT |