推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 121 |
pruna
Pruna 是一个面向开发者的模型优化框架,让您以最小的开销交付更快、更高效的模型。 |
1.3K | 103 | 08/27/26 | Apache-2.0 |
| 122 |
local-ai-packaged
在一个软件包中运行所有本地AI - Ollama、Supabase、n8n、Open WebUI等! |
3.8K | 1.4K | 05/25/26 | Apache-2.0 |
| 123 |
kubeai
AI推理操作器,用于Kubernetes。在生产环境中服务ML模型的最简单方式。支持VLM、LLM、嵌入和语音转文本。 |
1.3K | 134 | 08/24/26 | Apache-2.0 |
| 124 |
mleap
MLeap:将ML流水线部署到生产环境 |
1.5K | 316 | 07/21/26 | Apache-2.0 |
| 125 |
seldon-core
一个MLOps框架,用于打包、部署、监控和管理数千个生产机器学习模型。 |
4.8K | 868 | 03/23/26 | Other |
| 126 |
kvcached
虚拟化弹性KV缓存,用于动态GPU共享及更多场景 |
1.1K | 133 | 08/23/26 | Apache-2.0 |
| 127 |
DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
DeepSeek-v4-Flash 0731 用于2x DGX Sparks的配方 |
1.1K | 150 | 08/29/26 | MIT |
| 128 |
wllama
用于 llama.cpp 的 WebAssembly 绑定 - 在浏览器中实现 LLM 推理 |
1.2K | 119 | 08/27/26 | MIT |
| 129 |
kvpress
轻松实现LLM KV缓存压缩 |
1.2K | 172 | 08/18/26 | Apache-2.0 |
| 130 |
llama.rn
React Native 绑定 llama.cpp |
1.0K | 115 | 08/28/26 | MIT |
| 131 |
locally-uncensored
即插即用的本地AI工作室:无审查聊天、图像与视频生成、编程代理。运行去审查的LLMs和ComfyUI,100%离线。一个安装程序,无需Docker,无需云。 |
1.2K | 199 | 08/24/26 | AGPL-3.0 |
| 132 |
Comfy-WaveSpeed
https://wavespeed.ai/ [WIP] 面向ComfyUI的一体化推理优化解决方案,通用、灵活且快速。 |
1.2K | 68 | 08/21/26 | MIT |
| 133 |
gollama
用Go管理你的Ollama模型 |
1.8K | 109 | 07/20/26 | MIT |
| 134 |
paddler
开源的LLM/VLM负载均衡器和服务平台,用于大规模自托管LLM(和VLM)🏓🦙 是llm-d、Docker Model Runner等项目的替代方案,但组件更少,部署更简单,围绕ggml生态系统构建。支持CPU和GPU运行。 |
1.7K | 97 | 07/19/26 | Apache-2.0 |
| 135 |
BrowserAI
在浏览器中运行本地大语言模型,如llama、deepseek-distill、kokoro等 |
1.4K | 137 | 07/21/26 | MIT |
| 136 |
OnnxStream
轻量级ONNX文件推理库,用C++编写。可在RPI Zero 2上运行Stable Diffusion XL 1.0(或298MB内存),也可在桌面和服务器上运行Mistral 7B。支持ARM、x86、WASM、RISC-V。由XNNPACK加速。提供Python、C#和JS(WASM)绑定。 |
2.1K | 99 | 06/18/26 | Other |
| 137 |
parallax
Parallax 是一个分布式模型服务框架,让你可以在任何地方构建自己的 AI 集群。 |
1.4K | 146 | 07/01/26 | Apache-2.0 |
| 138 |
ollama-js
Ollama JavaScript 库 |
4.4K | 471 | 02/18/26 | MIT |
| 139 |
HuggingFaceModelDownloader
简单的Go工具,用于下载HuggingFace模型和数据集 |
1.2K | 124 | 06/13/26 | Apache-2.0 |
| 140 |
infinity
Infinity 是一个高吞吐量、低延迟的文本嵌入、重排序模型、clip、clap 和 colpali 的服务引擎。 |
2.9K | 198 | 03/24/26 | MIT |