推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 41 |
Mooncake
Mooncake是Kimi的服务平台,Kimi是Moonshot AI提供的领先LLM服务。 |
6.4K | 1.1K | 08/29/26 | Apache-2.0 |
| 42 |
kserve
用于Kubernetes上可扩展、多框架部署的标准化分布式生成式与预测性AI推理平台 |
5.8K | 1.6K | 08/29/26 | Apache-2.0 |
| 43 |
mlx-lm
使用 MLX 运行大语言模型 |
6.8K | 1.0K | 08/29/26 | MIT |
| 44 |
GenieX
通过几行代码,在骁龙设备上的NPU、GPU和CPU上本地运行前沿LLM和VLM。 |
8.3K | 1.0K | 08/28/26 | BSD-3-Clause |
| 45 |
mistral.rs
快速灵活的LLM推理 |
7.6K | 689 | 08/29/26 | MIT |
| 46 |
serving
一个灵活、高性能的机器学习模型服务系统 |
6.4K | 2.2K | 08/28/26 | Apache-2.0 |
| 47 |
stable-diffusion.cpp
纯C/C++实现的扩散模型(SD、Flux、Wan、Qwen Image、Z-Image等)推理 |
6.9K | 761 | 08/27/26 | MIT |
| 48 |
vllm-ascend
社区维护的硬件插件,用于Ascend上的vLLM |
2.7K | 2.1K | 08/29/26 | Apache-2.0 |
| 49 |
coremltools
Core ML 工具包含用于 Core ML 模型转换、编辑和验证的支持工具。 |
5.4K | 838 | 08/27/26 | BSD-3-Clause |
| 50 |
kimi-k3-in-c
2.78万亿参数的Kimi K3,在8.24 GB内存的单CPU上运行推理。便携C99:无需BLAS、无框架、无GPU。 |
6.7K | 1.1K | 08/26/26 | Apache-2.0 |
| 51 |
mlx-vlm
MLX-VLM 是一个用于在 Mac 上使用 MLX 进行视觉语言模型(VLM)推理和微调的包。 |
5.4K | 751 | 08/29/26 | MIT |
| 52 |
lemonade
Lemonade帮助用户通过自己的GPU和NPU运行优化的大语言模型,从而发现并运行本地AI应用。加入我们的Discord:https://discord.gg/5xXzkMu8Zk |
5.5K | 479 | 08/30/26 | Apache-2.0 |
| 53 |
turbo-fieldfare
在任意 M 系列 MacBook 上,约 2GB 内存即可进行 Gemma 4 26B-A4B 推理 |
6.5K | 408 | 08/29/26 | Apache-2.0 |
| 54 |
iree
一个基于MLIR的可重定向机器学习编译器与运行时工具包。 |
3.9K | 995 | 08/29/26 | Apache-2.0 |
| 55 |
whichllm
在你的硬件上找到真正能运行且表现最佳的本地LLM。按真实、时效性感知的基准排名,而非参数数量。一条命令,即刻运行。 |
6.5K | 357 | 08/14/26 | MIT |
| 56 |
cactus
面向移动设备、可穿戴设备、智能家居和机器人的量化、内核、运行时和推理引擎。 |
6.0K | 497 | 08/26/26 | Other |
| 57 |
gpustack
用于高性能AI模型服务(vLLM、SGLang)和按需SSH访问GPU实例的GPU集群管理器。 |
5.6K | 631 | 08/28/26 | Apache-2.0 |
| 58 |
apfel
Mac 上免费的 AI。命令行工具、兼容 OpenAI 的服务器和交互式聊天——全部通过 Apple Intelligence 在设备上运行。无需 API 密钥,无需云,无需下载。 |
6.3K | 243 | 08/05/26 | MIT |
| 59 |
shimmy
⚡ 纯Rust WebGPU推理引擎——兼容OpenAI API,原生GGUF,可在任何GPU上运行。无需Python,无需llama.cpp,单二进制文件。 |
5.8K | 561 | 08/29/26 | Apache-2.0 |
| 60 |
llm-d
在Kubernetes上使用现代加速器实现最先进的推理性能 |
4.3K | 728 | 08/29/26 | Apache-2.0 |