推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 61 |
Paddle-Lite
飞桨高性能深度学习端侧推理引擎 |
7.3K | 1.6K | 04/27/26 | Apache-2.0 |
| 62 |
FastDeploy
基于PaddlePaddle的高性能LLM和VLM推理与部署工具包 |
3.7K | 760 | 08/26/26 | Apache-2.0 |
| 63 |
fastllm
fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。 |
4.9K | 485 | 08/29/26 | Apache-2.0 |
| 64 |
ODS
将您的PC、Mac或Linux设备变成AI服务器。支持LLM推理、聊天界面、语音、智能体、工作流、RAG和图像生成。 |
4.9K | 741 | 08/30/26 | Apache-2.0 |
| 65 |
RWKV-Runner
一个RWKV管理和启动工具,全自动化,仅8MB。并提供与OpenAI API兼容的接口。RWKV是一个完全开源且可商用的大型语言模型。 |
6.5K | 600 | 07/07/26 | MIT |
| 66 |
llm-compressor
与Transformers兼容的库,用于对LLM应用各种压缩算法,以优化vLLM部署。 |
3.7K | 644 | 08/28/26 | Apache-2.0 |
| 67 |
lms
LM Studio CLI |
5.2K | 447 | 08/18/26 | MIT |
| 68 |
jetson-containers
适用于NVIDIA Jetson和JetPack-L4T的机器学习容器 |
4.8K | 845 | 08/10/26 | Other |
| 69 |
CTranslate2
Transformer模型的快速推理引擎 |
4.7K | 522 | 08/16/26 | MIT |
| 70 |
lollms-webui
大型语言与多模态系统之主的Web用户界面 |
4.8K | 587 | 08/13/26 | Apache-2.0 |
| 71 |
text-embeddings-inference
用于文本嵌入模型的极速推理解决方案 |
5.0K | 426 | 07/24/26 | Apache-2.0 |
| 72 |
LightLLM
LightLLM是一个基于Python的LLM(大型语言模型)推理和服务框架,以其轻量级设计、易于扩展和高性能而著称。 |
4.3K | 357 | 08/29/26 | Apache-2.0 |
| 73 |
optimum
🚀 使用易于使用的硬件优化工具加速🤗 Transformers、Diffusers、TIMM和Sentence Transformers的推理和训练 |
3.5K | 680 | 08/24/26 | Apache-2.0 |
| 74 |
ComputeLibrary
Compute Library 是一套计算机视觉和机器学习函数,使用 SIMD 技术针对 Arm CPU 和 GPU 进行了优化。 |
3.2K | 819 | 08/27/26 | Other |
| 75 |
Model-Optimizer
一个统一的最先进模型优化技术库(量化、剪枝、NAS、蒸馏、投机解码),用于压缩和加速深度学习模型,以便在TensorRT-LLM、vLLM和SGLang等框架中部署。 |
3.6K | 565 | 08/30/26 | Apache-2.0 |
| 76 |
zml
任何模型。任何硬件。零妥协。使用 @ziglang / @openxla / MLIR / @bazelbuild 构建。 |
4.0K | 179 | 08/29/26 | Apache-2.0 |
| 77 |
TensorRT
面向NVIDIA GPU的PyTorch/TorchScript/FX编译器,基于TensorRT |
3.0K | 409 | 08/30/26 | BSD-3-Clause |
| 78 |
ramalama
RamaLama是一个开源开发者工具,它简化了AI模型从任何来源的本地服务,并促进它们在生产环境中用于推理,这一切都通过熟悉的容器语言实现。 |
3.0K | 360 | 08/29/26 | MIT |
| 79 |
LitServe
一个极简的Python框架,用于构建自定义AI推理服务器,可完全控制逻辑、批处理和扩展。 |
3.9K | 301 | 08/17/26 | Apache-2.0 |
| 80 |
Rapid-MLX
Apple Silicon 上最快的本地 AI 引擎。比 Ollama 快 4.2 倍,缓存 TTFT 0.08 秒,100% 工具调用。17 种工具解析器、提示缓存、推理分离、云路由。OpenAI 的即插即用替代品。兼容 Claude Code、Cursor、Aider。 |
3.6K | 402 | 08/30/26 | Other |