推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 101–120 项,共 183 个

排名 项目 Stars Forks
101 Bonsai-demo

Bonsai 演示

2.3K 233
102 spark-vllm-docker

用于在双DGX Sparks上运行VLLM的Docker配置

2.2K 373
103 club-3090

在RTX 3090/4090/5090 CUDA GPU上部署LLM的社区方案。多引擎(vLLM、llama.cpp、ik_llama)且模型无关。目前提供Qwen3.6-27B、Qwen3.6 35B、Gemma 4 26B、Gemma 4 31B的配置,适用于单卡和双卡。

2.1K 128
104 vllm-metal

社区维护的适用于Apple Silicon的vLLM硬件插件。

1.7K 233
105 lorax

多LoRA推理服务器,可扩展到数千个微调LLM

3.8K 326
106 FastFlowLM

在AMD Ryzen™ AI NPU上几分钟内运行LLM;专为AMD NPU打造并深度优化。

1.8K 145
107 FastFlowLM

在AMD Ryzen™ AI NPU上运行LLM,几分钟即可完成;专为AMD NPU打造并深度优化。

1.8K 145
108 GPTQModel

LLM模型量化(压缩)工具包,通过HF、vLLM和SGLang支持Nvidia、AMD、Intel GPU及Intel/AMD/Apple CPU的硬件加速。

1.2K 204
109 react-native-executorch

在React Native设备上运行AI模型的声明式方式,由ExecuTorch驱动。

1.7K 95
110 truss

在生产环境中服务 AI/ML 模型的最简单方式

1.2K 122
111 vllm-mlx

适用于Apple Silicon的高性能OpenAI和Anthropic兼容LLM推理服务器。原生MLX、连续批处理、多模态模型、MCP工具调用和Claude Code支持。

1.6K 219
112 auto-round

SOTA量化工具包,用于高精度低比特LLM推理,无缝优化CPU/XPU/CUDA,支持多种数据类型,并与vLLM、SGLang和Transformers完全兼容。

1.6K 168
113 nndeploy

一款简单易用和高性能的AI部署框架

1.9K 233
114 node-llama-cpp

通过llama.cpp的node.js绑定在本地运行AI模型,并在生成层面对模型输出强制执行JSON模式。

2.2K 215
115 distributed-llama

分布式LLM推理。将家用设备连接成强大的集群,加速LLM推理。设备越多,推理越快。

3.0K 248
116 uzu

高性能AI模型推理引擎

1.7K 73
117 sonar

大规模LLM推理引擎

1.8K 208
118 local-studio

VLLM、Sglang、llama.cpp、exllamav3 的控制面板

1.7K 155
119 ComfyUI-Docker

🐳用于🎨ComfyUI的Dockerfile | 容器镜像与启动脚本

1.6K 232
120 mllm

移动设备上的快速多模态大语言模型

1.6K 213
< 上一页
/ 10
下一页 >