推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 141–160 项,共 183 个

排名 项目 Stars Forks
141 ollama-docker

欢迎使用Ollama Docker Compose设置!此项目简化了使用Docker Compose部署Ollama的过程,使您能够轻松地在容器化环境中运行Ollama及其所有依赖项。

1.4K 254
142 SageAttention

[ICLR2025, ICML2025, NeurIPS2025 Spotlight] 量化注意力相比FlashAttention实现了2-5倍的加速,同时不损失语言、图像和视频模型的端到端指标。

3.7K 493
143 TensorRT-YOLO

🚀 更简单更快速的 NVIDIA YOLO 部署工具包 🛠️

1.9K 194
144 turboquant

TurboQuant:面向LLM推理的近最优KV缓存量化(3位键,2位值),包含Triton内核与vLLM集成。

1.7K 195
145 rotorquant

通过块对角旋转实现KV缓存压缩。优于TurboQuant:更好的PPL(6.91 vs 7.07),解码速度提升28%,预填充速度提升5.3倍,参数量减少44倍。可无缝集成到llama.cpp中。

1.0K 89
146 deepseek-ocr.rs

Rust多后端OCR/VLM引擎(DeepSeek-OCR-1/2、PaddleOCR-VL、DotsOCR),支持DSQ量化,提供OpenAI兼容服务器和CLI,无需Python即可本地运行。

2.2K 169
147 gaianet-node

安装、运行和部署你自己的去中心化AI代理服务

5.0K 326
148 picolm

在256MB内存的10美元开发板上运行10亿参数的大语言模型

1.9K 240
149 LLMFarm

使用GGML库在iOS和MacOS上离线运行llama及其他大型语言模型。

2.1K 180
150 LlamaEdge

在本地或边缘运行定制和微调LLM的最简单、最快的方式

1.7K 149
151 comfyui-deploy

一个开源的类似Vercel的部署平台,用于Comfy UI

1.5K 219
152 hummingbird

Hummingbird 将训练好的机器学习模型编译为张量计算,以加速推理。

3.5K 292
153 Jlama

Jlama 是一个面向 Java 的现代 LLM 推理引擎

1.3K 164
154 dalai

在本地机器上运行LLaMA的最简单方式

12.9K 1.3K
155 petals

🌸 在家运行LLM,BitTorrent风格。微调和推理比卸载快10倍。

10.5K 643
156 DeepSpeed-MII

MII 借助 DeepSpeed 实现低延迟和高吞吐量的推理。

2.1K 192
157 Tengine

Tengine 是一个轻量、高性能、模块化的嵌入式设备推理引擎。

4.5K 982
158 TurboTransformers

一个快速且易于使用的Transformer推理运行时,支持CPU和GPU,适用于Bert、Albert、GPT2、解码器等模型。

1.5K 208
159 uTensor

TinyML AI推理库

1.9K 250
160 rwkv.cpp

在CPU上对RWKV语言模型进行INT4/INT5/INT8和FP16推理

1.6K 129
< 上一页
/ 10
下一页 >