推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 161–180 项,共 183 个

排名 项目 Stars Forks
161 cortex

大规模机器学习的生产基础设施

8.0K 594
162 streaming-llm

[ICLR 2024] 高效流式语言模型(使用 Attention Sinks)

7.3K 399
163 mmdeploy

OpenMMLab 模型部署框架

3.1K 715
164 mace

MACE是一个深度学习推理框架,针对移动异构计算平台进行了优化。

5.0K 819
165 gpu_poor

计算任何LLM的token/s和GPU内存需求。支持llama.cpp/ggml/bnb/QLoRA量化。

1.4K 88
166 api-for-open-llm

开源大模型的统一后端接口

2.5K 271
167 transformer-deploy

高效、可扩展且企业级的 CPU/GPU 推理服务器,适用于 🤗 Hugging Face 变压器模型 🚀

1.7K 153
168 chatglm.cpp

ChatGLM-6B、ChatGLM2-6B、ChatGLM3和GLM4(V)的C++实现

3.0K 326
169 llama.go

llama.go 就像纯 Go 语言版的 llama.cpp!

1.4K 73
170 Medusa

Medusa:简单框架,用于通过多个解码头加速LLM生成

2.8K 205
171 FreedomGPT

此代码库用于一个基于React和Electron的应用,该应用在Mac和Windows上通过聊天式界面本地(离线且私密)运行FreedomGPT LLM。

2.7K 363
172 mixtral-offloading

在Colab或消费级桌面上运行Mixtral-8x7B模型

2.3K 225
173 punica

将多个LoRA微调的LLM整合为单一服务

1.2K 64
174 ppq

PPL量化工具(PPQ)是一款强大的离线神经网络量化工具。

1.8K 285
175 WebGPT

使用WebGPU在浏览器上运行GPT模型。这是一个不到约1500行纯Javascript实现的GPT推理。

3.8K 223
176 llama2-webui

在本地运行任意 Llama 2,通过 gradio UI 在 GPU 或 CPU 上,支持 Linux/Windows/Mac。使用 `llama2-wrapper` 作为你的本地 llama2 后端,用于生成式代理/应用。

1.9K 199
177 ctransformers

使用GGML库以C/C++实现的Transformer模型的Python绑定。

1.9K 143
178 budgetml

以较低成本部署ML推理服务,代码不超过10行。

1.3K 65
179 text-generation-webui-colab

用于运行大型语言模型的 Colab Gradio 网页界面

2.1K 356
180 Bender

轻松在iOS上构建快速神经网络!使用TensorFlow模型。底层基于Metal。

1.8K 89
< 上一页
/ 10
下一页 >