推理与本地部署
高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。
共 183 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 161 |
cortex
大规模机器学习的生产基础设施 |
8.0K | 594 | 06/12/24 | Apache-2.0 |
| 162 |
streaming-llm
[ICLR 2024] 高效流式语言模型(使用 Attention Sinks) |
7.3K | 399 | 07/11/24 | MIT |
| 163 |
mmdeploy
OpenMMLab 模型部署框架 |
3.1K | 715 | 09/30/24 | Apache-2.0 |
| 164 |
mace
MACE是一个深度学习推理框架,针对移动异构计算平台进行了优化。 |
5.0K | 819 | 06/17/24 | Apache-2.0 |
| 165 |
gpu_poor
计算任何LLM的token/s和GPU内存需求。支持llama.cpp/ggml/bnb/QLoRA量化。 |
1.4K | 88 | 12/03/24 | Other |
| 166 |
api-for-open-llm
开源大模型的统一后端接口 |
2.5K | 271 | 09/26/24 | Apache-2.0 |
| 167 |
transformer-deploy
高效、可扩展且企业级的 CPU/GPU 推理服务器,适用于 🤗 Hugging Face 变压器模型 🚀 |
1.7K | 153 | 10/23/24 | Apache-2.0 |
| 168 |
chatglm.cpp
ChatGLM-6B、ChatGLM2-6B、ChatGLM3和GLM4(V)的C++实现 |
3.0K | 326 | 07/31/24 | MIT |
| 169 |
llama.go
llama.go 就像纯 Go 语言版的 llama.cpp! |
1.4K | 73 | 09/20/24 | Other |
| 170 |
Medusa
Medusa:简单框架,用于通过多个解码头加速LLM生成 |
2.8K | 205 | 06/25/24 | Apache-2.0 |
| 171 |
FreedomGPT
此代码库用于一个基于React和Electron的应用,该应用在Mac和Windows上通过聊天式界面本地(离线且私密)运行FreedomGPT LLM。 |
2.7K | 363 | 06/13/24 | GPL-3.0 |
| 172 |
mixtral-offloading
在Colab或消费级桌面上运行Mixtral-8x7B模型 |
2.3K | 225 | 04/08/24 | MIT |
| 173 |
punica
将多个LoRA微调的LLM整合为单一服务 |
1.2K | 64 | 05/08/24 | Apache-2.0 |
| 174 |
ppq
PPL量化工具(PPQ)是一款强大的离线神经网络量化工具。 |
1.8K | 285 | 03/28/24 | Apache-2.0 |
| 175 |
WebGPT
使用WebGPU在浏览器上运行GPT模型。这是一个不到约1500行纯Javascript实现的GPT推理。 |
3.8K | 223 | 01/12/24 | Other |
| 176 |
llama2-webui
在本地运行任意 Llama 2,通过 gradio UI 在 GPU 或 CPU 上,支持 Linux/Windows/Mac。使用 `llama2-wrapper` 作为你的本地 llama2 后端,用于生成式代理/应用。 |
1.9K | 199 | 03/22/24 | MIT |
| 177 |
ctransformers
使用GGML库以C/C++实现的Transformer模型的Python绑定。 |
1.9K | 143 | 01/28/24 | MIT |
| 178 |
budgetml
以较低成本部署ML推理服务,代码不超过10行。 |
1.3K | 65 | 02/12/24 | Apache-2.0 |
| 179 |
text-generation-webui-colab
用于运行大型语言模型的 Colab Gradio 网页界面 |
2.1K | 356 | 12/22/23 | Unlicense |
| 180 |
Bender
轻松在iOS上构建快速神经网络!使用TensorFlow模型。底层基于Metal。 |
1.8K | 89 | 11/07/23 | MIT |