推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 21–40 项,共 183 个

排名 项目 Stars Forks
21 MNN

MNN:一个极速、轻量级的推理引擎,由阿里巴巴实战检验,驱动高性能端侧大语言模型和边缘AI。

16.0K 2.4K
22 openvino

OpenVINO™ 是一个用于优化和部署AI推理的开源工具包。

10.8K 3.3K
23 TensorRT

NVIDIA® TensorRT™ 是一个用于在 NVIDIA GPU 上进行高性能深度学习推理的 SDK。该仓库包含 TensorRT 的开源组件。

13.3K 2.4K
24 LMCache

LMCache:以最快的KV缓存层加速你的大语言模型

11.6K 1.8K
25 WasmEdge

WasmEdge 是一个轻量级、高性能、可扩展的 WebAssembly 运行时,适用于云原生、边缘和去中心化应用。它为无服务器应用、嵌入式函数、微服务、智能合约和物联网设备提供支持。

10.8K 1.2K
26 OpenLLM

在云端运行任何开源LLM(如DeepSeek和Llama),作为OpenAI兼容的API端点。

12.5K 836
27 nano-vllm

Nano vLLM

15.2K 2.5K
28 server

Triton推理服务器为云端和边缘提供优化的推理解决方案。

10.9K 1.8K
29 llama-cpp-python

llama.cpp 的 Python 绑定

10.6K 1.5K
30 inference

通过更改一行代码,即可将GPT替换为任何LLM。Xinference让您可以在云端、本地或笔记本电脑上运行开源、语音和多模态模型——全部通过一个统一的、生产就绪的推理API。

9.5K 865
31 runanywhere-sdks

本地运行AI的生产就绪工具包

10.3K 370
32 BentoML

服务AI应用和模型的最简单方式 - 构建模型推理API、任务队列、LLM应用、多模型流水线等!

8.8K 1.0K
33 serve

☁️ 使用云原生技术栈构建多模态AI应用

21.9K 2.2K
34 ollama-python

Ollama Python 库

10.5K 1.2K
35 PowerInfer

高速大语言模型本地部署推理服务

9.8K 597
36 cog

用于机器学习的容器

9.5K 697
37 ik_llama.cpp

llama.cpp 的分支,带有额外的 SOTA 量化和改进的性能

3.1K 444
38 executorch

在移动、嵌入式及边缘设备上运行PyTorch的AI

5.0K 1.1K
39 vllm-omni

用于全模态模型高效推理的框架

6.5K 1.6K
40 lmdeploy

LMDeploy 是一个用于压缩、部署和服务 LLM 的工具包。

8.0K 733
< 上一页
/ 10
下一页 >