推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 121–140 项,共 183 个

排名 项目 Stars Forks
121 pruna

Pruna 是一个面向开发者的模型优化框架,让您以最小的开销交付更快、更高效的模型。

1.3K 103
122 local-ai-packaged

在一个软件包中运行所有本地AI - Ollama、Supabase、n8n、Open WebUI等!

3.8K 1.4K
123 kubeai

AI推理操作器,用于Kubernetes。在生产环境中服务ML模型的最简单方式。支持VLM、LLM、嵌入和语音转文本。

1.3K 134
124 mleap

MLeap:将ML流水线部署到生产环境

1.5K 316
125 seldon-core

一个MLOps框架,用于打包、部署、监控和管理数千个生产机器学习模型。

4.8K 868
126 kvcached

虚拟化弹性KV缓存,用于动态GPU共享及更多场景

1.1K 133
127 DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

DeepSeek-v4-Flash 0731 用于2x DGX Sparks的配方

1.1K 150
128 wllama

用于 llama.cpp 的 WebAssembly 绑定 - 在浏览器中实现 LLM 推理

1.2K 119
129 kvpress

轻松实现LLM KV缓存压缩

1.2K 172
130 llama.rn

React Native 绑定 llama.cpp

1.0K 115
131 locally-uncensored

即插即用的本地AI工作室:无审查聊天、图像与视频生成、编程代理。运行去审查的LLMs和ComfyUI,100%离线。一个安装程序,无需Docker,无需云。

1.2K 199
132 Comfy-WaveSpeed

https://wavespeed.ai/ [WIP] 面向ComfyUI的一体化推理优化解决方案,通用、灵活且快速。

1.2K 68
133 gollama

用Go管理你的Ollama模型

1.8K 109
134 paddler

开源的LLM/VLM负载均衡器和服务平台,用于大规模自托管LLM(和VLM)🏓🦙 是llm-d、Docker Model Runner等项目的替代方案,但组件更少,部署更简单,围绕ggml生态系统构建。支持CPU和GPU运行。

1.7K 97
135 BrowserAI

在浏览器中运行本地大语言模型,如llama、deepseek-distill、kokoro等

1.4K 137
136 OnnxStream

轻量级ONNX文件推理库,用C++编写。可在RPI Zero 2上运行Stable Diffusion XL 1.0(或298MB内存),也可在桌面和服务器上运行Mistral 7B。支持ARM、x86、WASM、RISC-V。由XNNPACK加速。提供Python、C#和JS(WASM)绑定。

2.1K 99
137 parallax

Parallax 是一个分布式模型服务框架,让你可以在任何地方构建自己的 AI 集群。

1.4K 146
138 ollama-js

Ollama JavaScript 库

4.4K 471
139 HuggingFaceModelDownloader

简单的Go工具,用于下载HuggingFace模型和数据集

1.2K 124
140 infinity

Infinity 是一个高吞吐量、低延迟的文本嵌入、重排序模型、clip、clap 和 colpali 的服务引擎。

2.9K 198
< 上一页
/ 10
下一页 >