推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 41–60 项,共 183 个

排名 项目 Stars Forks
41 Mooncake

Mooncake是Kimi的服务平台,Kimi是Moonshot AI提供的领先LLM服务。

6.4K 1.1K
42 kserve

用于Kubernetes上可扩展、多框架部署的标准化分布式生成式与预测性AI推理平台

5.8K 1.6K
43 mlx-lm

使用 MLX 运行大语言模型

6.8K 1.0K
44 GenieX

通过几行代码,在骁龙设备上的NPU、GPU和CPU上本地运行前沿LLM和VLM。

8.3K 1.0K
45 mistral.rs

快速灵活的LLM推理

7.6K 689
46 serving

一个灵活、高性能的机器学习模型服务系统

6.4K 2.2K
47 stable-diffusion.cpp

纯C/C++实现的扩散模型(SD、Flux、Wan、Qwen Image、Z-Image等)推理

6.9K 761
48 vllm-ascend

社区维护的硬件插件,用于Ascend上的vLLM

2.7K 2.1K
49 coremltools

Core ML 工具包含用于 Core ML 模型转换、编辑和验证的支持工具。

5.4K 838
50 kimi-k3-in-c

2.78万亿参数的Kimi K3,在8.24 GB内存的单CPU上运行推理。便携C99:无需BLAS、无框架、无GPU。

6.7K 1.1K
51 mlx-vlm

MLX-VLM 是一个用于在 Mac 上使用 MLX 进行视觉语言模型(VLM)推理和微调的包。

5.4K 751
52 lemonade

Lemonade帮助用户通过自己的GPU和NPU运行优化的大语言模型,从而发现并运行本地AI应用。加入我们的Discord:https://discord.gg/5xXzkMu8Zk

5.5K 479
53 turbo-fieldfare

在任意 M 系列 MacBook 上,约 2GB 内存即可进行 Gemma 4 26B-A4B 推理

6.5K 408
54 iree

一个基于MLIR的可重定向机器学习编译器与运行时工具包。

3.9K 995
55 whichllm

在你的硬件上找到真正能运行且表现最佳的本地LLM。按真实、时效性感知的基准排名,而非参数数量。一条命令,即刻运行。

6.5K 357
56 cactus

面向移动设备、可穿戴设备、智能家居和机器人的量化、内核、运行时和推理引擎。

6.0K 497
57 gpustack

用于高性能AI模型服务(vLLM、SGLang)和按需SSH访问GPU实例的GPU集群管理器。

5.6K 631
58 apfel

Mac 上免费的 AI。命令行工具、兼容 OpenAI 的服务器和交互式聊天——全部通过 Apple Intelligence 在设备上运行。无需 API 密钥,无需云,无需下载。

6.3K 243
59 shimmy

⚡ 纯Rust WebGPU推理引擎——兼容OpenAI API,原生GGUF,可在任何GPU上运行。无需Python,无需llama.cpp,单二进制文件。

5.8K 561
60 llm-d

在Kubernetes上使用现代加速器实现最先进的推理性能

4.3K 728
< 上一页
/ 10
下一页 >