推理与本地部署

高吞吐推理与本地运行环境,如 Ollama、vLLM、Triton 等。

共 183 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 61–80 项,共 183 个

排名 项目 Stars Forks
61 Paddle-Lite

飞桨高性能深度学习端侧推理引擎

7.3K 1.6K
62 FastDeploy

基于PaddlePaddle的高性能LLM和VLM推理与部署工具包

3.7K 760
63 fastllm

fastllm是后端无依赖的高性能大模型推理库。同时支持张量并行推理稠密模型和混合模式推理MOE模型,任意10G以上显卡即可推理满血DeepSeek。双路9004/9005服务器+单显卡部署DeepSeek满血满精度原版模型,单并发20tps;INT4量化模型单并发30tps,多并发可达60+。

4.9K 485
64 ODS

将您的PC、Mac或Linux设备变成AI服务器。支持LLM推理、聊天界面、语音、智能体、工作流、RAG和图像生成。

4.9K 741
65 RWKV-Runner

一个RWKV管理和启动工具,全自动化,仅8MB。并提供与OpenAI API兼容的接口。RWKV是一个完全开源且可商用的大型语言模型。

6.5K 600
66 llm-compressor

与Transformers兼容的库,用于对LLM应用各种压缩算法,以优化vLLM部署。

3.7K 644
67 lms

LM Studio CLI

5.2K 447
68 jetson-containers

适用于NVIDIA Jetson和JetPack-L4T的机器学习容器

4.8K 845
69 CTranslate2

Transformer模型的快速推理引擎

4.7K 522
70 lollms-webui

大型语言与多模态系统之主的Web用户界面

4.8K 587
71 text-embeddings-inference

用于文本嵌入模型的极速推理解决方案

5.0K 426
72 LightLLM

LightLLM是一个基于Python的LLM(大型语言模型)推理和服务框架,以其轻量级设计、易于扩展和高性能而著称。

4.3K 357
73 optimum

🚀 使用易于使用的硬件优化工具加速🤗 Transformers、Diffusers、TIMM和Sentence Transformers的推理和训练

3.5K 680
74 ComputeLibrary

Compute Library 是一套计算机视觉和机器学习函数,使用 SIMD 技术针对 Arm CPU 和 GPU 进行了优化。

3.2K 819
75 Model-Optimizer

一个统一的最先进模型优化技术库(量化、剪枝、NAS、蒸馏、投机解码),用于压缩和加速深度学习模型,以便在TensorRT-LLM、vLLM和SGLang等框架中部署。

3.6K 565
76 zml

任何模型。任何硬件。零妥协。使用 @ziglang / @openxla / MLIR / @bazelbuild 构建。

4.0K 179
77 TensorRT

面向NVIDIA GPU的PyTorch/TorchScript/FX编译器,基于TensorRT

3.0K 409
78 ramalama

RamaLama是一个开源开发者工具,它简化了AI模型从任何来源的本地服务,并促进它们在生产环境中用于推理,这一切都通过熟悉的容器语言实现。

3.0K 360
79 LitServe

一个极简的Python框架,用于构建自定义AI推理服务器,可完全控制逻辑、批处理和扩展。

3.9K 301
80 Rapid-MLX

Apple Silicon 上最快的本地 AI 引擎。比 Ollama 快 4.2 倍,缓存 TTFT 0.08 秒,100% 工具调用。17 种工具解析器、提示缓存、推理分离、云路由。OpenAI 的即插即用替代品。兼容 Claude Code、Cursor、Aider。

3.6K 402
< 上一页
/ 10
下一页 >