#117 · 主分类: 推理与本地部署

sonar

api-rest cuda inference-engine inferentia intel lora machine-learning rocm speculative-decoding tpu

大规模LLM推理引擎

项目最后更新:08/13/26

GitHub Stars

1.8K

Forks数量

208

贡献者数量

43

许可证

AGPL-3.0

收录理由

Sonar 是一个面向 Hugging Face 兼容文本与多模态模型的推理引擎,源自 vLLM 的衍生项目,适合希望自建硬件承载高流量服务的团队。它把实际部署所需的底层机制整合在一起:连续批处理、分页 KV 缓存管理、前缀缓存、投机解码,以及量化至 FP8 KV 缓存的能力,全部通过兼容 OpenAI 的 API 暴露出来。部署上可跨多节点运行而无需 Ray 集群,安装脚本除常规 CUDA 路径外,还覆盖 AMD ROCm、CPU 与苹果芯片。该项目已在 Dolphin Inference Network 和 PygmalionAI 上承载生产流量,说明那些棘手的边界情况多半已被处理妥当。对于追求宽泛硬件与模型覆盖的自托管服务场景,它值得仔细评估。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目