#117 · 主分类: 推理与本地部署
sonar
大规模LLM推理引擎
项目最后更新:08/13/26
GitHub Stars
1.8K
Forks数量
208
贡献者数量
43
许可证
AGPL-3.0
收录理由
Sonar 是一个面向 Hugging Face 兼容文本与多模态模型的推理引擎,源自 vLLM 的衍生项目,适合希望自建硬件承载高流量服务的团队。它把实际部署所需的底层机制整合在一起:连续批处理、分页 KV 缓存管理、前缀缓存、投机解码,以及量化至 FP8 KV 缓存的能力,全部通过兼容 OpenAI 的 API 暴露出来。部署上可跨多节点运行而无需 Ray 集群,安装脚本除常规 CUDA 路径外,还覆盖 AMD ROCm、CPU 与苹果芯片。该项目已在 Dolphin Inference Network 和 PygmalionAI 上承载生产流量,说明那些棘手的边界情况多半已被处理妥当。对于追求宽泛硬件与模型覆盖的自托管服务场景,它值得仔细评估。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。