#141 · 主分类: 推理与本地部署

atlas

cuda dgx dgx-spark gb10 llm-inference mamba nvfp4 openai-api rust speculative-decoding ssm transformers

纯 Rust 推理引擎

项目最后更新:08/30/26

GitHub Stars

672

Forks数量

103

贡献者数量

23

许可证

AGPL-3.0

收录理由

Atlas 是一个完全用 Rust 从零写成的 LLM 推理引擎,面向那些希望在自己硬件上跑大模型、而不是按 token 付费使用云服务的团队。它针对 NVIDIA、AMD 和 Intel 的特定硬件与模型家族提供了调优过的内核,并内置了投机解码和 KV 缓存量化,既能运行 Mamba/SSM 架构,也支持常规的 transformer 模型。由于提供了与 OpenAI 兼容的 API,现有工具链几乎不用改动就能直接对接,对于已经在用 llama.cpp 或 vLLM、又想要更快且依赖更少的替代方案的人来说,可以无缝切换。项目还详细说明了如何添加新的硬件目标和模型,如果你打算在它基础上做扩展而不是仅仅使用,这会很有帮助。不过在把它作为生产级服务层之前,建议仔细研究其内核策略和 AGPLv3 许可证的影响。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目