#59 · 主分类: 推理与本地部署

shimmy

api-server command-line-tool developer-tools gguf huggingface huggingface-models huggingface-transformers inference-server llama llamacpp llm-inference local-ai machine-learning ollama-api openai-compatible rust rust-crate transformers webgpu webgpu-shaders

⚡ 纯Rust WebGPU推理引擎——兼容OpenAI API,原生GGUF,可在任何GPU上运行。无需Python,无需llama.cpp,单二进制文件。

项目最后更新:08/29/26

GitHub Stars

5.8K

Forks数量

561

贡献者数量

1

许可证

Apache-2.0

收录理由

Shimmy 是一个纯 Rust 写的单二进制推理服务,直接把 GGUF 模型包装成 OpenAI 兼容的聊天接口,已有的 AI 工具改个地址就能用,省去一堆对接工作。底层推理跑在自研的 WebGPU 引擎上,不依赖 Python 或 C++ 工具链,几乎任何 GPU 都能跑,连核显也不在话下。对于重视隐私、想把模型留在自己机器上的用户,或者在小团队里用笔记本做本地推理、又不想折腾依赖环境的场景,都挺合适。下载一个文件,指向 GGUF 模型就能启动,现有客户端照常工作。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目