#59 · 主分类: 推理与本地部署
shimmy
api-server
command-line-tool
developer-tools
gguf
huggingface
huggingface-models
huggingface-transformers
inference-server
llama
llamacpp
llm-inference
local-ai
machine-learning
ollama-api
openai-compatible
rust
rust-crate
transformers
webgpu
webgpu-shaders
⚡ 纯Rust WebGPU推理引擎——兼容OpenAI API,原生GGUF,可在任何GPU上运行。无需Python,无需llama.cpp,单二进制文件。
项目最后更新:08/29/26
GitHub Stars
5.8K
Forks数量
561
贡献者数量
1
许可证
Apache-2.0
收录理由
Shimmy 是一个纯 Rust 写的单二进制推理服务,直接把 GGUF 模型包装成 OpenAI 兼容的聊天接口,已有的 AI 工具改个地址就能用,省去一堆对接工作。底层推理跑在自研的 WebGPU 引擎上,不依赖 Python 或 C++ 工具链,几乎任何 GPU 都能跑,连核显也不在话下。对于重视隐私、想把模型留在自己机器上的用户,或者在小团队里用笔记本做本地推理、又不想折腾依赖环境的场景,都挺合适。下载一个文件,指向 GGUF 模型就能启动,现有客户端照常工作。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。