#56 · 主分类: 推理与本地部署

cactus

ai android arm edge edge-ai framework ios llamacpp llm llm-inference llms mobile mobile-inference on-device-ai quantiz rag smartphone speech transformer whisper

面向移动设备、可穿戴设备、智能家居和机器人的量化、内核、运行时和推理引擎。

项目最后更新:08/26/26

GitHub Stars

6.0K

Forks数量

497

贡献者数量

52

许可证

Other

收录理由

Cactus 并非单一的推理服务程序,而是一套完整的端侧推理工具链,面向在手机、可穿戴设备、智能家居和机器人上运行大语言模型的团队。它把基于旋转的量化方案与针对 Apple、Samsung、Pixel 芯片调优的 CPU/GPU 内核结合起来,并通过兼容 OpenAI 的接口提供文本、语音和视觉能力。其编译器可将自定义 PyTorch 模型转换为引擎的零拷贝计算图;当设备内存紧张时,低置信度的本地请求可以切换到云端模型;内置的 RAG 则利用本地文本文件来支撑回答。随附的命令行工具覆盖模型转换、下载以及在真实硬件上的基准测试。对于想在离线、低延迟场景下做推理,又不想分别拼装量化、内核和服务库的移动开发者来说,这是一个实用的捷径。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目