#106 · 主分类: 推理与本地部署
FastFlowLM
在AMD Ryzen™ AI NPU上几分钟内运行LLM;专为AMD NPU打造并深度优化。
项目最后更新:08/28/26
GitHub Stars
1.8K
Forks数量
145
贡献者数量
30
许可证
MIT
收录理由
手里有台搭载 XDNA2 NPU 的 Ryzen AI 笔记本或迷你主机,想跑本地大模型,大概率会碰到一个尴尬:市面上的工具普遍优先调用 GPU,NPU 常常闲着。FastFlowLM 就是冲着这块硬件去的。装一个不到 20 秒的小型 Windows 安装包,模型就能在 NPU 上跑起来,支持视觉、音频、嵌入和 MoE 这几类模型,上下文窗口最长能到 256k token。它把推理放在 NPU 而不是 GPU 上,功耗能低一个数量级还多,对靠电池的笔记本和散热紧张的边缘设备来说,这点非常实在。项目公开了基准测试页面、模型清单和 Linux 上手指南,动手前可以先看看实际吞吐量再决定要不要把任务压上去。想让 LLM 推理完全留在设备端,又用的是 AMD 硬件,这条路走起来很直接。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。