#107 · 主分类: 推理与本地部署
FastFlowLM
在AMD Ryzen™ AI NPU上运行LLM,几分钟即可完成;专为AMD NPU打造并深度优化。
项目最后更新:08/28/26
GitHub Stars
1.8K
Forks数量
145
贡献者数量
30
许可证
MIT
收录理由
手头有搭载XDNA2 NPU的Ryzen AI笔记本的开发者,会发现FastFlowLM是一条不用独显就能跑LLM的省心路径。它装起来是个很小的签名包,拉模型的方式和Ollama类似,跑起来后提供OpenAI兼容接口和命令行流式输出。运行时覆盖文本、视觉、音频、嵌入和MoE模型,上下文窗口最大到256k token,本地聊天、RAG流水线、设备端转写这些场景都接得住。它真正的价值在于把原本闲置的NPU硬件变成低功耗推理引擎,对想在已有机器上做私有、离线推理的人来说很实在。团队在AMD硬件上对比本地部署方案时,会喜欢它开箱即用的API和基准测试遥测,方便和GPU方案做并排测试。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。