#205 · 主分类: 教育与研究

tiny-llm

course large-language-model llm python qwen serving vllm

面向系统工程师,在Apple Silicon上学习LLM推理系统:构建一个微型vLLM + Qwen

项目最后更新:08/29/26

GitHub Stars

4.5K

Forks数量

369

贡献者数量

27

许可证

Apache-2.0

收录理由

这门课程面向那些已经调用过LLM推理API、却想弄明白系统内部真实运作机制的系统工程师。四周的路径从数组和矩阵运算起步,逐步搭出一个可在Apple Silicon上运行的微型服务栈:先是组装一个可读的Qwen3模型,随后引入KV缓存,再叠加连续批处理和分页KV缓存,最终逼近一个精简版vLLM。全程基于MLX原语而非高层神经网络层,每章都会让你亲手用Python、C++或Metal实现算子,MLX只作为正确性参照。这样一来,数学公式与真实的内存带宽、kernel占用率、调度策略之间就有了直接联系。与其把推理服务当黑盒,不如跟着章节一步步从内部把它看透。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目