#100 · 主分类: 推理与本地部署
tokenspeed
TokenSpeed 是一个光速级 LLM 推理引擎。
项目最后更新:08/30/26
GitHub Stars
2.0K
Forks数量
261
贡献者数量
67
许可证
MIT
收录理由
TokenSpeed 是一个面向智能体工作负载的 LLM 推理引擎,这类场景里大量小请求和长上下文会给服务栈带来真实压力。它声称在保持 vLLM 般易用接口的同时达到 TensorRT-LLM 级别的性能,因此习惯 OpenAI 兼容服务的团队无需改写客户端即可上手。工程上的亮点在于:静态编译器能从模块注释自动生成集合通信,免去手写并行逻辑;C++ 控制面把请求生命周期和 KV 缓存所有权编码为类型化状态机,让高负载下的安全内存复用更可预期。它还内置了针对 Blackwell 优化的快速 MLA 内核,对在最新 NVIDIA GPU 上跑 DeepSeek、Kimi、Qwen 等潜在注意力模型的用户很有价值。如果在意延迟敏感的生产环境,值得拿自己的流量跑一遍基准测试。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。