#100 · 主分类: 推理与本地部署

tokenspeed

b200 b300 blackwell deepseek gb200 gb300 glm gpt-oss inkling kimi lightseek llm mi355x mi455x minimax qwen speed-of-light tokenspeed vlm

TokenSpeed 是一个光速级 LLM 推理引擎。

项目最后更新:08/30/26

GitHub Stars

2.0K

Forks数量

261

贡献者数量

67

许可证

MIT

收录理由

TokenSpeed 是一个面向智能体工作负载的 LLM 推理引擎,这类场景里大量小请求和长上下文会给服务栈带来真实压力。它声称在保持 vLLM 般易用接口的同时达到 TensorRT-LLM 级别的性能,因此习惯 OpenAI 兼容服务的团队无需改写客户端即可上手。工程上的亮点在于:静态编译器能从模块注释自动生成集合通信,免去手写并行逻辑;C++ 控制面把请求生命周期和 KV 缓存所有权编码为类型化状态机,让高负载下的安全内存复用更可预期。它还内置了针对 Blackwell 优化的快速 MLA 内核,对在最新 NVIDIA GPU 上跑 DeepSeek、Kimi、Qwen 等潜在注意力模型的用户很有价值。如果在意延迟敏感的生产环境,值得拿自己的流量跑一遍基准测试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目