#62 · 主分类: 基础模型

WeDLM

WeDLM: 最快的扩散语言模型,具有标准因果注意力和原生KV缓存兼容性,相比vLLM优化的基线提供真正的加速。

项目最后更新:03/03/26

GitHub Stars

654

Forks数量

46

贡献者数量

5

许可证

Apache-2.0

收录理由

扩散语言模型理论上能并行生成词元,但多数实现采用双向注意力,破坏了生产推理引擎所依赖的 KV 缓存机制,导致理论加速在实际中难以兑现。腾讯微信 AI 团队开源的 WeDLM 通过标准因果注意力下的并行掩码恢复解决了这一矛盾,原生兼容 FlashAttention、PagedAttention 和 CUDA Graphs,并可直接从 Qwen2.5、Qwen3 的预训练权重初始化。随附的 7B 与 8B 模型在实测中相对 vLLM 服务的自回归基线取得了真实墙钟时间加速。项目还提供推理引擎、网页演示、微调框架和评估脚本,chatllm.cpp 的接入也让本地部署变得简单。若你在评估更快的服务方案,这个项目值得拿来和现有技术栈做一次基准对比。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目