GitHub Stars
654
Forks数量
46
贡献者数量
5
许可证
Apache-2.0
收录理由
扩散语言模型理论上能并行生成词元,但多数实现采用双向注意力,破坏了生产推理引擎所依赖的 KV 缓存机制,导致理论加速在实际中难以兑现。腾讯微信 AI 团队开源的 WeDLM 通过标准因果注意力下的并行掩码恢复解决了这一矛盾,原生兼容 FlashAttention、PagedAttention 和 CUDA Graphs,并可直接从 Qwen2.5、Qwen3 的预训练权重初始化。随附的 7B 与 8B 模型在实测中相对 vLLM 服务的自回归基线取得了真实墙钟时间加速。项目还提供推理引擎、网页演示、微调框架和评估脚本,chatllm.cpp 的接入也让本地部署变得简单。若你在评估更快的服务方案,这个项目值得拿来和现有技术栈做一次基准对比。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。