#73 · 主分类: 基础模型

DeepSeek-V2

DeepSeek-V2:一个强大、经济且高效的混合专家语言模型

项目最后更新:09/25/24

GitHub Stars

5.0K

Forks数量

550

贡献者数量

7

许可证

MIT

收录理由

如果你正在寻找可以自行部署的开源权重模型,DeepSeek-V2 值得认真考虑。这个仓库同时提供了完整版 236B 参数模型和 16B 的 Lite 版本,并且都包含基座与对话两种检查点,你可以根据手头 GPU 的规模灵活选择。它的两个核心设计——多头潜在注意力(MLA)和每次只激活少量参数的稀疏 MoE 结构——直接降低了推理成本和 KV 缓存占用,而这两项恰恰决定了你实际需要多少张显卡。README 中附带了英文、中文、数学和代码等多个维度的基准测试表格,还提供了 vLLM 集成方案用于服务部署,在对比开源模型做真实落地时,它是一个很实用的参照基准。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目