#61 · 主分类: 基础模型

MiniMax-01

large-language-models llm llms minimax-text-01 minimax-vl-01 vision-language-model vlm

MiniMax-Text-01和MiniMax-VL-01的官方仓库,基于Linear Attention的大语言模型与视觉语言模型

项目最后更新:07/07/25

GitHub Stars

3.5K

Forks数量

332

贡献者数量

6

许可证

MIT

收录理由

MiniMax-01 将文本模型与视觉语言模型放在同一套代码仓库里,两者都采用了一个不太常见的做法:用线性注意力取代大多数大模型依赖的完整注意力。这一设计让文本模型能够处理一百万个 token 的上下文,同时把训练和推理开销压到比同等规模稠密模型更低的水平。对于需要处理超长文档、要求对话具备广泛记忆的智能体工作流,或者长序列多模态输入的团队来说,这里公开的权重、训练细节和评测结果都值得仔细参考。不过动手本地部署之前,先掂量一下手里的硬件:4560 亿参数、每个 token 只激活其中一小部分,这显然不是笔记本能跑动的模型。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目