#61 · 主分类: 基础模型
MiniMax-01
large-language-models
llm
llms
minimax-text-01
minimax-vl-01
vision-language-model
vlm
MiniMax-Text-01和MiniMax-VL-01的官方仓库,基于Linear Attention的大语言模型与视觉语言模型
项目最后更新:07/07/25
GitHub Stars
3.5K
Forks数量
332
贡献者数量
6
许可证
MIT
收录理由
MiniMax-01 将文本模型与视觉语言模型放在同一套代码仓库里,两者都采用了一个不太常见的做法:用线性注意力取代大多数大模型依赖的完整注意力。这一设计让文本模型能够处理一百万个 token 的上下文,同时把训练和推理开销压到比同等规模稠密模型更低的水平。对于需要处理超长文档、要求对话具备广泛记忆的智能体工作流,或者长序列多模态输入的团队来说,这里公开的权重、训练细节和评测结果都值得仔细参考。不过动手本地部署之前,先掂量一下手里的硬件:4560 亿参数、每个 token 只激活其中一小部分,这显然不是笔记本能跑动的模型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。