#151 · 主分类: 教育与研究
minimind-v
👀 仅需2小时从头训练一个65M参数的VLM!
项目最后更新:08/06/26
GitHub Stars
8.5K
Forks数量
934
贡献者数量
7
许可证
Apache-2.0
收录理由
开源视觉语言模型领域里,多数项目只丢给你一堆预训练权重,而MiniMind-V却把整套训练流程完整地摊开在你面前,而且是真的能跑起来的那种。从用冻结的SigLIP视觉编码器把图像转成token,到通过投影层把这些特征对齐到语言模型,再到Pretrain和SFT两个阶段,每一步都有代码和说明。单张NVIDIA RTX 3090就能在大约两小时内完成65M模型的SFT训练,仓库里也提供了低至65M的多个现成检查点,想省事的话直接加载一个就能开始玩。代码刻意写得精简,每个阶段都有文档,研究者可以把它当作参考实现,工程师也能照着在自己的硬件上复现一个紧凑的多模态模型。项目里关于成本和资源消耗的说明也很实在,对正在掂量要不要自己搞小型视觉语言系统的团队来说,是个很实用的参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
prompts.chat
前身为 Awesome ChatGPT Prompts。分享、发现和收集社区提示词。免费且开源——可自托管,为您的组织提供完全隐私。
JavaGuide
Java 面试 & 后端通用面试指南,覆盖计算机基础、数据库、分布式、高并发、系统设计与 AI 应用开发
system-prompts-and-models-of-ai-tools
精选流行AI助手和编码代理的系统提示、内部工具和AI模型集合。
30-seconds-of-code
编程文章,助你提升开发技能
generative-ai-for-beginners
21节课,开始使用生成式AI构建