#33 · 主分类: 基础模型
minimind-o
🎙️ 一个从零训练的0.1B Omni模型,能听、说、看!
项目最后更新:08/06/26
GitHub Stars
2.4K
Forks数量
282
贡献者数量
4
许可证
Apache-2.0
收录理由
想真正读懂一个全模态模型,而不是在数十亿参数的庞大权重面前无从下手,MiniMind-O 提供了难得的机会。它用约0.1B的单一权重同时处理文本、图像和音频,输出文本与流式语音,并且让语音和文本在隐层状态直接连通,绕开了ASR、LLM、TTS级联时因文本转写而丢失的语气与节奏信息。全部核心代码用PyTorch从零实现,没有高层封装,mini训练集在单张RTX 3090上约两小时就能跑完完整的Thinker-Talker流程,意味着你可以真正去读代码、改动、重新训练,而不只是加载一个现成检查点。项目还附带技术报告、在线演示,支持实时打断和音色克隆,从理解流式语音生成到动手扩展模型,路径清晰。对学生、工程师和研究者而言,这是一个务实而坦诚的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。