#33 · 主分类: 基础模型

minimind-o

artificial-intelligence chatgpt omni

🎙️ 一个从零训练的0.1B Omni模型,能听、说、看!

项目最后更新:08/06/26

GitHub Stars

2.4K

Forks数量

282

贡献者数量

4

许可证

Apache-2.0

收录理由

想真正读懂一个全模态模型,而不是在数十亿参数的庞大权重面前无从下手,MiniMind-O 提供了难得的机会。它用约0.1B的单一权重同时处理文本、图像和音频,输出文本与流式语音,并且让语音和文本在隐层状态直接连通,绕开了ASR、LLM、TTS级联时因文本转写而丢失的语气与节奏信息。全部核心代码用PyTorch从零实现,没有高层封装,mini训练集在单张RTX 3090上约两小时就能跑完完整的Thinker-Talker流程,意味着你可以真正去读代码、改动、重新训练,而不只是加载一个现成检查点。项目还附带技术报告、在线演示,支持实时打断和音色克隆,从理解流式语音生成到动手扩展模型,路径清晰。对学生、工程师和研究者而言,这是一个务实而坦诚的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目