#83 · 主分类: 基础模型
Aria
mixture-of-experts
multimodal
vision-and-language
Aria的代码库 - 一个开源的多模态原生MoE
项目最后更新:01/22/25
GitHub Stars
1.1K
Forks数量
89
贡献者数量
11
许可证
Apache-2.0
收录理由
如果你希望用一个开源模型同时处理文本、图片、文档和视频,而不是把几个专用系统拼在一起,Aria 值得一看。它采用混合专家架构,总参数 25.3B,但每个 token 只激活 3.9B 参数,这让推理和微调的开销比同规模稠密模型明显更低。仓库提供了可直接运行的代码,安装步骤清晰,也接好了 Hugging Face,拉下权重就能对图片进行聊天式提问,或者在一张 A100 级别的显卡上用自己的数据微调。64K 的上下文窗口加上在视频和文档理解上的出色表现,让它成为搭建视觉助手或文档分析流程的务实底座,Apache-2.0 许可也方便你在此基础上继续开发。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。