#83 · 主分类: 基础模型

Aria

mixture-of-experts multimodal vision-and-language

Aria的代码库 - 一个开源的多模态原生MoE

项目最后更新:01/22/25

GitHub Stars

1.1K

Forks数量

89

贡献者数量

11

许可证

Apache-2.0

收录理由

如果你希望用一个开源模型同时处理文本、图片、文档和视频,而不是把几个专用系统拼在一起,Aria 值得一看。它采用混合专家架构,总参数 25.3B,但每个 token 只激活 3.9B 参数,这让推理和微调的开销比同规模稠密模型明显更低。仓库提供了可直接运行的代码,安装步骤清晰,也接好了 Hugging Face,拉下权重就能对图片进行聊天式提问,或者在一张 A100 级别的显卡上用自己的数据微调。64K 的上下文窗口加上在视频和文档理解上的出色表现,让它成为搭建视觉助手或文档分析流程的务实底座,Apache-2.0 许可也方便你在此基础上继续开发。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目