#63 · 主分类: 基础模型

PaddleMIX

aigc clip controlnet deepseek-vl dit eva-clip got-ocr20 image-to-text internvl2 llava minicpm-v multimodal ppdiffusers qwen2-vl sd-xl sora stable-diffusion stablevideodiffusion text-to-image text-to-video

Paddle多模态集成与探索,支持主流多模态任务,包括端到端大规模多模态预训练模型和扩散模型工具箱。具备高性能和灵活性。

项目最后更新:03/06/26

GitHub Stars

724

Forks数量

223

贡献者数量

96

许可证

Apache-2.0

收录理由

对于已经在PaddlePaddle生态中工作的团队,这个项目提供了一条通往现代多模态模型的捷径,无需切换框架。它集成了丰富的视觉-语言模型,如LLaVA、InternVL、Qwen2-VL、DeepSeek-VL、MiniCPM-V和Janus,每个都带有推理和训练示例,可以直接微调或部署特定模型,省去从零搭建的麻烦。同时,内置的扩散模型工具箱覆盖了文生图和文生视频,支持Stable Diffusion和FLUX,让需要同时处理理解和生成任务的团队在一个地方就能完成。此外还附带了一些专门工具,比如文档理解模型、视频生成控制模型,以及用于清洗和标注多模态数据集的实用程序。如果你正在评估多模态能力,并且更倾向于使用Paddle而非PyTorch,这里是一个很实际的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目