#131 · 主分类: 深度学习框架

align-anything

chameleon dpo large-language-models multimodal rlhf vision-language-model

Align Anything:使用反馈训练全模态模型

项目最后更新:11/27/25

GitHub Stars

4.7K

Forks数量

506

贡献者数量

16

许可证

Apache-2.0

收录理由

想让多模态模型真正听懂人的指令,往往会被某个对齐方法绑住手脚,数据管线也得跟着它重写。Align Anything 提供了一套模块化的训练框架,把 SFT、DPO、PPO、GRPO 以及基于规则的强化学习都纳入其中,支持图像、音频、视频和任意模态之间的模型,这样你可以在不推翻现有工作流的前提下横向比较不同方案。项目里直接给出了 Qwen3、DeepSeek、Janus、MiniCPM-o 的可运行脚本,教程也讲得明白——从纯文本模型起步,逐步加上图像输入,或者搭建 DPO 训练,都有清晰步骤。NVIDIA GPU、华为昇腾 NPU 和 Slurm 集群的适配脚手架已经搭好,想认真做对齐实验的话,这里是个能落地的起点,而不是停留在演示层面。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目