#133 · 主分类: 深度学习框架

Trinity-RFT

agent llm rlhf

Trinity-RFT 是一个通用、灵活且可扩展的框架,专为大型语言模型(LLM)的强化微调(RFT)而设计。

项目最后更新:08/13/26

GitHub Stars

696

Forks数量

79

贡献者数量

28

许可证

Apache-2.0

收录理由

对于希望把模型从监督微调推进到强化微调阶段的团队来说,这个项目提供了一个很实在的入手点。它把强化微调流程拆成三个协同工作的部分:Explorer负责通过智能体与环境的交互来收集经验数据,Trainer负责更新模型权重,Buffer则贯穿整个流程处理数据。这样的拆分让每个环节都能被单独审视和优化,而不是面对一个难以调试的巨型脚本。项目自带GRPO等算法的可运行示例,支持LoRA、多模态模型以及FSDP2/Megatron并行方案,还提供了一个无需GPU的后端供实验使用。无论是想针对特定领域任务打磨智能体的开发者,还是希望在紧凑的即插即用模块上快速验证新算法的强化学习研究者,都能从中找到合适的工具。配套的教程也把每种工作流都讲得很清楚,对刚接触基于强化学习的训练方式的团队尤其友好。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目