#72 · 主分类: MLOps与评测
alignment-handbook
稳健的指南,用于使语言模型与人类和AI偏好对齐。
项目最后更新:05/26/26
GitHub Stars
5.7K
Forks数量
491
贡献者数量
34
许可证
Apache-2.0
收录理由
把一个基础模型变成真正能听懂指令的聊天机器人,远不止跑一遍微调那么简单。这份手册把整个后训练流程拆成了可直接运行的配方:从领域或语言适配的继续预训练,到监督微调、奖励建模、拒绝采样,再到 DPO、ORPO、KTO、IPO 这些偏好对齐方法,每一步都有对应的脚本和配置。训练脚本的适配范围很宽,既能在多卡节点上用 DeepSpeed 做全参数微调,也能在单张消费级显卡上跑 LoRA 或 QLoRA。每个配方都是一个独立的 YAML 配置,能复现出已知模型,相当于给了你一个经过验证的基准线,方便对比效果。如果你正负责把开源模型改造成内部助手,这里的评估脚本和数据集格式指导,和训练代码一样实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具