#147 · 主分类: MLOps与评测
alpaca_eval
自动评估指令跟随语言模型的工具。经过人工验证,高质量,低成本,快速。
项目最后更新:08/09/25
GitHub Stars
2.0K
Forks数量
315
贡献者数量
83
许可证
Apache-2.0
收录理由
调校指令跟随模型的人,常被一个问题卡住:新checkpoint到底比旧版强多少?AlpacaEval给出一个又快又省的答案。把模型输出喂进去,它会拿参考模型做对照,用GPT-4等强标注器在固定指令集上算胜率,开发期间可以反复跑,不必每次花钱雇人打分。它引入的长度控制胜率,专门治那种答案越长分越高的毛病,跑出来的结果和规模大得多的Chatbot Arena众包排名高度一致。项目还附带公开榜单、预计算好的模型输出、人类偏好数据,以及定制标注器的工具,想改评判方式也能动手。可以把它当作快速逼近人类判断的代理,但高风险的发布决策,还是得自己仔细把关。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具