#138 · 主分类: MLOps与评测
evaluation-guidebook
分享我们在管理 Open LLM Leaderboard 和设计 lighteval 时积累的关于 LLM 评估的实践见解和理论知识。
项目最后更新:12/03/25
GitHub Stars
2.1K
Forks数量
126
贡献者数量
13
许可证
Other
收录理由
评估一个LLM,往往比训练它更让人头疼。这份指南的两位作者,一位运营过Open LLM Leaderboard,另一位参与设计了lighteval,他们把实战中踩过的坑和攒下的经验都写进了书里。内容从自动基准、人工评估到让大模型当裁判的玩法都有涉及,但更难得的是那些故障排查和可复现性的章节,读起来像是真在部署一线摸爬滚打过的老手在说话。新手可以从每章的基础部分慢慢啃,已经上手评估的团队则能直接跳去设计和调优的章节,作者还用星号标出了自己真心推荐的精读链接。对于要为自己的生产模型写定制评估、或者在发布前纠结选什么指标的人来说,这本册子是很实在的参考。唯一要提个醒:这个仓库本身已经停更,内容整体迁移到了新版托管页面上,但这里仍然保留了最稳定的核心版本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具