#121 · 主分类: MLOps与评测

skillsbench

benchmark skillsbench

SkillsBench 评估技能的工作效果以及智能体使用技能的有效性。

项目最后更新:07/23/26

GitHub Stars

1.7K

Forks数量

363

贡献者数量

67

许可证

Apache-2.0

收录理由

依赖技能(即由指令、脚本和资源组成的模块化文件夹,让模型能完成专门工作)的智能体团队,往往很难判断这些技能是否真的有效,以及智能体是否用得恰当。SkillsBench 以健身房式基准测试同时回答这两个问题:每个任务以 task.md 形式提供环境、标准答案和验证器,让技能效果与智能体行为在同一套工作负载上对照衡量。由于任务本身就是 BenchFlow 原生包,可在 Docker 或 Modal 沙箱中运行,也能直接通过命令行检查和执行,对比较不同智能体框架或模型的团队来说相当实用。tasks-extra 中的示例更进一步,包含一个需要 GPU 凭证的任务,用于在 nanoGPT 中实现并比较流形约束超连接,为评估更重、更耗资源的流程提供了良好范本。想要可复现、可验证的智能体技能评测,而不是临时手动测试的话,这个项目值得参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目