#121 · 主分类: MLOps与评测
skillsbench
SkillsBench 评估技能的工作效果以及智能体使用技能的有效性。
项目最后更新:07/23/26
GitHub Stars
1.7K
Forks数量
363
贡献者数量
67
许可证
Apache-2.0
收录理由
依赖技能(即由指令、脚本和资源组成的模块化文件夹,让模型能完成专门工作)的智能体团队,往往很难判断这些技能是否真的有效,以及智能体是否用得恰当。SkillsBench 以健身房式基准测试同时回答这两个问题:每个任务以 task.md 形式提供环境、标准答案和验证器,让技能效果与智能体行为在同一套工作负载上对照衡量。由于任务本身就是 BenchFlow 原生包,可在 Docker 或 Modal 沙箱中运行,也能直接通过命令行检查和执行,对比较不同智能体框架或模型的团队来说相当实用。tasks-extra 中的示例更进一步,包含一个需要 GPU 凭证的任务,用于在 nanoGPT 中实现并比较流形约束超连接,为评估更重、更耗资源的流程提供了良好范本。想要可复现、可验证的智能体技能评测,而不是临时手动测试的话,这个项目值得参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具