#130 · 主分类: MLOps与评测

AgentBench

chatgpt gpt-4 llm llm-agent

全面评估LLM作为智能体的基准测试(ICLR'24)

项目最后更新:02/08/26

GitHub Stars

3.7K

Forks数量

278

贡献者数量

13

许可证

Apache-2.0

收录理由

AgentBench 面向那些需要判断语言模型作为自主智能体表现如何的团队,而不仅仅是看它聊天是否流畅。它让模型在八个不同的环境中接受考验,包括操作系统终端、数据库、知识图谱、纸牌游戏、横向思维谜题以及购物浏览等任务,并根据模型是否达成具体目标来评分。这样的设计能让你更真实地看到模型在哪些环节容易卡壳,在挑选通用模型还是针对特定任务调优的模型时很有参考价值。当前版本还提供了容器化环境和 Docker Compose 配置,你可以在自己的硬件上复现一次完整的评估流程,无需手动逐个搭建任务环境。对正在构建智能体产品的人来说,把它当作一个可重复的测试平台,远比依赖演示效果更可靠。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目