#177 · 主分类: MLOps与评测

can-ai-code

ai ggml humaneval langchain llama-cpp llm transformers

AI程序员的自我评估面试

项目最后更新:06/21/25

GitHub Stars

598

Forks数量

35

贡献者数量

9

许可证

MIT

收录理由

多数编程基准在模型能力提升后便失去区分度,而该项目从一开始就试图绕开这个天花板。它不依赖固定测试题,而是用参数化生成器产出无限多的独特问题,并沿着两个维度——工作记忆负荷与结构复杂度——搭建一条难度斜坡,衡量每个模型能爬多高。这样一来,横向对比不同模型、纵向追踪同一模型的迭代进展,都不再担心分数挤在一起。项目还附带了多个模型家族的实际测试结果,让你在投入自己的算力之前,先对当前模型的大致水平有个底。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目