#177 · 主分类: MLOps与评测
can-ai-code
AI程序员的自我评估面试
项目最后更新:06/21/25
GitHub Stars
598
Forks数量
35
贡献者数量
9
许可证
MIT
收录理由
多数编程基准在模型能力提升后便失去区分度,而该项目从一开始就试图绕开这个天花板。它不依赖固定测试题,而是用参数化生成器产出无限多的独特问题,并沿着两个维度——工作记忆负荷与结构复杂度——搭建一条难度斜坡,衡量每个模型能爬多高。这样一来,横向对比不同模型、纵向追踪同一模型的迭代进展,都不再担心分数挤在一起。项目还附带了多个模型家族的实际测试结果,让你在投入自己的算力之前,先对当前模型的大致水平有个底。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具