#260 · 主分类: AI工具目录与精选清单

Awesome-LLM-Eval

awsome-list awsome-lists benchmark bert chatglm chatgpt dataset evaluation gpt3 large-language-model leaderboard llama llm llm-evaluation machine-learning nlp openai qwen rag

Awesome-LLM-Eval:一个精选列表,包含工具、数据集/基准、演示、排行榜、论文、文档和模型,主要面向大语言模型评测,旨在探索生成式AI的技术边界。

项目最后更新:11/24/25

GitHub Stars

656

Forks数量

84

贡献者数量

5

许可证

MIT

收录理由

选大模型评测方案,往往比选模型本身更让人头疼。这个精选索引把评测工具、基准数据集、排行榜和论文集中在一起,并按实际测试目标分类,比如通用知识、代码能力、RAG流程、智能体能力、长上下文、多模态表现和推理速度。它还收录了模型本身以及训练框架,让你能一次性纵览评测工作的全貌。项目与一篇关于大模型评测的学术综述同步维护,因此选材经过深思熟虑,不是随意抓取的链接堆砌。准备制定评测策略的团队,可以在确定具体工具链之前,先来这里摸清现有基准和评测框架的底细。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目