#260 · 主分类: AI工具目录与精选清单
Awesome-LLM-Eval
awsome-list
awsome-lists
benchmark
bert
chatglm
chatgpt
dataset
evaluation
gpt3
large-language-model
leaderboard
llama
llm
llm-evaluation
machine-learning
nlp
openai
qwen
rag
Awesome-LLM-Eval:一个精选列表,包含工具、数据集/基准、演示、排行榜、论文、文档和模型,主要面向大语言模型评测,旨在探索生成式AI的技术边界。
项目最后更新:11/24/25
GitHub Stars
656
Forks数量
84
贡献者数量
5
许可证
MIT
收录理由
选大模型评测方案,往往比选模型本身更让人头疼。这个精选索引把评测工具、基准数据集、排行榜和论文集中在一起,并按实际测试目标分类,比如通用知识、代码能力、RAG流程、智能体能力、长上下文、多模态表现和推理速度。它还收录了模型本身以及训练框架,让你能一次性纵览评测工作的全貌。项目与一篇关于大模型评测的学术综述同步维护,因此选材经过深思熟虑,不是随意抓取的链接堆砌。准备制定评测策略的团队,可以在确定具体工具链之前,先来这里摸清现有基准和评测框架的底细。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。