#103 · 主分类: 自然语言处理与文本处理
nlg-eval
用于自然语言生成的各种无监督自动评估指标的评估代码。
项目最后更新:08/20/24
GitHub Stars
1.4K
Forks数量
226
贡献者数量
11
许可证
Other
收录理由
做文本生成的项目,无论做机器翻译、对话系统还是自动摘要,最终都要拿生成结果跟参考句子比一比质量。nlg-eval 把这些常用的自动评估指标整合到了一起:BLEU、METEOR、ROUGE、CIDEr、SPICE 都能从同一组假设文件和参考文件里跑出来,另外还提供了基于词向量的相似度计算,比如 SkipThought 余弦相似度和 Greedy Matching。这样一来,你在多轮实验里汇报分数时,不需要维护好几个互不兼容的评估包,一套工具就能给出可比的指标。当然,首次配置有点成本——要下载预训练的词向量,还得装 Java——但换来的是所有指标共用同一套预处理流程,跑出来的数字在不同实验和论文之间保持一致。无论是做 NLG 研究的同学,还是开发中想快速搭一个评分看板的工程师,命令行和 Python 接口都能比较方便地嵌进现有流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。