#103 · 主分类: 自然语言处理与文本处理

nlg-eval

bleu bleu-score cider dialog dialogue evaluation machine-translation meteor natural-language-generation natural-language-processing nlg nlp rouge rouge-l skip-thought-vectors skip-thoughts task-oriented-dialogue

用于自然语言生成的各种无监督自动评估指标的评估代码。

项目最后更新:08/20/24

GitHub Stars

1.4K

Forks数量

226

贡献者数量

11

许可证

Other

收录理由

做文本生成的项目,无论做机器翻译、对话系统还是自动摘要,最终都要拿生成结果跟参考句子比一比质量。nlg-eval 把这些常用的自动评估指标整合到了一起:BLEU、METEOR、ROUGE、CIDEr、SPICE 都能从同一组假设文件和参考文件里跑出来,另外还提供了基于词向量的相似度计算,比如 SkipThought 余弦相似度和 Greedy Matching。这样一来,你在多轮实验里汇报分数时,不需要维护好几个互不兼容的评估包,一套工具就能给出可比的指标。当然,首次配置有点成本——要下载预训练的词向量,还得装 Java——但换来的是所有指标共用同一套预处理流程,跑出来的数字在不同实验和论文之间保持一致。无论是做 NLG 研究的同学,还是开发中想快速搭一个评分看板的工程师,命令行和 Python 接口都能比较方便地嵌进现有流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目