#26 · 主分类: 自然语言处理与文本处理

spark-nlp

bert entity-extraction language-detection lemmatizer llamacpp llm machine-translation named-entity-recognition natural-language-processing nlp onnx part-of-speech-tagger pyspark question-answering sentiment-analysis spark spell-checker tensorflow text-classification transformers

最先进自然语言处理

项目最后更新:08/29/26

GitHub Stars

4.2K

Forks数量

744

贡献者数量

116

许可证

Apache-2.0

收录理由

对于已经在 Apache Spark 上构建数据管线的团队来说,这个库是少有的原生贴合该环境的 NLP 工具,而非事后硬接上去的补丁。它自带超过十万个预训练模型和流水线,覆盖分词、词性标注、命名实体识别、情感分析、机器翻译、摘要生成、问答等常见任务,并且所有能力都以注解形式融入 Spark 的分布式执行流程。这样一来,处理海量语料时不必把数据搬出集群,核心库采用 Apache 许可证,直接用于生产环境、在预训练结果之上继续微调模型都很顺手。如果只是想在单机上快速做点实验,轻量级方案用起来会更省心;但当吞吐量和跨节点横向扩展成为优化目标时,这个库的价值就真正体现出来了。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目