#26 · 主分类: 自然语言处理与文本处理
spark-nlp
bert
entity-extraction
language-detection
lemmatizer
llamacpp
llm
machine-translation
named-entity-recognition
natural-language-processing
nlp
onnx
part-of-speech-tagger
pyspark
question-answering
sentiment-analysis
spark
spell-checker
tensorflow
text-classification
transformers
最先进自然语言处理
项目最后更新:08/29/26
GitHub Stars
4.2K
Forks数量
744
贡献者数量
116
许可证
Apache-2.0
收录理由
对于已经在 Apache Spark 上构建数据管线的团队来说,这个库是少有的原生贴合该环境的 NLP 工具,而非事后硬接上去的补丁。它自带超过十万个预训练模型和流水线,覆盖分词、词性标注、命名实体识别、情感分析、机器翻译、摘要生成、问答等常见任务,并且所有能力都以注解形式融入 Spark 的分布式执行流程。这样一来,处理海量语料时不必把数据搬出集群,核心库采用 Apache 许可证,直接用于生产环境、在预训练结果之上继续微调模型都很顺手。如果只是想在单机上快速做点实验,轻量级方案用起来会更省心;但当吞吐量和跨节点横向扩展成为优化目标时,这个库的价值就真正体现出来了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。