#4 · 主分类: 数据质量与清洗
qsv
极速数据处理工具包
项目最后更新:08/30/26
GitHub Stars
3.8K
Forks数量
108
贡献者数量
89
许可证
Other
收录理由
qsv 是一款面向日常表格处理的终端工具,专为频繁操作 CSV、Excel 等结构化数据的人设计。它的命令简洁且可组合,覆盖了过滤、排序、连接、去重、校验、整形和富化这类常见工作流。由于核心以 Rust 编写,执行效率相当出色。在熟悉的 xsv 风格命令之外,它还集成了一些难得的功能:比如基于本地 Gazetteer 和 MaxMind 数据库的离线地理编码,以及由 LLM 驱动的 describegpt 命令,后者能生成数据字典、推断字段语义类型,并回答关于数据集的自然语言问题,且无需将整个文件发送到外部 API。对数据工程师、分析师和平台团队而言,这意味着一份可靠的二进制文件就能替代大量自定义脚本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
Curator
面向大语言模型的可扩展数据预处理与整理工具包