#10 · 主分类: 数据质量与清洗
spotlight
从数据框交互式探索非结构化数据集。
项目最后更新:08/19/26
GitHub Stars
1.3K
Forks数量
92
贡献者数量
25
许可证
MIT
收录理由
在非结构化数据上找模型失败的原因,往往要翻半天表格、对着缩略图猜。Spotlight 把这件事变成了一次交互式可视化:从 dataframe 出发,几行 Python 代码就能启动,把嵌入、预测结果和不确定性分数映射到画布上,哪些是簇、哪些是离群点,一眼就能看出来。ML 和工程团队拿它来定位模型出错的位置、发现标注错误,再决定下一轮训练前要清洗或重新标注哪些样本。同一个接口能处理图像、音频、文本、视频、时间序列和几何数据,混合类型的数据集不必来回切换工具。对于注重数据质量、想快速摸清数据真实情况的工作流来说,它是个轻量帮手,而不是笨重的平台。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。