#16 · 主分类: AI数据基础设施与存储

Daft

ai-engineering ai-pipeline arrow artificial-intelligence big-data data-engineering distributed distributed-computing distributed-systems embeddings etl huggingface iceberg machine-learning multimodal parquet python ray rust

面向AI和多模态工作负载的高性能数据引擎。可处理任意规模的图像、音频、视频和结构化数据。

项目最后更新:08/26/26

GitHub Stars

5.7K

Forks数量

549

贡献者数量

183

许可证

Apache-2.0

收录理由

处理训练或推理管线时,如果数据源是原始媒体,团队通常得把图像、音频、视频以及描述它们的表格元数据分别交给不同的工具去处理。Daft 把这些收进同一个 dataframe API:从 S3 加载一个图片文件夹,对每一行跑嵌入模型或 LLM 提示,再把结果写成 Parquet 或 Iceberg,全程不用离开这个框架。Python 接口之下是 Rust 核心,向量化执行和外存处理都靠它,也省掉了 Spark 那类技术栈的 JVM 开销。从笔记本到 Ray 或 Kubernetes 上的分布式集群都能跑,小团队想用同一套代码从原型走到生产,这一点很实在。如果你日常做的就是多模态 ETL、数据集整理或大规模特征生成,值得认真看看。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目