#37 · 主分类: AI数据基础设施与存储

fugue

dask data-practitioners distributed distributed-computing distributed-systems machine-learning pandas spark sql

分布式计算的统一接口。Fugue 无需重写即可在 Spark、Dask 和 Ray 上执行 SQL、Python、Pandas 和 Polars 代码。

项目最后更新:05/19/26

GitHub Stars

2.2K

Forks数量

103

贡献者数量

25

许可证

Apache-2.0

收录理由

当你的 Pandas 代码已经跑不动单机、又不想为集群重写一遍时,Fugue 提供了一条务实的出路。它用一套 Python 接口,让同样的 SQL、Python、Pandas 或 Polars 逻辑能原样跑在 Spark、Dask 或 Ray 上,本地原型验证和集群扩展之间不再需要维护两套代码。FugueSQL 层对混合了声明式 SQL 与 Python 函数的端到端工作流尤其顺手,而 transform() 这个辅助函数能直接把现有函数指向不同引擎来并行化。如果你的数据团队正在摸索从笔记本平滑过渡到分布式执行的统一路径,这个抽象值得认真评估。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目