#20 · 主分类: MLOps与评测

dagster

analytics dagster data-engineering data-integration data-orchestrator data-pipelines data-science etl metadata mlops orchestration python scheduler workflow workflow-automation

用于数据资产开发、生产和观测的编排平台。

项目最后更新:08/28/26

GitHub Stars

16.1K

Forks数量

2.3K

贡献者数量

695

许可证

Apache-2.0

收录理由

Dagster 的核心思路很直接:把表、数据集、模型、报表这些数据资产,用普通的 Python 函数声明出来,剩下的交给平台处理。它会自动梳理资产之间的依赖关系,管理分区和增量运行,并维护一份实时更新的资产目录,记录每份数据从哪来、怎么生成的。这种设计在同时涉及分析表、特征库和训练模型的场景里特别有用,因为血缘和新鲜度检查跟着数据走,而不是孤零零地挂在调度器上。如果团队已经在用 dbt、Spark、Databricks 或 Snowflake 跑 ML 任务,Dagster 提供的可观测性和元数据追踪能让调试和生产监控省心不少。它既能跑单条管道,也能扩展成共享平台,附带数据质量检查和成本可见性,选调度器时值得认真考虑。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目