#92 · 主分类: MLOps与评测

hamilton

dag data-analysis data-engineering data-science dataframe etl etl-framework etl-pipeline feature-engineering hacktoberfest lineage llmops machine-learning mlops orchestration pandas python rag software-engineering

Apache Hamilton 帮助数据科学家和工程师定义可测试、模块化、自文档化的数据流,这些数据流编码了血缘/追踪和元数据。在 Python 运行的任何地方都能运行和扩展。

项目最后更新:08/19/26

GitHub Stars

2.6K

Forks数量

213

贡献者数量

101

许可证

Apache-2.0

收录理由

许多数据团队都会碰到同样的窘境:特征管道和ETL任务起初只是几个脚本和笔记本,慢慢膨胀到没人愿意重跑或重构的地步。Hamilton换了一种思路,把每个转换都写成普通的Python函数,框架根据函数参数自动推断出DAG,既保留了结构,又不必让一个重量级框架强行改造你的代码。执行过程与图定义彼此独立,同一套代码既能本地快速迭代,等数据量超出笔记本能力时再平滑迁移到Spark或DuckDB上运行。每个步骤还会记录血缘和元数据,追踪某个值的来源、审计数据流,比翻日志省心得多。如果你想要模块化、自带文档的管道,又不想为此引入一个编排器,这是个相当务实的中间选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目