#65 · 主分类: 商业智能与分析
quokka
让数据湖适用于时间序列
项目最后更新:08/21/24
GitHub Stars
1.2K
Forks数量
63
贡献者数量
19
许可证
Apache-2.0
收录理由
对于手里攒着大量带时间戳数据的团队来说,常见的路就两条:要么把数据全搬进数仓,要么眼看着分析引擎在窗口查询和有状态计算上卡死。Quokka 换了个思路——它是一个基于 Ray、DuckDB、Polars 和 Arrow 构建的 Python 原生分布式查询引擎,采用推送式执行模型,能直接读取数据湖里的 Parquet 文件和 Iceberg 表,省掉了先灌进独立存储的 ETL 环节。它特别擅长处理那些让多数 SQL 引擎头疼的时间序列场景,比如 asof join、范围连接、模式识别,以及像构建限价订单簿这样的有状态计算。项目也拿出了实际结果:一个 tick 级回测能在十分钟左右重放过去四年的 SIP 交易数据流;在不少 TPC-H 查询上,它的执行速度比 SparkSQL 快数倍。因为是 Python 原生,当你需要定制数据源或自定义算子时,接入过程也相当直接。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。