#45 · 主分类: AI数据基础设施与存储

vectorflow

ai data-engineering embeddings machine-learning nlp vectors

VectorFlow 是一个高吞吐量的向量嵌入管道,可摄取原始数据,将其转换为向量,并写入您选择的向量数据库。

项目最后更新:05/16/24

GitHub Stars

703

Forks数量

51

贡献者数量

11

许可证

Apache-2.0

收录理由

对于需要把大批量文档送进向量数据库、又不想自己从头搭建摄取管线的团队,VectorFlow 提供了一个很直接的入口。你只要通过一个简单的 API 提交原始文件,它就会负责切分和向量化,再写入你选定的存储后端,Pinecone、Qdrant 和 Weaviate 都开箱即用。底层用 Postgres、RabbitMQ 和 MinIO 支撑任务队列,重负载的批次也能稳定跑完,不会中途丢数据。如果你正在做基于 RAG 的搜索或检索,它可以作为自托管的摄取层,本地用 docker compose 就能跑起来,需要扩展时也能部署到 Kubernetes。不过要留意,这个项目目前还是 MVP 阶段,生产环境依赖它之前,最好先确认当前功能覆盖了你需要的文件类型和目标向量数据库。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目