#36 · 主分类: AI数据基础设施与存储

docarray

cross-modal data-structures dataclass deep-learning docarray elasticsearch fastapi machine-learning multi-modal multimodal nearest-neighbor-search nested-data neural-search protobuf pydantic pytorch qdrant semantic-search weaviate

表示、发送、存储和搜索多模态数据。

项目最后更新:03/27/26

GitHub Stars

3.1K

Forks数量

243

贡献者数量

81

许可证

Apache-2.0

收录理由

多模态数据在实际项目中很少以单一规整的张量形式出现。文本往往与图像、音频、向量嵌入以及各类元数据混杂在一起,而且从模型训练到检索阶段,这些字段都需要保持关联。DocArray 基于 Pydantic 提供了强类型的结构化定义,允许你声明张量形状,把不同模态的字段装进同一个对象,还能批量组织成向量供训练使用。在数据传输与持久化方面,它既支持通过 HTTP 传输 JSON,也支持基于 gRPC 的 Protobuf 序列化,并且内置了指向 Weaviate、Qdrant、Elasticsearch、Redis 和 Mongo Atlas 的连接器。这样一来,你在代码里定义好的同一个对象可以直接写入这些存储后端,随后用近邻搜索把结果取回,无需为不同数据库手写转换逻辑。对于搭建语义搜索或 RAG 管线的团队来说,这种一致性很有价值。同时,它与 NumPy、PyTorch、TensorFlow、JAX 原生兼容,能够自然地融入已有的深度学习工作流,不会强迫你换用新框架。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目