#39 · 主分类: 知识库与企业搜索

PixelRAG

agent ai memory multimodal rag search searchengine vision vlm

https://arxiv.org/abs/2606.28344。网页解析的终结。可扩展像素原生搜索的开端。链接:https://pixelrag.ai/

项目最后更新:08/29/26

GitHub Stars

9.8K

Forks数量

836

贡献者数量

20

许可证

Apache-2.0

收录理由

传统的检索流程往往会把页面视觉布局中蕴含的信息白白丢掉,而 PixelRAG 换了一条路:先把文档渲染成截图瓦片,再对这些图像建索引,这样图表、排版和结构这些纯文本提取会遗漏的内容,也能被搜索命中。工具本身很轻,核心就两个命令——一个把页面渲染成瓦片,另一个查询视觉索引,另外它还提供了一个包含 828 万维基百科页面的托管索引,不用自己搭流程就能直接试。这个项目源自伯克利的研究,他们对比了截图和文本在检索上的表现,发现视觉方案在实际中站得住脚。对于想评估视觉检索是否适合自己的语料的小团队来说,真实的评测加上能跑通的演示,是最快验证想法的途径。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目