#11 · 主分类: LLM应用框架

langextract

gemini gemini-ai gemini-api gemini-flash gemini-pro information-extration large-language-models llm nlp python structured-data

一个Python库,使用LLM从非结构化文本中提取结构化信息,具备精确源定位和交互式可视化。

项目最后更新:08/27/26

GitHub Stars

38.5K

Forks数量

2.7K

贡献者数量

24

许可证

Apache-2.0

收录理由

LangExtract 解决了一个很实在的问题:把自由文本变成可查询的结构化数据,而且每个提取出来的值都能精确追溯到原文中的字符位置。你只需要用一小段提示词和几个示例来定义任务,库就会让大模型处理文档,长文本会被切块并并行运行。这种溯源能力在实际使用中特别关键——不用盲目相信模型输出,打开交互式 HTML 报告就能看到成千上万个条目分别来自哪里。它在临床记录、放射报告这类真实场景里表现稳定,既支持 Gemini、OpenAI 等云端模型,也能通过 Ollama 跑本地模型。因为不需要微调,小团队不用搭建定制流程就能获得可靠的结构化结果。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目