#11 · 主分类: LLM应用框架
langextract
一个Python库,使用LLM从非结构化文本中提取结构化信息,具备精确源定位和交互式可视化。
项目最后更新:08/27/26
GitHub Stars
38.5K
Forks数量
2.7K
贡献者数量
24
许可证
Apache-2.0
收录理由
LangExtract 解决了一个很实在的问题:把自由文本变成可查询的结构化数据,而且每个提取出来的值都能精确追溯到原文中的字符位置。你只需要用一小段提示词和几个示例来定义任务,库就会让大模型处理文档,长文本会被切块并并行运行。这种溯源能力在实际使用中特别关键——不用盲目相信模型输出,打开交互式 HTML 报告就能看到成千上万个条目分别来自哪里。它在临床记录、放射报告这类真实场景里表现稳定,既支持 Gemini、OpenAI 等云端模型,也能通过 Ollama 跑本地模型。因为不需要微调,小团队不用搭建定制流程就能获得可靠的结构化结果。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
langchain
智能体工程平台。
dify
在一个协作工作区中构建Agentic工作流、RAG管道,支持丰富的AI模型和工具。可部署在云、VPC或自托管环境,团队无需重建技术栈即可从原型走向生产。
headroom
压缩工具输出、日志、文件和RAG块,再送入LLM。编码代理减少20% token,JSON减少60-95% token,答案不变。提供库、代理、MCP服务器。
litellm
最快的、最轻量的AI网关。Rust核心,Python SDK。以OpenAI(或原生)格式调用100多种LLM API,具备成本追踪、护栏、负载均衡和日志记录 [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]
llama_index
LlamaIndex 是领先的文档代理和 OCR 平台