#71 · 主分类: LLM应用框架

cascadeflow

agent ai anthropic api budgets claude cost-optimization cost-transparency google-adk gpt huggingface llm model-cascading n8n ollama openai python together-ai typescript vllm

用于AI代理的级联运行时。在代理循环内优化成本、延迟、质量和策略决策。

项目最后更新:08/27/26

GitHub Stars

4.0K

Forks数量

911

贡献者数量

7

许可证

MIT

收录理由

智能体在长循环里反复调用模型,开销大头往往就耗在这些重复请求上,而常见做法是在 API 前挂个代理。cascadeflow 换了个思路,直接在进程内做级联调度:先用小而便宜的模型处理简单步骤,再由质量检查判断结果是否靠谱,只有通不过时才升级到昂贵的旗舰模型。围绕这套路由,它还能强制预算、限制工具调用次数、控制延迟与能耗,并落实合规策略,同时提供带 KPI 权重的路由和逐步骤决策轨迹,方便审计。它支持 LangChain、OpenAI Agents、CrewAI、PydanticAI 或 n8n,无需更换供应商,Python 和 TypeScript 版本都有。README 显示在 MT-Bench 上节省 69% 成本,GSM8K 上节省 93%,同时保留 96% 的 GPT-5 质量。如果团队的流量大多是小模型就能搞定的简单查询,这套级联机制正好能派上大用场。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目