#56 · 主分类: MLOps与评测

giskard-oss

agent-evaluation ai-red-team ai-security ai-testing fairness-ai llm llm-eval llm-evaluation llm-security llmops ml-testing ml-validation mlops rag-evaluation red-team-tools responsible-ai trustworthy-ai

🐢 用于LLM智能体的开源评估与测试库

项目最后更新:08/28/26

GitHub Stars

5.8K

Forks数量

527

贡献者数量

88

许可证

Apache-2.0

收录理由

对于正在交付LLM智能体、RAG流水线或单一模型端点的团队来说,这是一条在功能触达用户之前检查其行为的务实路径。它把编写评测的校验包和自动生成对抗性测试用例的扫描层组合在一起,覆盖提示注入、越狱、有害内容以及其他OWASP LLM Top-10威胁。评测侧从简单的断言延伸到基于LLM裁判的接地性和一致性检查,能够应对非确定性输出;扫描侧则帮助你针对已知故障模式进行红队演练,而不必逐条手写攻击样本。v3重写采用模块化和异步优先的设计,你只需引入自己需要的部分,也可以将任意可调用对象包装为被测目标。如果你希望将评测与安全测试整合进一个可通过pip安装的包,而不是在多个工具之间来回切换,这是一个可靠且维护活跃的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目