#56 · 主分类: MLOps与评测
giskard-oss
🐢 用于LLM智能体的开源评估与测试库
项目最后更新:08/28/26
GitHub Stars
5.8K
Forks数量
527
贡献者数量
88
许可证
Apache-2.0
收录理由
对于正在交付LLM智能体、RAG流水线或单一模型端点的团队来说,这是一条在功能触达用户之前检查其行为的务实路径。它把编写评测的校验包和自动生成对抗性测试用例的扫描层组合在一起,覆盖提示注入、越狱、有害内容以及其他OWASP LLM Top-10威胁。评测侧从简单的断言延伸到基于LLM裁判的接地性和一致性检查,能够应对非确定性输出;扫描侧则帮助你针对已知故障模式进行红队演练,而不必逐条手写攻击样本。v3重写采用模块化和异步优先的设计,你只需引入自己需要的部分,也可以将任意可调用对象包装为被测目标。如果你希望将评测与安全测试整合进一个可通过pip安装的包,而不是在多个工具之间来回切换,这是一个可靠且维护活跃的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具