DeepEval 是开源工具,帮助测试并评分 AI agent 给出的 answer。你编写小 test case,展示 input 与期望 reply,或 reply 必须遵守的规则。DeepEval 运行 agent,用 similarity、accuracy 或 safety 等内置 measure 检查 reply,并将每个 test 标为 pass 或 fail。可添加自定义 check,将 test 存于 code 或 YAML,并在 CI pipeline 中运行,使每个新 model 或 prompt version 得到相同快速 audit。快速 feedback 便于发现错误、减少 hallucination,并在 ship 前比较不同 model。