循序渐进 · AIP 教学 · AIP Evals(九)

分析运行结果

结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Chatbot Studio 的侧边栏里看。

本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip-evals/analyze-run-results/
原始标题:AIP Evals • Analyze run results • Palantir · 所属:AIP Evals(给 AI 做测试)

先记住这几条

① 结果按用例与标准展开
能看到每条用例的判定情况。
② 三个查看入口
Evals 应用、Logic 侧边栏、Chatbot Studio 侧边栏。
③ 关注聚合与个体
整体指标和单条表现都要看。
0

写在前面

运行结果显示你的函数在测试用例和评估标准方面的表现如何。结果视图可在 AIP Evals 应用中查看,也可在 AIP Logic 和 AIP Chatbot Studio 中集成的 AIP Evals 侧边栏中查看。

如果你在评估器上配置了通过标准(pass criteria),AIP Evals 将自动为每个测试用例判定 PassedFailed 状态。结果页面会显示所有测试用例的整体通过百分比。

1

测试用例调试视图

要点:单条用例的细节查看。

在某些情况下,你可能想进一步调查某个特定的测试用例结果。针对这些情况,可以使用调试视图(debug view)。该视图提供单个测试用例的执行轨迹、输入/输出数据和错误消息,让你能够理解你的函数输出和评估器结果。

Access the debug view

有多种方式可以打开测试用例的调试视图。你可以从 AIP Evals、AIP Logic 或 AIP Chatbot Studio 中打开。

In AIP Evals

  1. 在你的评估套件页面上打开 Results 标签页。
  2. 选择一次运行并切换到 Test cases
  3. 将鼠标悬停在某个测试用例结果上。
  4. 选择出现在测试用例行右侧的 Open 选项。
AIP Evals 应用结果视图。
AIP Evals 应用结果视图。

In AIP Logic or AIP Chatbot Studio

  1. 在运行结果对话框视图中,将鼠标悬停在某个测试用例结果上。
  2. 选择出现在测试用例卡片右上角的 Debugger 选项。
  3. 调试视图将打开,显示详细的执行信息。
AIP Logic 中的 AIP Evals 运行结果视图。
AIP Logic 中的 AIP Evals 运行结果视图。

Debug view capabilities

调试视图提供有关受测函数执行和评估器结果的详细信息。它允许你:

  • 检查某个测试用例的受测函数输入和输出。
  • TypeScript/Python 函数: 访问已执行代码的语法高亮代码预览。
  • AIP Logic 函数: 使用原生 Logic 调试器逐步跟踪函数执行过程。
  • 评估器: 查看输入和输出值、评估器的期望值与实际值结果,以及来自自定义函数评估器和部分内置评估器的调试输出。
AIP Evals 调试视图中的函数输出。
AIP Evals 调试视图中的函数输出。
AIP Evals 调试视图中的评估器标签页。
AIP Evals 调试视图中的评估器标签页。

某些评估器会在评估器标签页中将额外上下文作为 Debug outputs 展示。例如,内置的 LLM-as-a-judge 评估器会返回模型的推理过程作为调试输出,帮助你理解它为何得出特定的判定。

如果你编写了自定义评估器,它们也可以产生调试输出。自定义评估器在其指标输出之外返回的任何字符串值都会显示为 Debug outputs,提供诸如推理、中间值或诊断信息之类的额外上下文。

来自自定义函数评估器的调试输出。
来自自定义函数评估器的调试输出。

如果你使用 AIP Logic 构建自定义函数评估器,你还可以额外访问原生 Logic 调试器。这有助于你理解评估为何产生特定结果,在使用 LLM-as-a-judge 作为评估器时特别有帮助。

在下方截图所示的示例中,自定义函数评分标准评估器(rubric grader evaluator)未通过,因为结果 8 没有达到所定义的最小阈值 9。查看 Logic 调试器,我们可以看到 LLM 评判者只给出了 8 分,因为回答被引号包裹着。要获得更高的分数,我们需要改进我们的提示词。

使用 AIP Evals 调试视图理解评估器结果的示例。
使用 AIP Evals 调试视图理解评估器结果的示例。
2

跨目标函数比较结果

要点:同套件下多函数横向比。

当你的评估套件配置了多个目标函数时,你可以在 AIP Evals 中选择并比较跨不同目标的运行结果。这对于分析不同函数实现在同一批测试用例上的表现非常有用。

多目标结果对比视图。
多目标结果对比视图。
3

用 AI FDE 分析结果

要点:对话式分析评测数据。

你可以使用 AI FDE 来分析失败的测试用例、识别根本原因模式,并获得改进提示词的建议。

Analyze from AIP Evals

  1. 在你的评估套件页面上打开 Results 标签页。
  2. 选择一次包含失败测试用例的运行,然后选择 Test cases 标签页。
  3. 选择 Analyze with AI FDE

Analyze from AIP Logic

  1. 从 AIP Evals 侧边栏打开运行结果对话框视图。
  2. 选择 Analyze with AI FDE

AI FDE 将在新标签页中打开,并带有你的运行结果的上下文。有关 AI FDE 的更多信息,请参阅 AI FDE 文档

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

本组其他页面 · AIP Evals(给 AI 做测试)

同一主题下的相邻内容。

常见问题速答 · FAQ

关于「分析运行结果」,读者最常问的几个问题。

测试用例调试视图是什么?
单条用例的细节查看。在某些情况下,你可能想进一步调查某个特定的测试用例结果。针对这些情况,可以使用调试视图(debug view)。该视图提供单个测试用例的执行轨迹、输入/输出数据和错误消息,让你能够理解你的函数输出和评估器结果。
跨目标函数比较结果是什么?
同套件下多函数横向比。当你的评估套件配置了多个目标函数时,你可以在 AIP Evals 中选择并比较跨不同目标的运行结果。这对于分析不同函数实现在同一批测试用例上的表现非常有用。
用 AI FDE 分析结果是什么?
对话式分析评测数据。你可以使用 AI FDE 来分析失败的测试用例、识别根本原因模式,并获得改进提示词的建议。