分析运行结果
结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Chatbot Studio 的侧边栏里看。
https://www.palantir.com/docs/foundry/aip-evals/analyze-run-results/
原始标题:AIP Evals • Analyze run results • Palantir · 所属:AIP Evals(给 AI 做测试)
先记住这几条
写在前面
运行结果显示你的函数在测试用例和评估标准方面的表现如何。结果视图可在 AIP Evals 应用中查看,也可在 AIP Logic 和 AIP Chatbot Studio 中集成的 AIP Evals 侧边栏中查看。
如果你在评估器上配置了通过标准(pass criteria),AIP Evals 将自动为每个测试用例判定 Passed 或 Failed 状态。结果页面会显示所有测试用例的整体通过百分比。
测试用例调试视图
在某些情况下,你可能想进一步调查某个特定的测试用例结果。针对这些情况,可以使用调试视图(debug view)。该视图提供单个测试用例的执行轨迹、输入/输出数据和错误消息,让你能够理解你的函数输出和评估器结果。
Access the debug view
有多种方式可以打开测试用例的调试视图。你可以从 AIP Evals、AIP Logic 或 AIP Chatbot Studio 中打开。
In AIP Evals
- 在你的评估套件页面上打开 Results 标签页。
- 选择一次运行并切换到 Test cases。
- 将鼠标悬停在某个测试用例结果上。
- 选择出现在测试用例行右侧的 Open 选项。

In AIP Logic or AIP Chatbot Studio
- 在运行结果对话框视图中,将鼠标悬停在某个测试用例结果上。
- 选择出现在测试用例卡片右上角的 Debugger 选项。
- 调试视图将打开,显示详细的执行信息。

Debug view capabilities
调试视图提供有关受测函数执行和评估器结果的详细信息。它允许你:
- 检查某个测试用例的受测函数输入和输出。
- TypeScript/Python 函数: 访问已执行代码的语法高亮代码预览。
- AIP Logic 函数: 使用原生 Logic 调试器逐步跟踪函数执行过程。
- 评估器: 查看输入和输出值、评估器的期望值与实际值结果,以及来自自定义函数评估器和部分内置评估器的调试输出。


某些评估器会在评估器标签页中将额外上下文作为 Debug outputs 展示。例如,内置的 LLM-as-a-judge 评估器会返回模型的推理过程作为调试输出,帮助你理解它为何得出特定的判定。
如果你编写了自定义评估器,它们也可以产生调试输出。自定义评估器在其指标输出之外返回的任何字符串值都会显示为 Debug outputs,提供诸如推理、中间值或诊断信息之类的额外上下文。

如果你使用 AIP Logic 构建自定义函数评估器,你还可以额外访问原生 Logic 调试器。这有助于你理解评估为何产生特定结果,在使用 LLM-as-a-judge 作为评估器时特别有帮助。
在下方截图所示的示例中,自定义函数评分标准评估器(rubric grader evaluator)未通过,因为结果 8 没有达到所定义的最小阈值 9。查看 Logic 调试器,我们可以看到 LLM 评判者只给出了 8 分,因为回答被引号包裹着。要获得更高的分数,我们需要改进我们的提示词。

跨目标函数比较结果
当你的评估套件配置了多个目标函数时,你可以在 AIP Evals 中选择并比较跨不同目标的运行结果。这对于分析不同函数实现在同一批测试用例上的表现非常有用。

用 AI FDE 分析结果
你可以使用 AI FDE 来分析失败的测试用例、识别根本原因模式,并获得改进提示词的建议。
Analyze from AIP Evals
- 在你的评估套件页面上打开 Results 标签页。
- 选择一次包含失败测试用例的运行,然后选择 Test cases 标签页。
- 选择 Analyze with AI FDE。
Analyze from AIP Logic
- 从 AIP Evals 侧边栏打开运行结果对话框视图。
- 选择 Analyze with AI FDE。
AI FDE 将在新标签页中打开,并带有你的运行结果的上下文。有关 AI FDE 的更多信息,请参阅 AI FDE 文档。
延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Evals(给 AI 做测试)
同一主题下的相邻内容。
- AIP Evals 总览:给 AI 函数做测试LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的
- 为 Logic 函数建立评估套件Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。
- 创建评估套件评估套件 = 测试用例 + 目标函数 + 评估函数。这篇讲怎么把它搭起来,包括同时测多个目标函数的做法。
- 用中间参数评估 block 输出LLM 函数往往包含多个步骤,只看最终结果可能看不出是哪一步出了问题。这篇讲怎么评测中间 block 的输出。
- 评估 Ontology 编辑测一个会写 Ontology 的函数,难道每次都要真改数据?不用 —— 每个测试用例在 Ontology 模拟环境里跑,
- 运行评估套件套件可以从多个地方运行:AIP Logic 的 Evals 侧边栏、AIP Evals 应用。可以整跑,也可以只跑单个用
- 运行实验:系统对比参数组合想知道哪个模型性价比最高、哪版提示词效果最好?用实验系统性地跑多个参数组合,而不是靠猜。
- 把运行结果写入数据集Evals 界面不是给所有人用的。把结果写进数据集,就能在 Workshop 等应用里跟其他信息一起展示,让领域专家也能
- 在指标仪表盘查看结果把多次运行的结果收拢到一处,用图表和统计呈现,还能比较聚合结果或单个测试用例的表现。
常见问题速答 · FAQ
关于「分析运行结果」,读者最常问的几个问题。