循序渐进 · AIP 教学 · AIP Evals(二)

为 Logic 函数建立评估套件

Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。

全部目录 AIP 首页 ← 上一篇 为 Logic 函数建立评估套件 下一篇 →
本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip-evals/getting-started/
原始标题:AIP Evals • Evaluation suites for Logic functions • Palantir · 所属:AIP Evals(给 AI 做测试)

先记住这几条

① Preview 只够试跑
手动点几次不等于验证过。
② 要覆盖大量输入
测试用例越多,结论越可靠。
③ 从 Logic 侧边栏起步
评测能力就集成在 Logic 里。
0

写在前面

Logic 的 Preview 面板非常适合一次性测试,但若想对 Logic 函数获得更高的信心,针对大量输入进行测试非常重要。

本教程将带你使用 AIP Evals 为一个简单的 Logic 函数创建评估套件。

1

从 Logic 创建评估套件

要点:入口就在 Logic 里,动手第一步。

在本示例中,我们有一个 Logic 函数,它以餐厅评论作为输入,并根据评论情感将其分类为正面或负面。我们希望创建带有评论输入和期望情感输出的测试用例,以验证我们的函数。

保存 Logic 函数后,有几种方式可以创建评估套件:

  • Preview 面板中,你可以创建新的评估套件,并通过选择 Add as test case 同时添加第一个测试用例。
  • Evals 面板中,你可以选择 Set up tests manually 来创建一个空的评估套件,或者,如果你的 Logic 函数符合条件,选择 Generate evals,让 AIP 为你引导生成有用的测试和评估器。

选择 View limitations 可了解 AIP 无法自动生成测试和评估器的情况。如果你的 Logic 函数不符合 AIP 生成 evals 的条件,那么 Generate evals 按钮将被禁用,并显示说明以帮助你理解原因。

从 AIP Logic 创建你的评估套件。
从 AIP Logic 创建你的评估套件。

创建或生成评估套件后,你可以通过在 AIP Evals 面板中选择 Edit tests 来添加或修改测试用例。这将打开测试用例编辑器,你可以在其中为每个测试用例配置输入并保存评估套件。

向评估套件添加测试用例。
向评估套件添加测试用例。

当你在 Preview 面板中选择 Add as test case,或在 Evals 面板中选择 Generate evals 时,AIP 会尝试根据输入参数为你的测试用例提供一个描述性的名称。你也可以选择测试用例名称旁的紫色 AIP 星形图标来生成建议名称。

生成建议的测试用例名称。
生成建议的测试用例名称。

在本示例中,建议名称 Negative Review On Food QualityTest case 1 提供了更多信息:

建议名称简要描述了测试用例的参数。
建议名称简要描述了测试用例的参数。

添加测试用例后,你可以通过在 Evals 面板中选择 Run evaluation suite 来运行评估套件。这将运行套件中的所有测试用例。套件运行完成后,通过选择 Most recent run 区域中的卡片来查看结果。

运行评估套件并查看结果
运行评估套件并查看结果

如果你是通过 Evals 面板中的 Set up tests manually,或 Preview 面板中的 Add as test case 创建评估套件,AIP Evals 将输出函数的返回值,但不会提供聚合的表现指标。若要扩展你的评估套件,请添加一个评估器(evaluator),以将 Logic 函数产生的输出与期望值进行比较并计算聚合指标。在本示例中,请使用内置的 Exact string match 评估器。在实践中,根据函数性质的不同,你可能需要使用其他评估器或编写自定义评估器。

要添加评估器,请在测试用例配置标题中选择 + Add,然后选择 Exact string match > Add。这将添加评估器并打开评估器编辑器,你可以在其中将评估器输入映射到函数输出和测试用例列。在这种情况下,将函数输出映射到实际值,并为期望值创建一个新参数。这将向测试用例编辑器添加一个新列,你可以在其中为每个测试用例输入期望的情感。

你可以为每个指标配置目标(objective)。对于布尔型指标,选择 true 还是 false 值被视为通过结果。对于数值型指标,选择更高的值更好还是更低的值更好,并在需要时设置阈值。评估套件将根据这些目标自动为每个测试用例判定 passedfailed 状态。

添加 exact string match 评估器。
添加 exact string match 评估器。

保存后,你可以再次运行评估套件,以查看你函数的聚合指标,以及基于你所配置目标得出的每个测试用例的 passedfailed 结果。

使用 string match 评估器查看结果。
使用 string match 评估器查看结果。

你并非每次修改函数时都必须运行整个套件。你可以通过选择侧边栏中测试用例旁的播放图标来运行单个测试用例。这对于调试和快速迭代你的函数非常有用。

创建评估套件后,请进一步了解评估套件运行配置

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

本组其他页面 · AIP Evals(给 AI 做测试)

同一主题下的相邻内容。