为 Logic 函数建立评估套件
Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。
https://www.palantir.com/docs/foundry/aip-evals/getting-started/
原始标题:AIP Evals • Evaluation suites for Logic functions • Palantir · 所属:AIP Evals(给 AI 做测试)
先记住这几条
写在前面
Logic 的 Preview 面板非常适合一次性测试,但若想对 Logic 函数获得更高的信心,针对大量输入进行测试非常重要。
本教程将带你使用 AIP Evals 为一个简单的 Logic 函数创建评估套件。
从 Logic 创建评估套件
在本示例中,我们有一个 Logic 函数,它以餐厅评论作为输入,并根据评论情感将其分类为正面或负面。我们希望创建带有评论输入和期望情感输出的测试用例,以验证我们的函数。
保存 Logic 函数后,有几种方式可以创建评估套件:
- 在 Preview 面板中,你可以创建新的评估套件,并通过选择 Add as test case 同时添加第一个测试用例。
- 在 Evals 面板中,你可以选择 Set up tests manually 来创建一个空的评估套件,或者,如果你的 Logic 函数符合条件,选择 Generate evals,让 AIP 为你引导生成有用的测试和评估器。
选择 View limitations 可了解 AIP 无法自动生成测试和评估器的情况。如果你的 Logic 函数不符合 AIP 生成 evals 的条件,那么 Generate evals 按钮将被禁用,并显示说明以帮助你理解原因。

创建或生成评估套件后,你可以通过在 AIP Evals 面板中选择 Edit tests 来添加或修改测试用例。这将打开测试用例编辑器,你可以在其中为每个测试用例配置输入并保存评估套件。

当你在 Preview 面板中选择 Add as test case,或在 Evals 面板中选择 Generate evals 时,AIP 会尝试根据输入参数为你的测试用例提供一个描述性的名称。你也可以选择测试用例名称旁的紫色 AIP 星形图标来生成建议名称。

在本示例中,建议名称 Negative Review On Food Quality 比 Test case 1 提供了更多信息:

添加测试用例后,你可以通过在 Evals 面板中选择 Run evaluation suite 来运行评估套件。这将运行套件中的所有测试用例。套件运行完成后,通过选择 Most recent run 区域中的卡片来查看结果。

如果你是通过 Evals 面板中的 Set up tests manually,或 Preview 面板中的 Add as test case 创建评估套件,AIP Evals 将输出函数的返回值,但不会提供聚合的表现指标。若要扩展你的评估套件,请添加一个评估器(evaluator),以将 Logic 函数产生的输出与期望值进行比较并计算聚合指标。在本示例中,请使用内置的 Exact string match 评估器。在实践中,根据函数性质的不同,你可能需要使用其他评估器或编写自定义评估器。
要添加评估器,请在测试用例配置标题中选择 + Add,然后选择 Exact string match > Add。这将添加评估器并打开评估器编辑器,你可以在其中将评估器输入映射到函数输出和测试用例列。在这种情况下,将函数输出映射到实际值,并为期望值创建一个新参数。这将向测试用例编辑器添加一个新列,你可以在其中为每个测试用例输入期望的情感。
你可以为每个指标配置目标(objective)。对于布尔型指标,选择 true 还是 false 值被视为通过结果。对于数值型指标,选择更高的值更好还是更低的值更好,并在需要时设置阈值。评估套件将根据这些目标自动为每个测试用例判定 passed 或 failed 状态。

保存后,你可以再次运行评估套件,以查看你函数的聚合指标,以及基于你所配置目标得出的每个测试用例的 passed 或 failed 结果。

你并非每次修改函数时都必须运行整个套件。你可以通过选择侧边栏中测试用例旁的播放图标来运行单个测试用例。这对于调试和快速迭代你的函数非常有用。
创建评估套件后,请进一步了解评估套件运行配置。
延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Evals(给 AI 做测试)
同一主题下的相邻内容。
- AIP Evals 总览:给 AI 函数做测试LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的
- 创建评估套件评估套件 = 测试用例 + 目标函数 + 评估函数。这篇讲怎么把它搭起来,包括同时测多个目标函数的做法。
- 用中间参数评估 block 输出LLM 函数往往包含多个步骤,只看最终结果可能看不出是哪一步出了问题。这篇讲怎么评测中间 block 的输出。
- 评估 Ontology 编辑测一个会写 Ontology 的函数,难道每次都要真改数据?不用 —— 每个测试用例在 Ontology 模拟环境里跑,
- 运行评估套件套件可以从多个地方运行:AIP Logic 的 Evals 侧边栏、AIP Evals 应用。可以整跑,也可以只跑单个用
- 运行实验:系统对比参数组合想知道哪个模型性价比最高、哪版提示词效果最好?用实验系统性地跑多个参数组合,而不是靠猜。
- 把运行结果写入数据集Evals 界面不是给所有人用的。把结果写进数据集,就能在 Workshop 等应用里跟其他信息一起展示,让领域专家也能
- 分析运行结果结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Cha
- 在指标仪表盘查看结果把多次运行的结果收拢到一处,用图表和统计呈现,还能比较聚合结果或单个测试用例的表现。