循序渐进 · AIP 教学 · AIP Evals(四)
用中间参数评估 block 输出
LLM 函数往往包含多个步骤,只看最终结果可能看不出是哪一步出了问题。这篇讲怎么评测中间 block 的输出。
本文来源 · Source
内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip-evals/intermediate-parameters/
原始标题:AIP Evals • Use intermediate parameters to evaluate block output • Palantir · 所属:AIP Evals(给 AI 做测试)
https://www.palantir.com/docs/foundry/aip-evals/intermediate-parameters/
原始标题:AIP Evals • Use intermediate parameters to evaluate block output • Palantir · 所属:AIP Evals(给 AI 做测试)
★
先记住这几条
① 只看终局不够
最终错误可能源于中间某一步。
② 中间输出可单独评
把中间 block 的输出暴露成参数来测。
③ 能定位问题环节
哪一步偏了,一目了然。
0
写在前面
LLM 驱动的功能通常包含多个复杂操作,仅评估最终结果可能不足以判断提示词的表现。
借助 AIP Logic 和 AIP Evals,你可以设置中间参数(intermediate parameters)用于评估。与最终函数输出类似,中间输出可用于设置自动化的评估器,或者仅用于查看结果。如果设置了评估套件结果数据集(results dataset),中间参数的输出值也将被包含其中。
1
配置中间参数
要点:把中间 block 的输出暴露出来单独评。
要设置用于评估的中间参数,请按以下步骤操作:
- 选择 AIP Logic 模块上的烧瓶图标,以将该输出暴露为中间参数。
- 在评估器配置面板中选择新的中间参数,以评估该输出。

延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Evals(给 AI 做测试)
同一主题下的相邻内容。
- AIP Evals 总览:给 AI 函数做测试LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的
- 为 Logic 函数建立评估套件Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。
- 创建评估套件评估套件 = 测试用例 + 目标函数 + 评估函数。这篇讲怎么把它搭起来,包括同时测多个目标函数的做法。
- 评估 Ontology 编辑测一个会写 Ontology 的函数,难道每次都要真改数据?不用 —— 每个测试用例在 Ontology 模拟环境里跑,
- 运行评估套件套件可以从多个地方运行:AIP Logic 的 Evals 侧边栏、AIP Evals 应用。可以整跑,也可以只跑单个用
- 运行实验:系统对比参数组合想知道哪个模型性价比最高、哪版提示词效果最好?用实验系统性地跑多个参数组合,而不是靠猜。
- 把运行结果写入数据集Evals 界面不是给所有人用的。把结果写进数据集,就能在 Workshop 等应用里跟其他信息一起展示,让领域专家也能
- 分析运行结果结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Cha
- 在指标仪表盘查看结果把多次运行的结果收拢到一处,用图表和统计呈现,还能比较聚合结果或单个测试用例的表现。