循序渐进 · AIP 教学 · AIP Evals(十)
在指标仪表盘查看结果
把多次运行的结果收拢到一处,用图表和统计呈现,还能比较聚合结果或单个测试用例的表现。
本文来源 · Source
内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip-evals/metrics-dashboard/
原始标题:AIP Evals • View results in metrics dashboard • Palantir · 所属:AIP Evals(给 AI 做测试)
https://www.palantir.com/docs/foundry/aip-evals/metrics-dashboard/
原始标题:AIP Evals • View results in metrics dashboard • Palantir · 所属:AIP Evals(给 AI 做测试)
★
先记住这几条
① 仪表盘适合看趋势
比逐条读结果更直观。
② 可比较聚合与个体
整体指标和单用例都能切。
③ 跨运行对比
看改动前后是否真的变好了。
0
写在前面
评估套件运行的指标会被收集到报告中,可在 AIP Evals 指标仪表盘(metrics dashboard)中查看。在这里,你可以查看图表和统计数据,或比较来自评估函数的聚合结果和/或来自单个测试用例的结果。仪表盘视图中不支持指标目标(metric objectives)。

要访问仪表盘,请在 Logic 侧边栏的运行结果视图中选择 View metrics dashboard,或在评估套件页面上选择 Run tests 标签页。

如需更深入的分析和调试,你可以访问 LLM 轨迹查看器(LLM trace viewer)。导航到 View tests 标签页,然后双击某个测试用例以打开轨迹查看器。在这里,你将能够查看概述函数结果如何计算出来的执行信息。如果你使用的是自定义 LLM 作为评判者的评估器,LLM 轨迹查看器还将包含有关 LLM 评判者决策过程的信息。

延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Evals(给 AI 做测试)
同一主题下的相邻内容。
- AIP Evals 总览:给 AI 函数做测试LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的
- 为 Logic 函数建立评估套件Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。
- 创建评估套件评估套件 = 测试用例 + 目标函数 + 评估函数。这篇讲怎么把它搭起来,包括同时测多个目标函数的做法。
- 用中间参数评估 block 输出LLM 函数往往包含多个步骤,只看最终结果可能看不出是哪一步出了问题。这篇讲怎么评测中间 block 的输出。
- 评估 Ontology 编辑测一个会写 Ontology 的函数,难道每次都要真改数据?不用 —— 每个测试用例在 Ontology 模拟环境里跑,
- 运行评估套件套件可以从多个地方运行:AIP Logic 的 Evals 侧边栏、AIP Evals 应用。可以整跑,也可以只跑单个用
- 运行实验:系统对比参数组合想知道哪个模型性价比最高、哪版提示词效果最好?用实验系统性地跑多个参数组合,而不是靠猜。
- 把运行结果写入数据集Evals 界面不是给所有人用的。把结果写进数据集,就能在 Workshop 等应用里跟其他信息一起展示,让领域专家也能
- 分析运行结果结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Cha