循序渐进 · AIP 教学 · AIP Evals(八)
把运行结果写入数据集
Evals 界面不是给所有人用的。把结果写进数据集,就能在 Workshop 等应用里跟其他信息一起展示,让领域专家也能看到。
本文来源 · Source
内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip-evals/results-dataset/
原始标题:AIP Evals • Write run results to a dataset • Palantir · 所属:AIP Evals(给 AI 做测试)
https://www.palantir.com/docs/foundry/aip-evals/results-dataset/
原始标题:AIP Evals • Write run results to a dataset • Palantir · 所属:AIP Evals(给 AI 做测试)
★
先记住这几条
① 结果需要被更多人看到
领域专家未必会用 Evals 界面。
② 写进数据集就能复用
结果成为平台里的一等数据。
③ 可嵌入业务应用
在 Workshop 里与业务信息并列展示。
0
写在前面
根据被评估的函数和工作流,评估套件运行结果可能需要在平台的其他部分中呈现。例如,领域专家可能不够技术化,无法在 AIP Evals 中分析结果,他们可能希望运行数据与其他信息一起显示在专门的 Workshop 应用中。
为满足这一需求,AIP Evals 支持将运行结果写入数据集(dataset)。
当配置了运行结果数据集,且评估套件以项目范围执行模式运行时,该运行产生的所有信息都将自动写入所配置的数据集。这包括函数输出、评估器结果、用户指定和自动捕获的元数据以及错误。基于你所配置目标的每个指标的 passed 和 failed 结果目前尚不支持,并且编辑本体的受测函数不会产生函数输出。
运行结果数据集对于生成数据可以做什么提供了最大的灵活性。使用现有的 Foundry 工具,数据可用于更复杂的计算,例如将其写入对象并在 Workshop 中呈现,或在 Contour 中执行更深入的分析。
要将运行结果写入数据集,评估套件需要以项目范围执行模式运行,并且运行结果数据集需要与评估套件位于同一个项目中。否则,AIP Evals 将无法把数据写入该数据集。
1
配置运行结果数据集
要点:把结果写去哪里、怎么写。
要配置运行结果数据集,请按以下步骤操作:
- 打开评估套件页面。
- 在 AIP Logic 中,选择 AIP Logic 侧边栏中的 View。
- 或者,从文件系统中打开该评估套件。
- 在运行历史数据集区域中,选择 Create dataset。
- 定义数据集的名称和保存位置,并确认。
完成这些步骤后,数据集即可使用,以项目范围执行模式运行评估套件将把结果写入该数据集。
如果你移除了某个运行结果数据集,你将无法再次选择它。你需要创建一个新的数据集。

延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Evals(给 AI 做测试)
同一主题下的相邻内容。
- AIP Evals 总览:给 AI 函数做测试LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的
- 为 Logic 函数建立评估套件Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。
- 创建评估套件评估套件 = 测试用例 + 目标函数 + 评估函数。这篇讲怎么把它搭起来,包括同时测多个目标函数的做法。
- 用中间参数评估 block 输出LLM 函数往往包含多个步骤,只看最终结果可能看不出是哪一步出了问题。这篇讲怎么评测中间 block 的输出。
- 评估 Ontology 编辑测一个会写 Ontology 的函数,难道每次都要真改数据?不用 —— 每个测试用例在 Ontology 模拟环境里跑,
- 运行评估套件套件可以从多个地方运行:AIP Logic 的 Evals 侧边栏、AIP Evals 应用。可以整跑,也可以只跑单个用
- 运行实验:系统对比参数组合想知道哪个模型性价比最高、哪版提示词效果最好?用实验系统性地跑多个参数组合,而不是靠猜。
- 分析运行结果结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Cha
- 在指标仪表盘查看结果把多次运行的结果收拢到一处,用图表和统计呈现,还能比较聚合结果或单个测试用例的表现。