AIP Evals 总览:给 AI 函数做测试
LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的测试环境:建测试用例、定评估标准、跟历史版本比。
https://www.palantir.com/docs/foundry/aip-evals/overview/
原始标题:AIP Evals • Overview • Palantir · 所属:AIP Evals(给 AI 做测试)
先记住这几条
写在前面
AIP Evals 是一个测试环境,用于评估 AIP Logic 函数(AIP Logic functions)、AIP Chatbot 函数(AIP Chatbot functions)或代码编写的函数(code-authored functions)的表现。它专门用于帮助你应对 LLM 的非确定性特征。借助 AIP Evals,你可以创建测试用例(test case)、定义评估函数(evaluation function)来衡量表现,并将结果与函数的早期版本进行对比。它使你能够建立必要的信心,从而将 LLM 驱动的函数投入生产环境,或对既有实现进行修改。
你可以使用 AIP Evals 来:
- 创建测试用例并定义评估标准。
- 调试、迭代并改进函数与提示词。
- 对比不同模型在你的函数上的表现。
- 考察多次运行之间的差异。
AIP Evals 也可作为 AI FDE 中的集成工具使用,让你能够通过对话式指令创建并运行评估套件(evaluation suite)。

核心概念
评估套件(Evaluation suite): 用于对函数表现进行基准测试的测试用例、目标函数(target function)与评估函数的集合。
目标函数(Target function): 被评估的函数。一个套件可以配置为同时测试多个目标函数。
评估函数(Evaluation function): 将目标函数的实际输出与期望输出进行比较或评估时所使用的方法。
测试用例(Test cases): 定义好的输入与期望输出集合,在评估套件运行时被传入评估函数。
指标(Metrics): 评估函数的结果。指标按每个测试用例生成,可以在多次运行之间进行聚合对比或单独对比。
延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
本组其他页面 · AIP Evals(给 AI 做测试)
同一主题下的相邻内容。
- 为 Logic 函数建立评估套件Logic 的 Preview 面板适合一次性试跑;但要建立真正的信心,必须拿大量输入去测。这篇是入门路径。
- 创建评估套件评估套件 = 测试用例 + 目标函数 + 评估函数。这篇讲怎么把它搭起来,包括同时测多个目标函数的做法。
- 用中间参数评估 block 输出LLM 函数往往包含多个步骤,只看最终结果可能看不出是哪一步出了问题。这篇讲怎么评测中间 block 的输出。
- 评估 Ontology 编辑测一个会写 Ontology 的函数,难道每次都要真改数据?不用 —— 每个测试用例在 Ontology 模拟环境里跑,
- 运行评估套件套件可以从多个地方运行:AIP Logic 的 Evals 侧边栏、AIP Evals 应用。可以整跑,也可以只跑单个用
- 运行实验:系统对比参数组合想知道哪个模型性价比最高、哪版提示词效果最好?用实验系统性地跑多个参数组合,而不是靠猜。
- 把运行结果写入数据集Evals 界面不是给所有人用的。把结果写进数据集,就能在 Workshop 等应用里跟其他信息一起展示,让领域专家也能
- 分析运行结果结果视图告诉你:函数在各测试用例与评估标准上的表现具体如何。可以在 Evals 应用里看,也能在 Logic / Cha
- 在指标仪表盘查看结果把多次运行的结果收拢到一处,用图表和统计呈现,还能比较聚合结果或单个测试用例的表现。