循序渐进 · AIP 教学 · AIP Evals(一)

AIP Evals 总览:给 AI 函数做测试

LLM 的输出是不确定的(non-deterministic),传统单元测试不够用。AIP Evals 是专门为此设计的测试环境:建测试用例、定评估标准、跟历史版本比。

全部目录 AIP 首页 ← 上一篇 AIP Evals 总览:给 AI 函数做测试 下一篇 →
本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip-evals/overview/
原始标题:AIP Evals • Overview • Palantir · 所属:AIP Evals(给 AI 做测试)

先记住这几条

① 解决"不确定"这个根本问题
同一个输入,LLM 每次输出可能不同。
② 五个核心概念
评估套件、目标函数、评估函数、测试用例、指标。
③ 目的是建立信心
有评测才敢把 LLM 函数推上生产。
④ 也能在 AI FDE 里用
通过对话式命令创建和运行评测。
0

写在前面

AIP Evals 是一个测试环境,用于评估 AIP Logic 函数(AIP Logic functions)AIP Chatbot 函数(AIP Chatbot functions)代码编写的函数(code-authored functions)的表现。它专门用于帮助你应对 LLM 的非确定性特征。借助 AIP Evals,你可以创建测试用例(test case)、定义评估函数(evaluation function)来衡量表现,并将结果与函数的早期版本进行对比。它使你能够建立必要的信心,从而将 LLM 驱动的函数投入生产环境,或对既有实现进行修改。

你可以使用 AIP Evals 来:

  • 创建测试用例并定义评估标准。
  • 调试、迭代并改进函数与提示词。
  • 对比不同模型在你的函数上的表现。
  • 考察多次运行之间的差异。

AIP Evals 也可作为 AI FDE 中的集成工具使用,让你能够通过对话式指令创建并运行评估套件(evaluation suite)。

Evals 概览
Evals 概览
1

核心概念

要点:五个术语一次讲清:评估套件、目标函数、评估函数、测试用例、指标。

评估套件(Evaluation suite): 用于对函数表现进行基准测试的测试用例、目标函数(target function)与评估函数的集合。

目标函数(Target function): 被评估的函数。一个套件可以配置为同时测试多个目标函数

评估函数(Evaluation function): 将目标函数的实际输出与期望输出进行比较或评估时所使用的方法。

测试用例(Test cases): 定义好的输入与期望输出集合,在评估套件运行时被传入评估函数。

指标(Metrics): 评估函数的结果。指标按每个测试用例生成,可以在多次运行之间进行聚合对比或单独对比。

要开始使用,请为逻辑函数创建评估套件,或为通用函数创建评估套件,并进一步了解评估运行配置

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

本组其他页面 · AIP Evals(给 AI 做测试)

同一主题下的相邻内容。