动作类型详解

监控(Monitoring)

动作上线后会不会变慢、会不会悄悄失败?这一篇讲 Foundry 如何对动作做性能与可靠性监控,以及怎样在出问题时收到告警。

原文 Palantir Foundry · Action types 预计阅读 9 分钟 互动演示 + 6 道测验
本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/action-types/monitoring/
原始标题:Action monitoring
1

为什么要监控动作

动作是修改本体的主要方式,它的性能与可靠性直接影响业务。

在 Foundry 中,动作(action)可以被监控,用来跟踪其性能与可靠性。当动作变慢或开始失败时,监控能帮你尽早发现、主动排查。

"Actions in Foundry can be monitored to track performance and reliability."Foundry 中的动作可以被监控,以跟踪其性能与可靠性。

监控不是孤立的功能:它和上一篇的一致性保证(consistency guarantee)、本模块后续的动作指标(action metrics)动作日志(action log)共同构成"观察—度量—追责"的闭环。

2

两类监控规则(Monitoring rules)

Foundry 为动作监控内置了两种关键规则类型,点击展开看它们分别"盯"什么。

规则一动作时长 P95(Action duration p95)
当第 95 百分位执行时间超过阈值时告警。
用来发现"拖慢整体"的性能瓶颈:P95 表示把执行时间排序后,最慢的 5% 动作的平均水平。一旦它超过设定阈值,说明有相当一部分动作偏慢,需要优化工作流。
规则二窗口内失败次数(Number of action failures in window)
当一段窗口时间内的失败次数超过阈值时告警。
用来捕捉"突然开始失败"的可靠性问题:在一个时间窗口里,如果失败次数累计超过阈值,就触发告警,让你在故障扩大前介入。
提示:更细的配置项(阈值、严重级别等)参见官方 monitoring rules reference 文档;本篇只讲概念和流程。
3

四步配置动作监控

配置监控遵循 Foundry 监控视图(monitoring view)的标准流程。

  1. 创建监控视图按官方流程新建一个 monitoring view,作为承载规则的容器。
  2. 添加监控规则为某个动作(action)或动作类型(action type)添加一条监控规则(monitoring rule)。
  3. 配置阈值与严重级别设置合适的阈值(threshold)和严重级别(severity),决定何时、多严重才告警。
  4. 订阅告警通知按告警订阅指南配置 alert notification,把告警推给该收到的人。

点击揭晓:监控规则除了绑定单个动作,还能用什么"动态作用域"自动覆盖一批动作?

点击这里揭晓 →

4

动态作用域(Dynamic scopes)

与其逐个绑定动作,不如让监控"跟着资源走"。把作用域匹配到它的描述(点击右侧)。

5

告警与订阅:从"看见"到"被通知"

监控的价值在于出问题时有人知道。来模拟一次"窗口内失败"的告警判定。

互动实验:窗口内失败告警
窗口内失败数
0
点击"模拟一次失败"累加
阈值
5
超过则触发告警
尚未达到阈值。

一页带走

① 监控的目的
跟踪动作的性能与可靠性,尽早发现变慢与失败。
② 两类规则
动作时长 P95窗口内失败次数
③ 四步配置
建视图 → 加规则 → 配阈值/严重级别 → 订阅告警。
④ 动态作用域
Workflow Lineage / Workshop / OSDK 自动覆盖其动作。

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

常见问题速答 · FAQ

关于「监控(Monitoring)」,读者最常问的几个问题。

为什么要监控动作?
在 Foundry 中,动作(action)可以被监控,用来跟踪其性能与可靠性。当动作变慢或开始失败时,监控能帮你尽早发现、主动排查。
四步配置动作监控是什么?
点击揭晓:监控规则除了绑定单个动作,还能用什么"动态作用域"自动覆盖一批动作?