动作类型详解
监控(Monitoring)
动作上线后会不会变慢、会不会悄悄失败?这一篇讲 Foundry 如何对动作做性能与可靠性监控,以及怎样在出问题时收到告警。
本文来源 · Source
内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/action-types/monitoring/
原始标题:Action monitoring
https://www.palantir.com/docs/foundry/action-types/monitoring/
原始标题:Action monitoring
1
为什么要监控动作
动作是修改本体的主要方式,它的性能与可靠性直接影响业务。
在 Foundry 中,动作(action)可以被监控,用来跟踪其性能与可靠性。当动作变慢或开始失败时,监控能帮你尽早发现、主动排查。
"Actions in Foundry can be monitored to track performance and reliability."Foundry 中的动作可以被监控,以跟踪其性能与可靠性。
监控不是孤立的功能:它和上一篇的一致性保证(consistency guarantee)、本模块后续的动作指标(action metrics)与动作日志(action log)共同构成"观察—度量—追责"的闭环。
2
两类监控规则(Monitoring rules)
Foundry 为动作监控内置了两种关键规则类型,点击展开看它们分别"盯"什么。
规则一动作时长 P95(Action duration p95)
当第 95 百分位执行时间超过阈值时告警。
用来发现"拖慢整体"的性能瓶颈:P95 表示把执行时间排序后,最慢的 5% 动作的平均水平。一旦它超过设定阈值,说明有相当一部分动作偏慢,需要优化工作流。
规则二窗口内失败次数(Number of action failures in window)
当一段窗口时间内的失败次数超过阈值时告警。
用来捕捉"突然开始失败"的可靠性问题:在一个时间窗口里,如果失败次数累计超过阈值,就触发告警,让你在故障扩大前介入。
提示:更细的配置项(阈值、严重级别等)参见官方 monitoring rules reference 文档;本篇只讲概念和流程。
3
四步配置动作监控
配置监控遵循 Foundry 监控视图(monitoring view)的标准流程。
- 创建监控视图按官方流程新建一个 monitoring view,作为承载规则的容器。
- 添加监控规则为某个动作(action)或动作类型(action type)添加一条监控规则(monitoring rule)。
- 配置阈值与严重级别设置合适的阈值(threshold)和严重级别(severity),决定何时、多严重才告警。
- 订阅告警通知按告警订阅指南配置 alert notification,把告警推给该收到的人。
点击揭晓:监控规则除了绑定单个动作,还能用什么"动态作用域"自动覆盖一批动作?
点击这里揭晓 →
4
动态作用域(Dynamic scopes)
与其逐个绑定动作,不如让监控"跟着资源走"。把作用域匹配到它的描述(点击右侧)。
5
告警与订阅:从"看见"到"被通知"
监控的价值在于出问题时有人知道。来模拟一次"窗口内失败"的告警判定。
互动实验:窗口内失败告警
窗口内失败数
0
点击"模拟一次失败"累加
阈值
5
超过则触发告警
尚未达到阈值。
一页带走
① 监控的目的
跟踪动作的性能与可靠性,尽早发现变慢与失败。
② 两类规则
动作时长 P95 与窗口内失败次数。
③ 四步配置
建视图 → 加规则 → 配阈值/严重级别 → 订阅告警。
④ 动态作用域
Workflow Lineage / Workshop / OSDK 自动覆盖其动作。
延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
常见问题速答 · FAQ
关于「监控(Monitoring)」,读者最常问的几个问题。
为什么要监控动作?
在 Foundry 中,动作(action)可以被监控,用来跟踪其性能与可靠性。当动作变慢或开始失败时,监控能帮你尽早发现、主动排查。
四步配置动作监控是什么?
点击揭晓:监控规则除了绑定单个动作,还能用什么"动态作用域"自动覆盖一批动作?