Observability(可观测性)总览
平台内建工具用于监控资源健康、排查开发/生产问题、跨服务追踪执行、分析遥测。这一篇讲监控、调试与日志导出三块。
https://www.palantir.com/docs/foundry/observability/overview/
原始标题:Observability > Overview
先记住这几条
写在前面
Palantir 平台提供内置工具,用于监控资源健康、调试开发与生产中的问题、跨服务追踪执行,以及大规模分析遥测(telemetry)数据。

监控: 你可以使用 Data Health 工具监控平台。借助 Data Health,你可以为失败、延迟等指标设置规则和阈值;可以按资源或跨项目大规模配置监控器;可以通过 PagerDuty、Slack、webhook 或 Foundry 通知接收告警;并可以查看过去 30 天的执行次数与 P95 延迟指标。
调试: Workflow Lineage 工具让你可以探索和调查平台历史与日志。你可以查看 7 天的执行历史,按状态、用户、时长或版本筛选,并精确定位需要关注的具体执行。Workflow Lineage 还允许你跨日志搜索,从某个源执行器的所有执行中查找特定的日志消息、错误或模式。
追踪: 要可视化跨越函数、动作与 LLM 调用的完整请求旅程,你可以使用追踪视图。追踪视图让你可以深入任意操作,查看其时长、输入、输出与错误。
分析: 要对日志数据做进一步分析,你可以将 Foundry 的日志、指标与追踪导出到一个流式数据集,以驱动你自己的仪表盘、流水线或自定义可观测性工作流。
监控
监控
监控工具帮助你随时间追踪资源的健康与稳定性,主动发现问题,并在问题发生时收到告警。
Data Health 是监控平台资源健康的主要应用。Data Health 提供两套功能:
- 监控视图: 你可以使用基于范围的监控规则,跨项目、文件夹、应用或单个资源大规模监控 Foundry 资源。
- 健康检查: 可以在单个资源上配置详细的健康检查,包括对数据集、调度与表的内容和 schema 校验。
监控视图与健康检查在发现问题时会生成告警。告警可以通过 Foundry 通知,或通过 PagerDuty、Slack 等外部系统 送达。
Metrics
Foundry 提供跨多种资源类型的指标,帮助你随时间监控健康与性能。
- 函数、动作与 AIP Logic: 通过 Ontology Manager 或 Workflow Lineage,查看过去 30 天近乎实时的成功/失败次数与 P95 执行时长。你也可以借助 Workshop 中的 Observability Chart 组件,将这些指标直接嵌入运营应用,在流程其余部分旁边监控资源健康。
- 流与计算模块: 在 Metrics(指标) 标签页访问指标,以监控长时运行计算任务的健康与稳定性。

调试
调试
调试工具通过提供对执行细节、日志与追踪的可见性,帮助你在开发与生产环境中调查问题。
Ontology and AIP observability
Workflow Lineage 中的 Ontology 与 AIP 可观测性 特性,让你对 AIP 与 Ontology 工作流的执行获得全面的洞察。使用这些特性来了解你的智能体、函数、语言模型、自动化、动作与 Ontology 的性能。
这些特性可用于获取指标、执行历史、分布式追踪、日志与日志搜索的可见性。
Logs
你可以查看用于运行你代码的第三方库(如流所使用的 Kafka)产生的日志,以及你的代码所输出的日志。日志在多种任务类型上可用:
你还可以跨日志搜索,从某个源执行器的所有执行中查找特定的日志消息、错误或模式。源执行器是调用链中的第一个可执行资源,例如函数、动作、自动化、AIP Logic、AIP 智能体或模型实时部署。
日志导出
日志导出
日志导出在你的租户中可能不可用。如需了解更多信息,请联系 Palantir 支持。
为了支持平台内工具当前能力之外的任意处理,你可以创建一个位于指定文件夹中的流,其中包含某个组织的全部遥测数据。这包括日志、指标与追踪。该流中的数据可以使用 Foundry 的数据分析工具套件进行分析,或导出到第三方系统。

延伸阅读 · 相关页面
按主题横向跳转,不必顺着目录一篇篇读。
常见问题速答 · FAQ
关于「Observability(可观测性)总览」,读者最常问的几个问题。