循序渐进 · AIP 教学 · 自带模型(四)

自托管模型

在自己的基础设施上跑开源或私有模型,数据完全不出环境。这篇说明自托管的做法与代价。

本文来源 · Source 内容整理自 Palantir Foundry 官方文档:
https://www.palantir.com/docs/foundry/aip/self-host-models/
原始标题:Bring your own model • Self-host models with AIP • Palantir · 所属:接入自己的模型(Bring your own model)

先记住这几条

① 自托管的动机是控制
数据不出境、模型可定制。
② 实现方式沿用 module
通过 compute module 提供后端。
③ 要自己承担运维
容量、可用性、升级都是你的责任。
0

写在前面

你可以通过用 compute module 为注册模型提供后端来自托管模型。自托管让你可以在自己的基础设施上运行开源或自定义的大型语言模型,并将它们作为 AIP 中的一等公民模型使用。当你需要以下条件时,这非常有用:

  • Data sovereignty(数据主权): 将所有推理流量保留在你自己的网络边界内。
  • On-premise or air-gapped deployments(本地部署或气隙部署): 在完全没有外部连接的情况下运行模型。
  • Cost control(成本控制): 使用你自己的 GPU,而不必按 token 向托管供应商付费。
  • Early access to new models(抢先体验新模型): 在托管供应商提供之前就部署新发布的开源模型。
1

前置条件

要点:自托管需要的基础设施与准备。

在开始之前,请查阅由 compute module 提供后端的模型的通用先决条件注册步骤

2

如何用 AIP 自托管模型

要点:实现路径与注意事项。
  1. 构建一个运行推理服务器(例如 vLLM 或 Ollama)的容器镜像,该服务器提供你的模型权重,并暴露受支持的供应商 API 格式
  2. 在你的 Dockerfile 中设置 application.port 标签,并将镜像发布到 Artifacts。关于容器的通用指引,请查阅 compute modules 容器文档
  3. 使用已发布的镜像创建一个 compute module。将最小副本数设置为至少一个。
  4. 在 Control Panel 中注册模型并配置能力。
  5. 在任意受支持的 AIP 应用中选择该模型。

延伸阅读 · 相关页面

按主题横向跳转,不必顺着目录一篇篇读。

本组其他页面 · 接入自己的模型(Bring your own model)

同一主题下的相邻内容。