12.2. 关于 NVIDIA DPF Operator
NVIDIA DOCA Platform Framework (DPF) Operator 通过将 OVN-Kubernetes 数据平面操作卸载到 NVIDIA BlueField-3 Data Processing Units (DPU)在 OpenShift Container Platform 上启用硬件加速网络。
DPF 部署会创建一个双集群拓扑,它由在 x86 服务器上运行的管理集群以及在 BlueField-3 DPU 上运行的托管 DPU 集群组成。
12.2.1. DPF 架构概述 复制链接链接已复制到粘贴板!
OpenShift Container Platform 4.22 上的 NVIDIA DOCA Platform Framework (DPF) v26.4.1 部署将 OVN-Kubernetes 数据平面操作卸载到 NVIDIA BlueField-3 DPU。
在 Host Trusted 部署中,DPF 使用 BlueField DPU 作为主机加速器,主机是可信域的一部分。管理员可以使用标准 OpenShift Container Platform API 和自定义资源定义(CRD)编排工作负载和 DPU 加速基础架构。
通过将关键 OpenShift Container Platform 网络功能(如 OVN-Kubernetes)卸载到 DPU,架构会释放租户应用程序的主机 CPU 资源。DPF 还提供自动生命周期管理,以便管理员可以直接从 OpenShift Container Platform 置备、配置和更新 DPU。
在当前发行版本中,支持的 DPU 服务是带有 OVN-Kubernetes 和 DOCA Telemetry Service (DTS)的基于主机的网络(HBN)。
NVIDIA DPF Operator 与 Red Hat DPU Operator 不同。Red Hat DPU Operator 管理支持的非NVIDIA DPU 设备。NVIDIA BlueField-3 部署使用 DPF Operator 和相关组件。
12.2.1.1. 拓扑 复制链接链接已复制到粘贴板!
DPF 部署创建一个专门的网络基础架构,它由两个不同的集群平面组成,它们协同工作以提供硬件加速网络:
- OpenShift Container Platform 管理集群
管理集群在服务器的主 x86 CPU 内核上运行。它托管实际的业务逻辑,如 AI 工作负载或企业应用程序。
管理集群充当主管理界面和主机集群,用于置备和管理 DPU 和用户工作负载。在 Host Trusted 部署中,此集群中的 worker 节点是托管 BlueField DPU 的物理服务器。
管理集群负责以下功能:
- 在 x86 主机处理器上运行用户工作负载。
-
使用 Kubernetes CRD 提供用于定义基础架构所需状态的单一接口,如
DPUSet、DPUDeployment和DPUService。 - 推动 DPU 发现、闪存 BlueField Bootstream (BFB)镜像并配置主机到DPU 网络。
- 协调服务和网络流到 DPU 集群的部署。
- OpenShift Container Platform DPU 托管集群
DPU 托管集群是一个专用的二级 Kubernetes control plane,用于管理 NVIDIA BlueField DPUs 的数量。DPUs 作为此托管集群的 worker 节点,与它们物理附加的裸机主机分开。
DPU 托管的集群运行以下组件:
- 在 DPU 模式下运行的 OVN-Kubernetes 来卸载流。
- DOCA 服务,如用于 BGP 路由的主机网络(HBN)、用于监控的 DOCA Telemetry Service (DTS)和 Firefly 进行时间同步。
- 系统组件,包括 NVIDIA IPAM、Multus 和 SR-IOV 设备插件来管理 DPU 硬件资源。
12.2.1.2. 拓扑示例 复制链接链接已复制到粘贴板!
下图说明了参考实验室环境的物理连接。它充当一个基线示例,用于演示核心组件及其交互。
12.2.1.3. 架构特征 复制链接链接已复制到粘贴板!
- 主机管理的 DPU 生命周期
- 在 Host Trusted 部署中,DPU 从主机管理。此模型可让云操作员直接从标准 OpenShift Container Platform control plane 管理 BlueField-bound 服务。DPF 自动化了 DPU 的发现和置备:DPF Operator 会检测 worker 节点,创建 DPU 对象,并部署 DOCA Management Service (DMS)来安装 BFB 固件并在主机和 DPU 之间配置网络。这种方法通过使用标准 Kubernetes API 和工作流减少手动低级设备配置。
- 基础架构服务卸载
- 在 Host Trusted 模式中,网络、存储和安全性等基础架构服务从主机 CPU 卸载到 DPU。这会释放应用程序的主机 CPU 资源。框架通过 BlueField DPU 上的专用端口路由数据中心流量。
- Kubernetes 原生编配
- DPF 将 Kubernetes control plane 扩展到 DPU,使管理员通过使用熟悉的 Kubernetes 构造来直接在 BlueField DPU 上部署和编排 NVIDIA DOCA 服务和第三方应用程序。架构支持对服务进行自动滚动更新、扩展和回滚,而不会中断持续操作。