在阿里云环境下使用 gpu 机器
目录 1. 概述 2. 使用及使用约束 2.1 安装 ai 套件 2.2 创建节点池 2.3 业务 pod 声明 gpu 资源 3. gpu 调度 3.1 显存与算力调度 3.2 NUMA 拓扑调度 4. 监控 4.1 阿里云监控方案 ...
目录 1. 概述 2. 使用及使用约束 2.1 安装 ai 套件 2.2 创建节点池 2.3 业务 pod 声明 gpu 资源 3. gpu 调度 3.1 显存与算力调度 3.2 NUMA 拓扑调度 4. 监控 4.1 阿里云监控方案 ...
目录 概述 1. pytorch 程序代码 2. Dockerfile 配置 3. 机器配置 3.1 安装 gpu/cuda 驱动 3.2 nvidia-container-toolkit 3.3 部署 gpu device-plugin 4. 通过 job 运行程序 总结 备注 ...
目录 概述 cpu 限制 memory 限制 io 限制 概述 从 K8s 1.25 开始 cgroupv2 特性变成 stable 状态,很多生产环境也都开始在使用 cgroupv2 了。本文初步研究下 cgroupv2 中的一些概念模型,并通过一些例子来学习下 cgroupv2 的一些特性。 cpu 限制 与 cgroupv1 类似,cgroupv2 支持绑定 c...
目录 harbor 概述 helm 命令行使用 传统 helm chart 仓库格式 oci 格式 打包上传 chart 在 pulumi 中安装 chart 传统 helm chart 格式 oci 格式的镜像仓库 使用 helm sdk 安装 chart har...
目录 helm chart 概述 自动打包 chart 到 github repo 发布 chart 到 K8s 集群 helm chart 概述 在云原生领域,helm chart 是事实上的应用交付标准,一般来说,我们构建 helm chart 之后,有两种方式可以发布 chart: 1)可以通过 helm chart tgz 压缩包进行传输和发布;2)将 chart ...
目录 kruise 部署安装 cloneset lifecycle 概述 lifecycle 实践 preNormal inPlaceUpdate preDelete kruise 部署安装 根据 kruise 文档 通过 helm 安装。 # Firstly add openkruise charts repo...
目录 hpa 支持 prometheus 指标 keda 支持 prometheus 指标 scaleObject 配置 trigger 中的 metricType AverageValue Value Utilization ...
目录 gateway api 概述 快速入门 部署 metallb 安装 crd 以及 istio 部署测试服务 配置入口 gateway 添加业务路由到 gateway 基于权重的路由 总结 gateway api 概述 gateway api 是 K8s 发起的下一代 in...
目录 keda 概述 安装 keda 快速入手(以mysql为例) keda 的一些特性 缩容到 0 定时扩缩容 事件驱动,事件源丰富 一些参考 openkruise 基于HPA的极致弹性调度最佳实践 蚂蚁金服 Kapacity ...
目录 概述 参数配置 horizontal-pod-autoscaler-sync-period horizontal-pod-autoscaler-initial-readiness-delay 计算 desiredReplica stabilizationWindowSeconds 配置 容忍度 tolerance ...