多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

K8s集群分布式存储快照恢复实战演练实操

K8s集群分布式存储快照恢复实战演练实操 K8s集群分布式存储快照恢复实战演练实操技术栈Kubernetes v1.32.13 Rocky Linux 8.6 存储快照与克隆 Containerd 1.7.x操作环境 / 对接原理 / 详细步骤 / 完整命令 / 配置文件 / 验证流程 / 排错方案K8s集群分布式存储快照恢复实战演练实操操作环境K8s 集群 3 节点k8s-master(192.168.1.10), k8s-node1(192.168.1.11), k8s-node2(192.168.1.12)K8s 版本 v1.32.13存储类型存储快照与克隆已配置对应 StorageClass 支持动态供给PV/PVC 资源已就绪容器运行时Containerd 1.7.x操作系统 Rocky Linux 8.6内核版本已适配存储需求集群内存在多命名空间/多租户业务存储资源需要统一规范化管理包含 PV/PVC/StorageClass/ResourceQuota 等资源已配置监控告警体系Prometheus Grafana存储指标可采集具备备份恢复能力对接原理K8s集群分布式存储快照恢复实战演练实操是 K8s 集群存储系统运维中的核心操作场景。K8s 存储体系通过 PVPersistentVolume和 PVCPersistentVolumeClaim实现存储资源的抽象与解耦StorageClass 提供动态存储供给能力CSIContainer Storage Interface统一存储驱动接口。存储快照与克隆作为具体的存储后端为集群中的有状态应用提供持久化存储能力。运维操作的核心目标是确保存储资源的可用性、性能、安全性和可管理性通过规范化的 PV/PVC 管理确保持久化数据不丢失通过 StorageClass 和动态供给提升资源分配效率通过配额和多租户隔离实现资源管控通过监控告警和备份容灾保障业务连续性通过自动化脚本和 SOP 提升运维效率。所有操作需遵循业务无感知原则对正在使用的存储资源采用灰度和滚动方式避免影响业务运行。详细步骤1. 存储资源现状盘点与分类# 1. 盘点所有 PV 资源 kubectl get pv -o wide kubectl get pv -o custom-columnsNAME:.metadata.name,STATUS:.status.phase,CAPACITY:.spec.capacity.storage,ACCESSMODES:.spec.accessModes[*],RECLAIMPOLICY:.spec.persistentVolumeReclaimPolicy,STORAGECLASS:.spec.storageClassName,AGE:.metadata.creationTimestamp ​ # 2. 盘点所有 PVC 资源 kubectl get pvc --all-namespaces -o wide kubectl get pvc --all-namespaces -o custom-columnsNAMESPACE:.metadata.namespace,NAME:.metadata.name,STATUS:.status.phase,VOLUME:.spec.volumeName,CAPACITY:.status.capacity.storage,STORAGECLASS:.spec.storageClassName,ACCESSMODES:.spec.accessModes[*],AGE:.metadata.creationTimestamp ​ # 3. 盘点 StorageClass kubectl get storageclass -o wide kubectl describe storageclass ​ # 4. 按命名空间/租户分类统计 for ns in $(kubectl get ns -o jsonpath{.items[*].metadata.name}); do count$(kubectl get pvc -n $ns --no-headers 2/dev/null | wc -l) if [ $count -gt 0 ]; then echo 命名空间 $ns: $count 个PVC kubectl get pvc -n $ns -o wide fi done ​ # 5. 识别异常状态资源 echo Pending 状态 PVC kubectl get pvc --all-namespaces --field-selectorstatus.phasePending -o wide echo Released 状态 PV kubectl get pv --field-selectorstatus.phaseReleased -o wide echo Failed 状态 PV kubectl get pv --field-selectorstatus.phaseFailed -o wide ​ # 6. 导出盘点结果 kubectl get pv -o yaml /tmp/pv_inventory_$(date %Y%m%d).yaml kubectl get pvc --all-namespaces -o yaml /tmp/pvc_inventory_$(date %Y%m%d).yaml echo 盘点结果已导出到 /tmp/ ​2. 制定操作方案与备份防护# 1. 备份当前所有存储资源配置操作前必做 kubectl get pv -o yaml /tmp/pv_backup_$(date %Y%m%d_%H%M%S).yaml kubectl get pvc --all-namespaces -o yaml /tmp/pvc_backup_$(date %Y%m%d_%H%M%S).yaml kubectl get storageclass -o yaml /tmp/sc_backup_$(date %Y%m%d_%H%M%S).yaml kubectl get resourcequota --all-namespaces -o yaml /tmp/quota_backup_$(date %Y%m%d_%H%M%S).yaml ​ # 2. 备份存储后端数据根据存储类型执行 # NFS 备份示例 # ssh rootnfs-server tar czf /data/nfs_backup_$(date %Y%m%d).tar.gz /data/nfs/shared/ # Ceph 备份示例 # ceph osd pool get volumes size # rbd snap create volumes/pvc-xxxsnapshot_$(date %Y%m%d) ​ # 3. 制定操作方案 cat /tmp/storage_operation_plan.md EOF # 存储操作方案 ## 一、操作目标 ## 二、影响范围评估 ## 三、操作步骤与时间窗口 ## 四、回滚方案 ## 五、验证标准 ## 六、风险点与应对措施 EOF echo 操作方案模板已创建 ​ # 4. 确认业务窗口低峰期操作 echo 当前时间: $(date) echo 建议在业务低峰期执行存储操作避免影响业务 ​ # 5. 通知相关业务方 # echo 存储运维操作通知 | mail -s 存储运维通知 adminexample.com ​3. 执行存储资源规范化操作# 1. 批量补全 PV/PVC 标签示例 cat /tmp/batch_label_storage.sh SCRIPT #!/bin/bash # 为所有 PV 补全标签 for pv in $(kubectl get pv -o jsonpath{.items[*].metadata.name}); do sc$(kubectl get pv $pv -o jsonpath{.spec.storageClassName}) kubectl label pv $pv storage-type$sc managed-bystorage-team envprod --overwrite 2/dev/null done # 为所有 PVC 补全标签 for ns in $(kubectl get ns -o jsonpath{.items[*].metadata.name}); do for pvc in $(kubectl get pvc -n $ns -o jsonpath{.items[*].metadata.name} 2/dev/null); do kubectl label pvc $pvc -n $ns namespace$ns managed-bystorage-team envprod --overwrite 2/dev/null done done echo 标签批量补全完成 SCRIPT chmod x /tmp/batch_label_storage.sh # /tmp/batch_label_storage.sh ​ # 2. 规范化 StorageClass 参数示例 # kubectl patch storageclass sc-name -p {allowVolumeExpansion: true} ​ # 3. 设置 ResourceQuota示例 # cat /tmp/quota.yaml EOF # apiVersion: v1 # kind: ResourceQuota # metadata: # name: storage-quota # namespace: namespace # spec: # hard: # requests.storage: 500Gi # persistentvolumeclaims: 20 # EOF # kubectl apply -f /tmp/quota.yaml ​ # 4. 清理闲置资源先确认无业务引用 # 识别无 Pod 挂载的 PVC # for ns in $(kubectl get ns -o jsonpath{.items[*].metadata.name}); do # for pvc in $(kubectl get pvc -n $ns -o jsonpath{.items[*].metadata.name} 2/dev/null); do # used$(kubectl get pod -n $ns -o json 2/dev/null | grep -c persistentVolumeClaim.*$pvc) # if [ $used -eq 0 ]; then # echo 闲置PVC: $ns/$pvc # fi # done # done # 确认后删除: kubectl delete pvc name -n namespace ​ # 5. 执行具体操作根据标题调整 echo 执行存储资源规范化具体操作... echo 请根据操作方案执行具体步骤 ​4. 存储性能调优与参数优化# 1. 检查当前存储性能指标 kubectl top nodes # 检查磁盘 IO需节点权限 # kubectl debug node/node-name -it --imagebusybox -- iostat -x 1 5 ​ # 2. 存储挂载参数调优NFS 示例 # mount -o hard,nfsvers4.1,rsize1048576,wsize1048576,timeo600,retrans3 nfs-server:/share /mnt/nfs ​ # 3. 内核 IO 调度器调优 # 查看当前调度器 # cat /sys/block/sda/queue/scheduler # 设置为 deadline适合 SSD或 cfq适合 HDD # echo deadline /sys/block/sda/queue/scheduler ​ # 4. 文件系统挂载参数优化 # ext4: noatime,nodiratime,barrier0 # xfs: noatime,nodiratime,allocsize64m # mount -o remount,noatime,nodiratime /dev/sdb1 /data ​ # 5. StorageClass 参数调优 # kubectl patch storageclass sc-name -p {parameters: {volumeBindingMode: WaitForFirstConsumer}} ​ # 6. 验证调优效果 # dd if/dev/zero of/mnt/storage/testfile bs1G count1 oflagdirect # dd if/mnt/storage/testfile of/dev/null bs1G iflagdirect # 清理测试文件 # rm -f /mnt/storage/testfile ​5. 存储监控告警与巡检# 1. 检查存储相关监控指标 # PV/PVC 状态 kubectl get pv --no-headers | awk {print $1, $2} | sort | uniq -c kubectl get pvc --all-namespaces --no-headers | awk {print $2, $3} | sort | uniq -c ​ # 2. 存储容量监控需节点权限或监控系统 # df -h | grep -E /data|/mnt|nfs|ceph # 检查 PVC 实际使用量需进入 Pod # kubectl exec -it pod-name -- df -h | grep -E /data|/mnt ​ # 3. 配置存储告警规则Prometheus 示例 cat /tmp/storage_alerts.yaml EOF groups: - name: storage-alerts rules: - alert: PVCPending expr: kube_persistentvolumeclaim_status_phase{phasePending} 0 for: 5m labels: severity: warning annotations: summary: PVC 处于 Pending 状态 - alert: StorageCapacityHigh expr: (1 - kubelet_volume_stats_available_bytes / kubelet_volume_stats_capacity_bytes) * 100 85 for: 5m labels: severity: critical annotations: summary: 存储卷使用率超过 85% EOF echo 告警规则模板已创建 ​ # 4. 定时巡检脚本 cat /tmp/storage_audit.sh SCRIPT #!/bin/bash echo 存储巡检 $(date) echo --- PV 状态统计 --- kubectl get pv --no-headers | awk {print $2} | sort | uniq -c echo --- PVC 状态统计 --- kubectl get pvc --all-namespaces --no-headers | awk {print $3} | sort | uniq -c echo --- StorageClass 列表 --- kubectl get storageclass --no-headers echo --- 异常 PVC --- kubectl get pvc --all-namespaces --field-selectorstatus.phasePending -o wide 2/dev/null echo --- 异常 PV --- kubectl get pv --field-selectorstatus.phaseReleased -o wide 2/dev/null kubectl get pv --field-selectorstatus.phaseFailed -o wide 2/dev/null echo 巡检完成 SCRIPT chmod x /tmp/storage_audit.sh /tmp/storage_audit.sh ​ # 5. 设置定时巡检CronJob 或 crontab # crontab -e # 0 2 * * * /tmp/storage_audit.sh /var/log/storage_audit.log 21 ​6. 验证操作结果与业务无感知# 1. 验证 PV/PVC 状态 kubectl get pv -o wide | head -20 kubectl get pvc --all-namespaces -o wide | head -20 # 预期无 Pending/Failed/Released 异常状态或已确认保留 ​ # 2. 验证 StorageClass 配置 kubectl get storageclass -o wide kubectl describe storageclass sc-name | grep -E Parameters|Reclaim|Expansion|Mount # 预期参数已规范化allowVolumeExpansion 符合预期 ​ # 3. 验证 ResourceQuota kubectl get resourcequota --all-namespaces -o wide # 预期各命名空间配额已设置使用量正常 ​ # 4. 验证标签补全 kubectl get pv -L storage-type,managed-by,env --no-headers | head -10 kubectl get pvc --all-namespaces -L namespace,managed-by,env --no-headers | head -10 # 预期标签已补全 ​ # 5. 业务无感知验证抽查正在使用的 PVC echo 正在使用的 PVC抽查 kubectl get pvc --all-namespaces -o wide | grep Bound | head -5 echo 关联 Pod 状态抽查 kubectl get pod --all-namespaces -o wide | grep Running | head -10 # 预期业务 Pod 均正常 Running无因存储操作导致的异常 ​ # 6. 存储读写验证进入业务 Pod 测试 # kubectl exec -it pod-name -- touch /data/test_write_$(date %Y%m%d).txt # kubectl exec -it pod-name -- ls -la /data/test_write_*.txt # kubectl exec -it pod-name -- rm -f /data/test_write_*.txt # 预期读写正常无权限或挂载问题 ​ # 7. 生成操作报告 echo 存储操作报告 /tmp/storage_operation_report.txt echo 操作时间: $(date) /tmp/storage_operation_report.txt echo 操作前 PV 数量: $(cat /tmp/pv_backup_*.yaml 2/dev/null | grep -c kind: PersistentVolume) /tmp/storage_operation_report.txt echo 操作后 PV 数量: $(kubectl get pv --no-headers | wc -l) /tmp/storage_operation_report.txt echo 操作前 PVC 数量: $(cat /tmp/pvc_backup_*.yaml 2/dev/null | grep -c kind: PersistentVolumeClaim) /tmp/storage_operation_report.txt echo 操作后 PVC 数量: $(kubectl get pvc --all-namespaces --no-headers | wc -l) /tmp/storage_operation_report.txt echo 异常状态 PV: $(kubectl get pv --field-selectorstatus.phaseReleased --no-headers 2/dev/null | wc -l) Released, $(kubectl get pv --field-selectorstatus.phaseFailed --no-headers 2/dev/null | wc -l) Failed /tmp/storage_operation_report.txt echo 异常状态 PVC: $(kubectl get pvc --all-namespaces --field-selectorstatus.phasePending --no-headers 2/dev/null | wc -l) Pending /tmp/storage_operation_report.txt cat /tmp/storage_operation_report.txt ​验证流程# 1. PV 状态验证 kubectl get pv -o wide # 预期所有 PV 状态正常Bound/Available无 Failed ​ # 2. PVC 状态验证 kubectl get pvc --all-namespaces -o wide # 预期所有 PVC 状态为 Bound无 Pending/Lost ​ # 3. StorageClass 验证 kubectl get storageclass -o wide # 预期StorageClass 存在参数符合规范 ​ # 4. 业务 Pod 验证 kubectl get pod --all-namespaces -o wide | grep -v Running | head -10 # 预期无因存储问题导致的异常 Pod ​ # 5. 存储读写验证 # kubectl exec -it pod -- touch /data/test.txt echo 读写正常 # 预期读写操作成功 ​ # 6. 监控指标验证 # 检查 Prometheus 存储指标是否正常采集 # 预期存储容量、IOPS、延迟等指标可查询 ​ # 7. 操作报告验证 cat /tmp/storage_operation_report.txt # 预期报告包含操作前后对比无异常状态排错方案快照创建失败检查 VolumeSnapshotClass、CSI 驱动快照支持、存储后端快照功能、PV 状态、RBAC 权限快照数据损坏检查快照创建时应用一致性、存储后端快照完整性、快照恢复验证、定期校验快照占用空间过大检查快照保留策略、过期快照清理、快照增量机制、存储容量规划克隆卷创建失败检查快照状态、存储后端克隆支持、克隆卷参数、容量、StorageClass克隆卷数据隔离问题检查克隆卷读写权限、数据独立性、与源卷关联、删除影响快照恢复数据不一致检查恢复流程、应用停机、快照时间点、数据校验、恢复后验证快照过期未自动清理检查 VolumeSnapshot 保留策略、定时清理任务、CSI 驱动支持、手动清理快照批量管理困难检查快照命名规范、标签管理、批量脚本、台账记录、自动化工具
返回列表