跳转至

节点与集群运维

日常检查

  • 管理界面检查集群与节点健康状态。
  • 检查节点 CPU、内存、磁盘容量、网络错误和存储副本健康度。
  • 检查告警、事件与最近失败的虚拟机任务。
  • 在节点维护前确认可迁移资源、剩余容量和高可用副本数。

节点维护原则

  1. 先确认集群仍有足够资源承载迁移后的虚拟机与存储副本。
  2. 将节点置于维护状态,按平台工作流迁移/停止受影响虚拟机。
  3. 执行硬件、网络或系统维护。
  4. 节点恢复后确认网络、存储副本、VM 调度和告警均正常。

不要直接在节点上随意修改 Kubernetes、KubeVirt 或存储组件的底层配置。节点自定义应优先使用平台提供的管理和 CloudInit 机制。