节点与集群运维¶
日常检查¶
- 管理界面检查集群与节点健康状态。
- 检查节点 CPU、内存、磁盘容量、网络错误和存储副本健康度。
- 检查告警、事件与最近失败的虚拟机任务。
- 在节点维护前确认可迁移资源、剩余容量和高可用副本数。
节点维护原则¶
- 先确认集群仍有足够资源承载迁移后的虚拟机与存储副本。
- 将节点置于维护状态,按平台工作流迁移/停止受影响虚拟机。
- 执行硬件、网络或系统维护。
- 节点恢复后确认网络、存储副本、VM 调度和告警均正常。
不要直接在节点上随意修改 Kubernetes、KubeVirt 或存储组件的底层配置。节点自定义应优先使用平台提供的管理和 CloudInit 机制。