Ksd Blog

Thinking will not overcome fear but action will.

RKE2 与 K3s 集群证书续期与轮换实战指南

介绍证书到期监控、自动续期、手动轮换以及 Rancher 管理集群的证书操作方法

在 RKE2 和 K3s 集群中,证书是 Kubernetes 控制平面与节点之间建立信任关系的基础。证书一旦过期,节点之间的身份认证就会失效,进而导致 kubelet、Kubernetes API Server、控制平面组件之间的通信异常,最终表现为集群不稳定甚至服务中断。 因此,证书的监控、续期与轮换是 Kubernetes 集群日常运维工作中不可忽视的一部分。本文整理了 RKE2 与...

如何确认 Rancher 配置的 RKE2 集群升级已成功完成

通过 Rancher UI、Rancher Manager 日志、节点状态与系统组件检查,验证 RKE2 集群升级是否已顺利结束

在 Rancher 管理下创建的 RKE2 集群升级过程中,用户最关心的往往不是“升级命令是否已发出”,而是“升级是否真的已经完成”。 本文重点介绍如何验证 Rancher 管理的 RKE2 集群升级是否已成功结束,并给出一组可直接执行的检查方法。 前言 通常情况下,只要下游集群升级已经完全结束,Rancher UI 中该集群的状态会自动恢复为 Active。不过如果你想进一步确认升级...

打通 guest 集群与 Longhorn 存储——Harvester CSI 驱动配置笔记

在 SUSE Virtualization(Harvester) 里跑 guest Kubernetes 集群,可以说是鱼和熊掌兼得——既有裸金属的性能,又有虚拟机的灵活性。这是一种很常见的玩法:把 Rancher 和下游节点都当作 guest 虚拟机部署好之后,接下来要面对的问题就是——怎么让这些 guest 集群用上宿主机的存储(SUSE Storage(Longhorn))。 如果你...

在 Harvester 上调优 Windows 虚拟机性能

SUSE Virtualization(Harvester) 是一款云原生的超融合基础设施(HCI)平台解决方案,专为在数据中心、多云以及边缘环境中运行虚拟机和容器工作负载而优化。 这篇文章重点聊聊在 SUSE Virtualization 上给 Windows 虚拟机做性能调优这件事——毕竟 Windows 客户机要想发挥出全部实力,往往得再多花点心思。我们会逐一过一遍对性能影响最大的几...

避坑帖!麒麟 V10 离线安装 RKE2:为什么我建议你最高只装到 v1.34?

随着国产化替代的深入,在 ARM 架构的麒麟操作系统上部署高可用 Kubernetes 集群已成为核心需求。然而,受限于内核版本与 Cgroup 机制的实现差异,RKE2 在麒麟 V10 上的版本选择存在“分水岭”。本文将详细介绍如何在离线环境下,规避高版本 Cgroup V2 兼容性陷阱,成功搭建稳定的 RKE2(v1.34.x)高可用集群。 说明 环境说明 本例使用 4 个 rke...

Longhorn Ingress 实践:基于 Traefik 实现 Basic Auth

这篇文章介绍了如何基于 Traefik 为 Longhorn 配置 Ingress、启用 Basic Auth,并支持大文件 backing image 上传。

如果你通过 kubectl 或 Helm 在 Kubernetes 集群中安装了 SUSE Storage(Longhorn),那么你需要创建一个 Ingress,才能让外部流量访问 SUSE Storage 的 UI。 当通过 kubectl 或 Helm 安装 SUSE Storage 时,默认并不会启用认证机制。本文将介绍如何使用 Traefik 暴露 SUSE Storage UI...

Rancher 升级检查清单:企业 Kubernetes 平台升级最佳实践

面向生产环境的 Rancher 与 Kubernetes 升级规划、检查与回滚实践

在企业 Kubernetes 平台的日常运维中,升级是一个绕不开的话题。无论是为了获取新功能、提升稳定性,还是修复安全问题,Rancher 与 Kubernetes 的版本升级都需要被认真规划与执行。 但在实际操作中,很多问题往往并不是出现在“怎么升级”,而是出在“什么时候升级、先升什么、是否符合版本兼容性”。一旦顺序或策略不当,轻则业务波动,重则可能导致集群不可用甚至数据丢失。 本文整...

如何优雅的关闭 RKE2 节点

操作步骤 在 RKE2 中,为了在维护场景下实现节点的优雅关机,可以按照以下步骤对节点进行 cordon 和 drain 操作: 1. 将节点标记为不可调度 kubectl cordon <node name> 2. 驱逐节点上的 Pod 将节点上的所有 Pod 驱逐,包括受 Pod Disruption Budget(PDB)限制的 Pod: kubectl dr...

如何优雅地关闭 RKE2 或 K3s 集群

操作步骤 如果你需要关闭运行 RKE2 或 K3s Kubernetes 集群的基础设施(例如数据中心维护),本指南提供了按正确顺序执行的步骤,以确保集群安全关闭。 1. 创建集群快照 与任何集群维护操作一样,强烈建议在执行该流程之前创建集群快照。 对于独立集群,可以在 RKE2 和 K3s 官方文档中找到快照相关说明。 对于由 Rancher 创建的集群,可以在 Ranc...

Rancher RKE2 集群从 Ingress NGINX 迁移至 Traefik 实践指南

面向 Rancher RKE2 集群的 Ingress Controller 迁移实践,从 NGINX 平滑切换至 Traefik 的官方路径说明

Rancher RKE2 集群从 Ingress NGINX 迁移至 Traefik 实践指南 背景 Ingress NGINX 将在 2026 年 3 月之后停止维护,对于暂时不打算迁移 Ingress Controller 的组织,SUSE 将帮助你稳定现有环境。RKE2 v1.35 将为 SUSE Rancher Prime LTS 客户提供支持直至 2027 年 11 月。这意味...