Ksd Blog

Thinking will not overcome fear but action will.

Rancher v2.15 新监控模式实践:使用 kube-prometheus-stack 与 Monitoring Dashboards 监控 RKE2 集群

以 RKE2 为例,构建 kube-prometheus-stack 与 Rancher Monitoring Dashboards 的监控方案

前言 参考:https://ranchermanager.docs.rancher.com/v2.15/integrations-in-rancher/monitoring-and-alerting/ 从 Rancher v2.15 开始,监控相关组件的安装方式发生了明显变化。此前,Rancher 通过一个完整的 rancher-monitoring chart 统一部署 Pro...

RKE2 与 K3s 集群证书续期与轮换实战指南

介绍证书到期监控、自动续期、手动轮换以及 Rancher 管理集群的证书操作方法

在 RKE2 和 K3s 集群中,证书是 Kubernetes 控制平面与节点之间建立信任关系的基础。证书一旦过期,节点之间的身份认证就会失效,进而导致 kubelet、Kubernetes API Server、控制平面组件之间的通信异常,最终表现为集群不稳定甚至服务中断。 因此,证书的监控、续期与轮换是 Kubernetes 集群日常运维工作中不可忽视的一部分。本文整理了 RKE2 与...

如何确认 Rancher 配置的 RKE2 集群升级已成功完成

通过 Rancher UI、Rancher Manager 日志、节点状态与系统组件检查,验证 RKE2 集群升级是否已顺利结束

在 Rancher 管理下创建的 RKE2 集群升级过程中,用户最关心的往往不是“升级命令是否已发出”,而是“升级是否真的已经完成”。 本文重点介绍如何验证 Rancher 管理的 RKE2 集群升级是否已成功结束,并给出一组可直接执行的检查方法。 前言 通常情况下,只要下游集群升级已经完全结束,Rancher UI 中该集群的状态会自动恢复为 Active。不过如果你想进一步确认升级...

打通 guest 集群与 Longhorn 存储——Harvester CSI 驱动配置笔记

在 SUSE Virtualization(Harvester) 里跑 guest Kubernetes 集群,可以说是鱼和熊掌兼得——既有裸金属的性能,又有虚拟机的灵活性。这是一种很常见的玩法:把 Rancher 和下游节点都当作 guest 虚拟机部署好之后,接下来要面对的问题就是——怎么让这些 guest 集群用上宿主机的存储(SUSE Storage(Longhorn))。 如果你...

在 Harvester 上调优 Windows 虚拟机性能

SUSE Virtualization(Harvester) 是一款云原生的超融合基础设施(HCI)平台解决方案,专为在数据中心、多云以及边缘环境中运行虚拟机和容器工作负载而优化。 这篇文章重点聊聊在 SUSE Virtualization 上给 Windows 虚拟机做性能调优这件事——毕竟 Windows 客户机要想发挥出全部实力,往往得再多花点心思。我们会逐一过一遍对性能影响最大的几...

避坑帖!麒麟 V10 离线安装 RKE2:为什么我建议你最高只装到 v1.34?

随着国产化替代的深入,在 ARM 架构的麒麟操作系统上部署高可用 Kubernetes 集群已成为核心需求。然而,受限于内核版本与 Cgroup 机制的实现差异,RKE2 在麒麟 V10 上的版本选择存在“分水岭”。本文将详细介绍如何在离线环境下,规避高版本 Cgroup V2 兼容性陷阱,成功搭建稳定的 RKE2(v1.34.x)高可用集群。 说明 环境说明 本例使用 4 个 rke...

Longhorn Ingress 实践:基于 Traefik 实现 Basic Auth

这篇文章介绍了如何基于 Traefik 为 Longhorn 配置 Ingress、启用 Basic Auth,并支持大文件 backing image 上传。

如果你通过 kubectl 或 Helm 在 Kubernetes 集群中安装了 SUSE Storage(Longhorn),那么你需要创建一个 Ingress,才能让外部流量访问 SUSE Storage 的 UI。 当通过 kubectl 或 Helm 安装 SUSE Storage 时,默认并不会启用认证机制。本文将介绍如何使用 Traefik 暴露 SUSE Storage UI...

Rancher 升级检查清单:企业 Kubernetes 平台升级最佳实践

面向生产环境的 Rancher 与 Kubernetes 升级规划、检查与回滚实践

在企业 Kubernetes 平台的日常运维中,升级是一个绕不开的话题。无论是为了获取新功能、提升稳定性,还是修复安全问题,Rancher 与 Kubernetes 的版本升级都需要被认真规划与执行。 但在实际操作中,很多问题往往并不是出现在“怎么升级”,而是出在“什么时候升级、先升什么、是否符合版本兼容性”。一旦顺序或策略不当,轻则业务波动,重则可能导致集群不可用甚至数据丢失。 本文整...

如何优雅的关闭 RKE2 节点

操作步骤 在 RKE2 中,为了在维护场景下实现节点的优雅关机,可以按照以下步骤对节点进行 cordon 和 drain 操作: 1. 将节点标记为不可调度 kubectl cordon <node name> 2. 驱逐节点上的 Pod 将节点上的所有 Pod 驱逐,包括受 Pod Disruption Budget(PDB)限制的 Pod: kubectl dr...

如何优雅地关闭 RKE2 或 K3s 集群

操作步骤 如果你需要关闭运行 RKE2 或 K3s Kubernetes 集群的基础设施(例如数据中心维护),本指南提供了按正确顺序执行的步骤,以确保集群安全关闭。 1. 创建集群快照 与任何集群维护操作一样,强烈建议在执行该流程之前创建集群快照。 对于独立集群,可以在 RKE2 和 K3s 官方文档中找到快照相关说明。 对于由 Rancher 创建的集群,可以在 Ranc...