1. Kubernetes集群部署全景指南
作为容器编排领域的事实标准,Kubernetes(简称K8s)的集群部署一直是运维工程师的必修课。我在金融、电商等多个行业落地K8s集群的过程中,发现90%的线上问题都源于部署阶段的基础配置不当。本文将分享从零构建生产级K8s集群的完整方法论,重点解析那些官方文档不会告诉你的实战细节。
2. 基础环境准备
2.1 硬件资源配置黄金法则
生产环境中的节点配置需要遵循"计算-存储-网络"三位一体原则:
- Master节点:建议至少4核CPU/8GB内存/100GB磁盘(etcd数据目录单独挂载SSD)
- Worker节点:根据工作负载动态扩展,但单节点不宜超过64核/256GB内存(防止单点故障影响面过大)
- 网络带宽:节点间通信需要至少10Gbps网络,跨AZ部署需配置专用隧道
踩坑记录:某次在公有云环境误用突发性能实例作为Master节点,在集群高负载时出现调度延迟,后更换为计算优化型实例解决。
2.2 操作系统调优清单
在Ubuntu 22.04上的必须配置(其他Linux发行版需相应调整):
# 关闭swap sudo swapoff -a sed -i '/swap/s/^/#/' /etc/fstab # 加载内核模块 cat <<EOF | sudo tee /etc/modules-load.d/k8s.conf br_netfilter ip_vs ip_vs_rr ip_vs_wrr ip_vs_sh nf_conntrack EOF # 内核参数调整 cat <<EOF | sudo tee /etc/sysctl.d/k8s.conf net.bridge.bridge-nf-call-ip6tables = 1 net.bridge.bridge-nf-call-iptables = 1 net.ipv4.ip_forward = 1 vm.swappiness = 0 EOF sudo sysctl --system3. 集群部署核心流程
3.1 容器运行时选型对比
| 运行时 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|
| Docker | 生态完善 | 已被K8s弃用 | 传统迁移项目 |
| Containerd | 轻量稳定 | 调试工具少 | 生产环境首选 |
| CRI-O | 纯CRI实现 | 社区支持较弱 | OpenShift环境 |
推荐使用containerd作为生产环境运行时:
# 安装containerd apt-get install -y containerd containerd config default > /etc/containerd/config.toml sed -i 's/SystemdCgroup = false/SystemdCgroup = true/' /etc/containerd/config.toml systemctl restart containerd3.2 使用kubeadm部署集群
初始化Master节点(关键参数详解):
kubeadm init \ --pod-network-cidr=10.244.0.0/16 \ --apiserver-advertise-address=192.168.1.100 \ --control-plane-endpoint=cluster.example.com:6443 \ --upload-certs \ --image-repository registry.aliyuncs.com/google_containersWorker节点加入命令:
kubeadm join cluster.example.com:6443 \ --token <token> \ --discovery-token-ca-cert-hash sha256:<hash> \ --node-labels="disk=ssd,zone=az1"关键技巧:通过
--node-labels预先打标便于后续调度,避免生产环境频繁变更标签触发Pod迁移。
4. 网络插件深度配置
4.1 Calico网络策略实战
生产环境推荐使用Calico的IPIP模式跨AZ通信:
apiVersion: crd.projectcalico.org/v1 kind: IPPool metadata: name: ippool-ipip spec: cidr: 10.244.0.0/16 ipipMode: Always natOutgoing: true nodeSelector: all()网络隔离策略示例(按命名空间隔离):
apiVersion: projectcalico.org/v3 kind: NetworkPolicy metadata: name: default-deny namespace: production spec: types: - Ingress - Egress podSelector: {}5. 存储方案选型指南
5.1 持久化卷方案对比
| 类型 | 性能 | 动态供给 | 适用场景 |
|---|---|---|---|
| Local PV | ★★★★★ | 否 | 高性能数据库 |
| Ceph RBD | ★★★★ | 是 | 通用块存储 |
| NFS | ★★ | 是 | 共享配置文件 |
| Longhorn | ★★★ | 是 | 轻量分布式存储 |
MySQL数据库推荐配置示例:
apiVersion: storage.k8s.io/v1 kind: StorageClass metadata: name: mysql-ssd provisioner: kubernetes.io/gce-pd parameters: type: pd-ssd fstype: ext4 replication-type: none6. 高可用架构设计
6.1 Master节点高可用方案
- 前置负载均衡器(推荐使用HAProxy+Keepalived)
- 至少3个Master节点部署在不同故障域
- etcd集群采用奇数节点部署,使用SSD磁盘
HAProxy关键配置片段:
frontend k8s-api bind *:6443 mode tcp default_backend k8s-masters backend k8s-masters balance roundrobin server master1 192.168.1.101:6443 check server master2 192.168.1.102:6443 check server master3 192.168.1.103:6443 check7. 监控与运维实战
7.1 核心监控指标清单
必须监控的黄金指标:
- API Server:请求延迟(99分位)、错误率
- etcd:写入延迟、wal_fsync持续时间
- 节点:CPU饱和度、内存OOM概率
- 工作负载:Pod重启次数、就绪状态变化
Prometheus抓取配置示例:
- job_name: 'kubelet' metrics_path: '/metrics' scheme: 'https' tls_config: insecure_skip_verify: true bearer_token_file: /var/run/secrets/kubernetes.io/serviceaccount/token kubernetes_sd_configs: - role: node8. 安全加固检查表
8.1 生产环境必须配置
RBAC:禁用默认ServiceAccount的自动挂载
apiVersion: v1 kind: ServiceAccount metadata: name: default automountServiceAccountToken: falsePod安全策略(PSP替代方案):
apiVersion: policy/v1beta1 kind: PodSecurityPolicy metadata: name: restricted spec: privileged: false allowPrivilegeEscalation: false requiredDropCapabilities: - ALL网络策略:默认拒绝所有进出流量
apiVersion: networking.k8s.io/v1 kind: NetworkPolicy metadata: name: default-deny spec: podSelector: {} policyTypes: - Ingress - Egress
9. 常见故障排查手册
9.1 典型问题处理流程
问题现象:Pod状态卡在ContainerCreating
排查步骤:
- 检查kubelet日志:
journalctl -u kubelet --since "5 minutes ago" | grep -i error - 验证CNI插件状态:
kubectl get pods -n kube-system -l k8s-app=calico-node - 检查容器运行时:
crictl ps -a | grep -v RUNNING
问题现象:API Server间歇性不可用
排查步骤:
- 检查etcd集群健康状态:
kubectl get --raw='/readyz?verbose' - 验证Master节点资源使用率:
kubectl top nodes - 检查网络延迟:
kubectl run -it --rm debug --image=nicolaka/netshoot -- ping <apiserver_ip>
10. 性能优化实战技巧
10.1 调度器调优参数
在kube-scheduler配置中增加这些参数可提升调度性能:
apiVersion: kubescheduler.config.k8s.io/v1beta2 kind: KubeSchedulerConfiguration profiles: - schedulerName: default-scheduler plugins: score: enabled: - name: NodeResourcesBalancedAllocation weight: 2 - name: ImageLocality weight: 1 pluginConfig: - name: NodeResourcesFit args: scoringStrategy: type: MostAllocated resources: - name: cpu weight: 1 - name: memory weight: 110.2 Kubelet内存管理
防止节点OOM的关键配置(/var/lib/kubelet/config.yaml):
evictionHard: memory.available: "500Mi" nodefs.available: "10%" kubeReserved: cpu: "500m" memory: "1Gi" systemReserved: cpu: "500m" memory: "1Gi" evictionPressureTransitionPeriod: 5m0s11. 版本升级最佳实践
11.1 滚动升级步骤
- 先升级kubectl客户端版本
- 逐个升级Master节点(确保etcd先升级):
kubeadm upgrade plan kubeadm upgrade apply v1.24.3 - 批量升级Worker节点(使用批量运维工具):
kubectl drain <node> --ignore-daemonsets apt-get upgrade kubeadm kubelet kubeadm upgrade node systemctl restart kubelet kubectl uncordon <node>
血泪教训:某次升级跳过etcd版本检查直接升级控制平面,导致集群元数据损坏,最终不得不从备份恢复。
12. 扩展功能集成
12.1 使用Kruise增强部署能力
安装OpenKruise扩展:
helm install kruise https://github.com/openkruise/kruise/releases/download/v1.3.0/kruise-chart.tgz高级部署示例(灰度发布):
apiVersion: apps.kruise.io/v1alpha1 kind: CloneSet metadata: name: frontend spec: replicas: 10 updateStrategy: type: InPlaceIfPossible partition: 4 template: spec: containers: - name: nginx image: nginx:1.20.213. 备份与灾难恢复
13.1 etcd快照管理
定期备份etcd数据(需在Master节点执行):
ETCDCTL_API=3 etcdctl \ --endpoints=https://127.0.0.1:2379 \ --cacert=/etc/kubernetes/pki/etcd/ca.crt \ --cert=/etc/kubernetes/pki/etcd/server.crt \ --key=/etc/kubernetes/pki/etcd/server.key \ snapshot save /backup/etcd-snapshot-$(date +%Y%m%d).db恢复集群状态:
kubeadm reset ETCDCTL_API=3 etcdctl snapshot restore /backup/etcd-snapshot.db \ --data-dir /var/lib/etcd-restore systemctl restart etcd kubeadm init --ignore-preflight-errors=DirAvailable--var-lib-etcd