电话咨询 微信答疑 领取资料 认证报考

Kubernetes集群管理怎么入门(5步搭建与3个高频排坑)

K8s集群管理现在基本成了云原生运维的标配。CNCF 2025年度报告显示,全球96%的企业在用或评估Kubernetes,国内一线大厂更是全员上K8s。摩尔狮教育在培训中发现,很多同学卡在"会部署应用但不会管集群"这一步。今天我们把K8s集群从零搭建到日常运维的完整路径拆开讲。

先说环境准备。一个能跑的生产级K8s集群,至少要1个master节点加2个worker节点。master节点建议4核8G起步,worker节点根据业务负载来,一般8核16G能扛住中型应用。操作系统选CentOS 7.9或Ubuntu 22.04都行,关键是关闭swap分区,K8s默认不支持swap。之前在Docker容器化部署里讲过容器运行时的安装,这里不再重复,装好containerd就行。

第二步,集群初始化。用kubeadm是最主流的方式,一行命令搞定:kubeadm init --pod-network-cidr=10.244.0.0/16。这个CIDR网段要根据你的网络环境调整,别跟宿主机网段冲突。初始化完成后会输出一个join命令,记下来等会加worker节点要用。很多新手在这一步踩坑,忘了配置--pod-network-cidr,后面装网络插件时Pod之间死活不通。

第三步,部署网络插件。Calico和Flannel用得最多。Calico功能更强,支持网络策略,适合生产环境;Flannel简单轻量,学习够用。kubectl apply -f一个YAML文件就能装。装完之后kubectl get nodes,看到所有节点都是Ready状态,说明集群网络通了。更多云原生体系化学习内容,可以参考云原生培训的课程体系。

第四步,加入工作节点。在每台worker机器上执行刚才保存的join命令,等个一两分钟,kubectl get nodes就能看到新节点加进来了。注意worker节点的容器运行时版本要和master一致,版本不一致会导致加入失败。

第五步,配置监控和日志。生产环境没监控等于裸奔。用Prometheus + Grafana做指标监控,用Loki或EFK做日志收集。kubectl apply部署kube-prometheus-stack,5分钟就能搭好一套基础监控。再配个云监控体系做告警闭环,集群运维就算基本到位了。

接着说3个高频排坑。第一个坑:Pod CIDR冲突。多个集群混合部署时,网段没规划好导致跨集群通信异常。建议每个集群用独立CIDR段,提前规划好IP地址池。

第二个坑:节点资源不足。集群跑了一段时间后Pod频繁被驱逐,一看是节点内存满了。解决办法是给节点预留资源,kubelet的--system-reserved和--kube-reserved参数要配好,别让业务Pod把节点资源吃光。这个问题在服务网格运维场景里也经常遇到。

第三个坑:证书过期。K8s集群证书默认有效期1年,很多团队上线之后忘了续期,一年后集群突然挂了。用kubeadm certs check-expiration定期检查,提前30天续期就行。也可以写个定时脚本自动检测告警。

K8s集群管理说到底就是搭好、管好、排好坑这三件事。掌握了这套流程,从单机Docker到多节点K8s集群的跨越就算完成了。后续可以往GitOps运维和Service Mesh方向进阶,把自动化和治理能力再往上提一层。

更多阿里云认证资讯,请关注公众号:摩尔狮云证通