生产环境 Kubernetes:集群上线前 CTO 检查清单
Kubernetes 承诺「开箱即用的自动扩缩容」。实践中,缺乏规范的集群是昂贵的混乱:CrashLoop、OOMKill、明文密钥,以及周五晚上用 `kubectl apply -f` 部署。
要点。 上生产前:独立命名空间、每个 Deployment 的 limits、Ingress+TLS、GitOps、重启监控和 etcd 备份。一个集群包办一切、没有 Operator 的 Postgres in Pod,是典型的夜间事故路径。
生产环境最低检查清单
- RBAC 与命名空间 — 分离 prod/stage,CI 遵循最小权限。
- Requests/limits — 每个 Deployment 都要设;没有 limits,邻居会互相拖垮。
- Ingress + TLS — cert-manager、HSTS、边缘限流。
- GitOps — Argo CD / Flux,一键回滚。
- 监控 — Prometheus + Pod 重启、饱和度、错误率告警。
- etcd 与 PV 备份 — DR 方案写在纸上,而不是记在 DevOps 脑子里。
常见错误
- 一个集群包办一切 — prod 与实验共用一个命名空间。
- 有状态服务没有 Operator — PostgreSQL「跑在 Pod 里」却没有 Patroni/Crunchy。
- 没有与 prod 拓扑一致的 staging 环境。
我们在高负载与 IoT 项目中搭建并运维集群。服务:交钥匙 Kubernetes、DevOps 与 CI/CD。现有集群审计 — 起价 35 000 ₽,见价格。
生产环境 Kubernetes 常见问题
RBAC 与独立命名空间、每个 Deployment 的 requests/limits、Ingress+TLS、可回滚的 GitOps、 重启与错误率监控,以及写在纸上的 etcd/PV 备份与 DR 方案。
不要共用命名空间,最好也不要共用集群:邻居噪音、CI 权限和失败实验都会打到生产。 Staging 拓扑应与生产一致。
没有 limits,一个 Pod 会饿死邻居(OOMKill、限流)。Requests 给调度器信号;靠感觉估不准负载落点。
密钥、RBAC、limits 和 etcd 备份——这些会在第一个夜晚出问题。现有集群审计起价 35 000 ₽。
相关文章
没有专职 DevOps 的中小企业基础设施监控:5 个关键信号
中小企业无 DevOps 的基础设施监控:五个信号——营收路径可用性、磁盘、备份、变慢与到期。 Telegram 告警,不必先上 Grafana。
阅读文章AI Agent 写的代码:上生产前的清单
AI Agent 写代码:面向 CTO 的上生产管控清单——泄露、许可证与静默 bug 风险、 评审门禁,以及事故损失量级(人民币)。
阅读文章生产环境监控:普通人也能看懂的 4 个指标
用大白话讲 production 监控:网站速度、错误、流量、服务器余量。投广告前要查什么, 别等客户投诉才知道宕机。DevOps、Grafana、Prometheus。
阅读文章生产环境 DevOps 与 CI/CD:应优先配置什么
面向业务的 DevOps 服务:构建流水线、Staging、零停机部署、 监控与回滚 — 前 4–6 周的优先级。
阅读文章