没有专职 DevOps 的中小企业基础设施监控:5 个关键信号
客户在聊天里说:「柜打不开」。管理员在休假。主机商面板是绿的:「服务器能 ping」。一小时后才发现——不是「硬件坏了」,而是登录柜失败,核算服务器磁盘昨天已到 98%。对 30–150 人、没有专职 DevOps 的办公室,这很典型:纸面上有监控,第一个信号却来自人,而不是系统。
下面给中小企业 CEO 和 IT 管理员一个框架:把 没有 DevOps 的基础设施监控 收敛成五个会在客户来电前叫醒你的信号。不要「为好看」的 Grafana,也不承诺「银行级」。
要点。 先做五个信号:营收/核算路径不可用、磁盘将满、备份沉默、延迟与错误上升、SSL/许可证到期。三条 Telegram 告警,胜过一百张无人负责的图表。

五个信号胜过没人响应的漂亮仪表盘
为什么「服务器能 ping」不是监控
Ping 和「首页能开」看不见:
- 柜或核算 Web 返回 500,前台仍是绿的;
- 磁盘满了——明天早上库不收单据;
- 夜间备份连续两周失败,面板勾选还在撒谎;
- SSL 在周末过期——浏览器用红锁吓唬客户。
面向网站生产指标(延迟、错误、容量余量)见 生产监控:4 项指标。本文焦点不同:没有专职 SRE 的中小企业基础设施——核算服务器、访问、备份与到期。
信号 1. 营收或核算路径不可用
先答:从外部检查的不是「服务器活着」,而是业务丢钱或停工的 URL——客户柜、支付、核算 Web、线索表单。
每 1–5 分钟一次外部探测(UptimeRobot、Better Stack、主机监控或简单脚本),非 200 或超时就打进 Telegram。选 两到三个 URL,不要二十个。告警用真人名:「客户柜」,不要 IP。
若仍从客户聊天才知道宕机——这个信号还不存在,即使主机商写着「可用性 99.9%」。
信号 2. 磁盘将满
先答:磁盘写满拖垮核算、邮件和网站,比「CPU 坏了」更安静、更常见。阈值不是 99%,而是占用 80–85%,并留出一天日志与备份的增长空间。
对核算、网站库、文件共享服务器设「磁盘 >85%」告警。没有 DevOps 时,常常是主机自带探针或开箱 Zabbix/Netdata + Telegram。成本是管理员一小时;沉默的成本是库停一天。
信号 3. 备份沉默或失败
先答:要告警的是 「N 小时内没有成功备份」 或任务失败——不是「任务已计划」。否则「我们都备份了」会活到第一次真事故。
3-2-1 与恢复演练见 中小企业备份与容灾。监控在这里是守夜人:副本没出来,今天就有人知道,而不是勒索软件那天。
信号 4. 业务路径变慢与报错
先答:盯与信号 1 相同 URL 上的 5xx 占比与响应时间。「平均很快」会骗人——要看最差情况和错误飙升。
中小企业起步阈值:明显比例的请求超过 2–3 秒,或 5xx 飙升——「一小时内重要」告警。再衔接到投放高峰前的 压测:监控抓劣化,压测证明余量。
信号 5. 到期:SSL、域名、许可证
先答:没有 DevOps 时,日历炸弹常在周末炸开。在 SSL、域名、核算许可证或关键 SaaS 到期前 30 / 14 / 7 天提醒。
这不是「服务器指标」,但是基础设施监控的一部分:没有它,老板会从客户截图「连接不安全」才知道。维护一张到期表 + 机器人/日历,并升级到两个人。
告警发到哪里、叫醒谁
- 紧急 — 营收/核算路径不可用、大量 5xx → Telegram + 打电话给值班
- 今天 — 磁盘 >85%、备份失败、SSL <14 天 → IT 群,傍晚前升级给负责人
- 明早 — 「磁盘在涨」、偶发错误、SSL <30 天 → 凌晨三点不打电话
关键告警要有两个负责人(主 + 备)。一个人休假且无替补 = 监控等于关掉。关于你到底需要多少个「9」,见 SLA 99.9% vs 99.99%。
沉默的成本
中小企业量级:网站或核算停一小时,常见 5–20+ 万卢布 的营收与人力损失;停一整天是另一个数量级。五信号基础栈启动通常几万卢布、外部探测几乎零成本——比一次「安静事故」便宜。完整算法见 宕机一小时值多少钱。
清单:没有 DevOps 的基础设施监控
- 写下 2–3 个营收/核算 URL,每 1–5 分钟外部探测。
- 磁盘告警:核算/库/文件占用 >80–85%。
- 「无成功备份」在约定窗口内告警 + 最近一次恢复演练日期。
- 同一批 URL 的 5xx 与延迟阈值,不只 ping。
- SSL / 域名 / 许可证日历,30/14/7 天提醒。
- 两个人收关键告警;紧急 / 今天 / 明早分开。
- 每季度演练:故意关掉探测——5 分钟内告警到了吗?
何时该请 DevOps,而不是「再加一个免费监控」
五个信号解决「别从聊天才知道」。下一阶段:投放高峰、多站点、对客户合同 SLA,或 7×24 值班。那时需要统一仪表盘、error budget 和真正的 DevOps 体系——不是第十个 Telegram 机器人。
若上面清单已经发红:本周先上营收路径、磁盘与备份告警,其余一个月内补齐。需要协助搭建——评估任务或联系 @MozziDev。
管理者关于「无 DevOps 监控」的常见问题
可以。对 30–150 人的办公室,先做关键 URL 的外部探测、核算/网站服务器磁盘告警、「备份未成功」、 响应时间阈值,以及 SSL/许可证到期提醒即可。Grafana、Prometheus 是下一阶段——等告警真的 有人响应、有明确负责人之后。
主机商面板上首页可用性可以是绿的,同时客户柜、核算 Web 入口或支付已经在报错。 基础设施监控盯的是营收与业务路径,外加磁盘、备份和到期日——不只是 ICMP ping。
1)营收或核算路径不可用;2)磁盘将满;3)备份沉默或失败;4)错误/延迟飙升; 5)SSL、域名或许可证即将到期。这五个覆盖了大多数「从客户聊天才知道」的事故。
关键事件进 IT + 负责人的共享 Telegram;趋势进「明早再看」通道。紧急 = 不可用与大量错误; 磁盘与备份 = 工作时间处理,当天未关闭再升级。没有优先级分层,团队会疲劳并开始忽略信号。
网站或核算停机一小时,常见损失是数万到数十万卢布的营收与人力;停一整天可达数十万到数百万, 外加丢单。一套基础告警通常比一次「安静事故」更便宜。算法与「宕机一小时值多少钱」一文相同。
相关文章
AI Agent 写的代码:上生产前的清单
AI Agent 写代码:面向 CTO 的上生产管控清单——泄露、许可证与静默 bug 风险、 评审门禁,以及事故损失量级(人民币)。
阅读文章生产环境监控:普通人也能看懂的 4 个指标
用大白话讲 production 监控:网站速度、错误、流量、服务器余量。投广告前要查什么, 别等客户投诉才知道宕机。DevOps、Grafana、Prometheus。
阅读文章生产环境 DevOps 与 CI/CD:应优先配置什么
面向业务的 DevOps 服务:构建流水线、Staging、零停机部署、 监控与回滚 — 前 4–6 周的优先级。
阅读文章生产环境 Kubernetes:集群上线前 CTO 检查清单
生产级 Kubernetes 配置:RBAC、资源配额、Ingress、GitOps、监控 与常见错误 — 上线前的检查清单。
阅读文章