Мониторинг инфраструктуры без DevOps: 5 сигналов для МСБ
Клиент пишет в чат: «Кабинет не открывается». Админ в отпуске. Хостинг зелёный: «сервер пингуется». Через час выясняется — упал не «железо», а вход в ЛК, а диск на сервере 1С был на 98% ещё вчера. Для офиса 30–150 человек без штатного DevOps это типичная картина: мониторинг есть «на бумаге», а сигнал приходит от людей, а не от системы.
Ниже — рамка для CEO и IT-админа МСБ: мониторинг инфраструктуры без DevOps как пять сигналов, которые реально будят до звонка клиента. Без Grafana «ради красоты» и без обещания «как в банке».
Главное. Начните с пяти сигналов: точка денег/учёта недоступна, диск кончается, бэкап молчит, тормоза и ошибки растут, сроки SSL/лицензий горят. Три алерта в Telegram важнее сотни графиков без владельца.

Пять сигналов важнее «красивого» дашборда без реакции
Почему «сервер пингуется» — не мониторинг
Ping и «главная открывается» не видят:
- кабинет или веб-доступ к 1С отдают 500, пока витрина зелёная;
- диск заполнен — завтра утром база не примет документы;
- ночной бэкап падает две недели, а «галочка» в панели врёт;
- SSL истекает в выходные — браузер пугает клиентов красным замком.
Смежная рамка для сайта в production (скорость, ошибки, запас мощности) — в статье мониторинг production: 4 метрики. Здесь фокус другой: инфраструктура МСБ без выделенного SRE — серверы учёта, доступ, бэкапы и сроки.
Сигнал 1. Точка денег или учёта недоступна
Ответ сразу: проверяйте снаружи не «сервер жив», а URL, на котором бизнес теряет деньги или останавливает работу — кабинет клиента, оплата, веб-1С, форма заявки.
Раз в 1–5 минут внешний check (UptimeRobot, Better Stack, хостинг-монитор или простой скрипт) бьёт в Telegram, если код ответа не 200 или таймаут. Укажите два–три URL, не двадцать. Имя в алерте — человеческое: «ЛК клиентов», не IP.
Если узнаёте о падении из чата с клиентом — этого сигнала ещё нет, даже если «аптайм 99,9%» в панели хостинга.
Сигнал 2. Диск заканчивается
Ответ сразу: полный диск валит 1С, почту и сайт тише и чаще, чем «сломался процессор». Порог — не 99%, а 80–85% занятости с запасом на сутки роста логов и бэкапов.
Алерт «диск >85%» на серверах учёта, БД сайта и файлового шара. Без DevOps это часто один агент хостинга или Zabbix/Netdata «из коробки» + Telegram. Цена вопроса — час работы админа; цена молчания — день простоя базы.
Сигнал 3. Бэкап молчит или падает
Ответ сразу: нужен алерт не «задача запланирована», а «успешного бэкапа не было N часов» или job завершился с ошибкой. Иначе «всё бэкапится» живёт до первой аварии.
Связка с схемой 3-2-1 и учебным restore — в статье бэкапы и DR для МСБ. Мониторинг здесь — сторож: если копия не появилась, кто-то узнаёт сегодня, а не в день шифровальщика.
Сигнал 4. Тормоза и ошибки на бизнес-пути
Ответ сразу: смотрите долю 5xx и время ответа на тех же URL, что в сигнале 1. Среднее «всё быстро» врёт — важны худшие случаи и скачок ошибок.
Порог для старта МСБ: ответ дольше 2–3 секунд у заметной доли запросов или всплеск 5xx — алерт «важно, в течение часа». Это мост к стресс-тесту и подготовке к рекламному пику: мониторинг ловит деградацию, тест — запас до акции.
Сигнал 5. Сроки: SSL, домен, лицензии
Ответ сразу: календарные «бомбы» без DevOps взрываются в выходные. Нужны напоминания за 30 / 14 / 7 дней до истечения SSL, домена, лицензии 1С или критичного SaaS.
Это не «метрика сервера», но часть мониторинга инфраструктуры: без сигнала директор узнаёт от клиента с скриншотом «ваше соединение не защищено». Заведите одну таблицу сроков + бот/календарь с эскалацией на двух людей.
Куда слать алерты и кого будить
- Срочно — точка денег/учёта недоступна, массовые 5xx → Telegram + звонок дежурному
- Сегодня — диск >85%, бэкап упал, SSL <14 дней → чат IT, эскалация директору к вечеру
- На утро — тренд «диск растёт», единичные ошибки, SSL <30 дней → без звонка в 3:00
Два владельца на критичные алерты (основной + заместитель). Один человек в отпуске без заместителя = мониторинг выключен. Про SLA и «сколько девяток вам реально нужно» — в SLA 99.9% vs 99.99%.
Сколько стоит молчание
Ориентир для МСБ: час недоступности сайта или 1С часто 50–200+ тыс. ₽ упущенной выручки и зарплат; полный день — уже другой порядок. Базовый контур из пяти сигналов обычно укладывается в десятки тысяч ₽ запуска и копейки на внешние checks — дешевле одного «тихого» инцидента. Подробный расчёт — в стоимости часа простоя.
Чеклист: мониторинг инфраструктуры без DevOps
- Записаны 2–3 URL «точек денег/учёта» и внешняя проверка каждые 1–5 минут.
- Алерт по диску на 1С/БД/файлы при занятости >80–85%.
- Алерт «нет успешного бэкапа» за согласованное окно + дата последнего restore-теста.
- Порог по 5xx и времени ответа на тех же URL, не только ping.
- Календарь SSL / домен / лицензии с напоминаниями 30/14/7 дней.
- Два человека получают критичные алерты; приоритеты «срочно / сегодня / на утро» разделены.
- Раз в квартал учебный сбой: выключили check намеренно — пришло ли уведомление за 5 минут.
Когда пора звать DevOps, а не «ещё один бесплатный монитор»
Пять сигналов закрывают «не узнавать из чата». Дальше — если рекламные пики, несколько площадок, SLA в договоре с клиентами или онколл 24/7. Тогда нужны единый дашборд, error budget и нормальный контур DevOps, а не десятый бот в Telegram.
Если сейчас краснеет чеклист выше — начните с алертов на точку денег, диск и бэкап на этой неделе. Остальное нарастите за месяц. Нужна помощь с постановкой контура — оцените задачу или напишите в Telegram @MozziDev.
Сервисы и материалы по теме
Вопросы руководителя про мониторинг без DevOps
Нет. Для офиса 30–150 человек достаточно внешней проверки ключевых URL, контроля диска на сервере 1С/сайта, алерта «бэкап не прошёл», порога по времени ответа и напоминаний о сроках SSL/лицензий. Grafana и Prometheus — следующий уровень, когда уже есть стабильные алерты и понятный владелец.
Хостинг может показывать аптайм по главной, пока кабинет клиентов, веб-доступ к 1С или оплата уже отдают ошибку. Мониторинг инфраструктуры смотрит на пути денег и учёта плюс диск, бэкапы и сроки — не только на ICMP ping сервера.
1) недоступна точка денег или учёта; 2) заканчивается диск; 3) бэкап молчит или падает; 4) резко выросли ошибки/время ответа; 5) истекает SSL, домен или лицензия. Эти пять покрывают большинство «узнали из чата с клиентом».
В общий Telegram/MAX-чат IT + директора на критичные события и отдельный «на утро» для трендов. Срочно — недоступность и массовые ошибки; диск и бэкап — в рабочее время с эскалацией, если не закрыли за день. Без разделения приоритетов команда выгорает и начинает игнорировать сигналы.
Час простоя сайта или 1С часто 50–200+ тыс. ₽ выручки и зарплат; день без учёта — уже сотни тысяч–миллионы плюс сорванные сделки. Базовый контур алертов обычно дешевле одного такого инцидента. Считайте по той же логике, что в статье про стоимость часа простоя.
Хотите применить это на практике?
Расскажите про вашу систему — предложим план работ и метрики, которые имеет смысл зафиксировать в SLA/SLO.
Статьи по теме
Код от AI-агентов: чеклист до продакшена
AI-агенты пишут код: чеклист контроля до продакшена для CTO — риски утечек, лицензий и тихих багов, ворота ревью и ориентир потерь в ₽ при инциденте.
Читать статьюМониторинг сайта в production: 4 метрики, которые увидит даже не-IT
Мониторинг production простыми словами: скорость сайта, ошибки, нагрузка и запас мощности сервера. Что проверить до рекламы и как не узнавать о сбое из чата с клиентами. DevOps, Grafana, Prometheus.
Читать статьюDevOps и CI/CD в production: что настроить в первую очередь
DevOps услуги для бизнеса: пайплайн сборки, staging, деплой без простоя, мониторинг и rollback — приоритеты на первые 4–6 недель.
Читать статьюKubernetes в production: чеклист для CTO перед запуском кластера
Kubernetes настройка для production: RBAC, ресурсы, Ingress, GitOps, мониторинг и типичные ошибки — чеклист перед выходом в бой.
Читать статью