NineLabNineLab.ru
КейсыЦены
Контакты
27 августа 2026Евгений · Senior Systems Engineer

Мониторинг инфраструктуры без DevOps: 5 сигналов для МСБ


Клиент пишет в чат: «Кабинет не открывается». Админ в отпуске. Хостинг зелёный: «сервер пингуется». Через час выясняется — упал не «железо», а вход в ЛК, а диск на сервере 1С был на 98% ещё вчера. Для офиса 30–150 человек без штатного DevOps это типичная картина: мониторинг есть «на бумаге», а сигнал приходит от людей, а не от системы.

Ниже — рамка для CEO и IT-админа МСБ: мониторинг инфраструктуры без DevOps как пять сигналов, которые реально будят до звонка клиента. Без Grafana «ради красоты» и без обещания «как в банке».

Главное. Начните с пяти сигналов: точка денег/учёта недоступна, диск кончается, бэкап молчит, тормоза и ошибки растут, сроки SSL/лицензий горят. Три алерта в Telegram важнее сотни графиков без владельца.

Мониторинг инфраструктуры без DevOps: пять сигналов для МСБ на дашборде алертов

Пять сигналов важнее «красивого» дашборда без реакции

Почему «сервер пингуется» — не мониторинг

Ping и «главная открывается» не видят:

  • кабинет или веб-доступ к 1С отдают 500, пока витрина зелёная;
  • диск заполнен — завтра утром база не примет документы;
  • ночной бэкап падает две недели, а «галочка» в панели врёт;
  • SSL истекает в выходные — браузер пугает клиентов красным замком.

Смежная рамка для сайта в production (скорость, ошибки, запас мощности) — в статье мониторинг production: 4 метрики. Здесь фокус другой: инфраструктура МСБ без выделенного SRE — серверы учёта, доступ, бэкапы и сроки.

Сигнал 1. Точка денег или учёта недоступна

Ответ сразу: проверяйте снаружи не «сервер жив», а URL, на котором бизнес теряет деньги или останавливает работу — кабинет клиента, оплата, веб-1С, форма заявки.

Раз в 1–5 минут внешний check (UptimeRobot, Better Stack, хостинг-монитор или простой скрипт) бьёт в Telegram, если код ответа не 200 или таймаут. Укажите два–три URL, не двадцать. Имя в алерте — человеческое: «ЛК клиентов», не IP.

Если узнаёте о падении из чата с клиентом — этого сигнала ещё нет, даже если «аптайм 99,9%» в панели хостинга.

Сигнал 2. Диск заканчивается

Ответ сразу: полный диск валит 1С, почту и сайт тише и чаще, чем «сломался процессор». Порог — не 99%, а 80–85% занятости с запасом на сутки роста логов и бэкапов.

Алерт «диск >85%» на серверах учёта, БД сайта и файлового шара. Без DevOps это часто один агент хостинга или Zabbix/Netdata «из коробки» + Telegram. Цена вопроса — час работы админа; цена молчания — день простоя базы.

Сигнал 3. Бэкап молчит или падает

Ответ сразу: нужен алерт не «задача запланирована», а «успешного бэкапа не было N часов» или job завершился с ошибкой. Иначе «всё бэкапится» живёт до первой аварии.

Связка с схемой 3-2-1 и учебным restore — в статье бэкапы и DR для МСБ. Мониторинг здесь — сторож: если копия не появилась, кто-то узнаёт сегодня, а не в день шифровальщика.

Сигнал 4. Тормоза и ошибки на бизнес-пути

Ответ сразу: смотрите долю 5xx и время ответа на тех же URL, что в сигнале 1. Среднее «всё быстро» врёт — важны худшие случаи и скачок ошибок.

Порог для старта МСБ: ответ дольше 2–3 секунд у заметной доли запросов или всплеск 5xx — алерт «важно, в течение часа». Это мост к стресс-тесту и подготовке к рекламному пику: мониторинг ловит деградацию, тест — запас до акции.

Сигнал 5. Сроки: SSL, домен, лицензии

Ответ сразу: календарные «бомбы» без DevOps взрываются в выходные. Нужны напоминания за 30 / 14 / 7 дней до истечения SSL, домена, лицензии 1С или критичного SaaS.

Это не «метрика сервера», но часть мониторинга инфраструктуры: без сигнала директор узнаёт от клиента с скриншотом «ваше соединение не защищено». Заведите одну таблицу сроков + бот/календарь с эскалацией на двух людей.

Куда слать алерты и кого будить

  • Срочно — точка денег/учёта недоступна, массовые 5xx → Telegram + звонок дежурному
  • Сегодня — диск >85%, бэкап упал, SSL <14 дней → чат IT, эскалация директору к вечеру
  • На утро — тренд «диск растёт», единичные ошибки, SSL <30 дней → без звонка в 3:00

Два владельца на критичные алерты (основной + заместитель). Один человек в отпуске без заместителя = мониторинг выключен. Про SLA и «сколько девяток вам реально нужно» — в SLA 99.9% vs 99.99%.

Сколько стоит молчание

Ориентир для МСБ: час недоступности сайта или 1С часто 50–200+ тыс. ₽ упущенной выручки и зарплат; полный день — уже другой порядок. Базовый контур из пяти сигналов обычно укладывается в десятки тысяч ₽ запуска и копейки на внешние checks — дешевле одного «тихого» инцидента. Подробный расчёт — в стоимости часа простоя.

Чеклист: мониторинг инфраструктуры без DevOps

  1. Записаны 2–3 URL «точек денег/учёта» и внешняя проверка каждые 1–5 минут.
  2. Алерт по диску на 1С/БД/файлы при занятости >80–85%.
  3. Алерт «нет успешного бэкапа» за согласованное окно + дата последнего restore-теста.
  4. Порог по 5xx и времени ответа на тех же URL, не только ping.
  5. Календарь SSL / домен / лицензии с напоминаниями 30/14/7 дней.
  6. Два человека получают критичные алерты; приоритеты «срочно / сегодня / на утро» разделены.
  7. Раз в квартал учебный сбой: выключили check намеренно — пришло ли уведомление за 5 минут.

Когда пора звать DevOps, а не «ещё один бесплатный монитор»

Пять сигналов закрывают «не узнавать из чата». Дальше — если рекламные пики, несколько площадок, SLA в договоре с клиентами или онколл 24/7. Тогда нужны единый дашборд, error budget и нормальный контур DevOps, а не десятый бот в Telegram.

Если сейчас краснеет чеклист выше — начните с алертов на точку денег, диск и бэкап на этой неделе. Остальное нарастите за месяц. Нужна помощь с постановкой контура — оцените задачу или напишите в Telegram @MozziDev.

Сервисы и материалы по теме

Вопросы руководителя про мониторинг без DevOps

Нет. Для офиса 30–150 человек достаточно внешней проверки ключевых URL, контроля диска на сервере 1С/сайта, алерта «бэкап не прошёл», порога по времени ответа и напоминаний о сроках SSL/лицензий. Grafana и Prometheus — следующий уровень, когда уже есть стабильные алерты и понятный владелец.

Хостинг может показывать аптайм по главной, пока кабинет клиентов, веб-доступ к 1С или оплата уже отдают ошибку. Мониторинг инфраструктуры смотрит на пути денег и учёта плюс диск, бэкапы и сроки — не только на ICMP ping сервера.

1) недоступна точка денег или учёта; 2) заканчивается диск; 3) бэкап молчит или падает; 4) резко выросли ошибки/время ответа; 5) истекает SSL, домен или лицензия. Эти пять покрывают большинство «узнали из чата с клиентом».

В общий Telegram/MAX-чат IT + директора на критичные события и отдельный «на утро» для трендов. Срочно — недоступность и массовые ошибки; диск и бэкап — в рабочее время с эскалацией, если не закрыли за день. Без разделения приоритетов команда выгорает и начинает игнорировать сигналы.

Час простоя сайта или 1С часто 50–200+ тыс. ₽ выручки и зарплат; день без учёта — уже сотни тысяч–миллионы плюс сорванные сделки. Базовый контур алертов обычно дешевле одного такого инцидента. Считайте по той же логике, что в статье про стоимость часа простоя.

Хотите применить это на практике?

Расскажите про вашу систему — предложим план работ и метрики, которые имеет смысл зафиксировать в SLA/SLO.

Все материалы: DevOps и SRE

DevOps и SRE27 июля 2026 г.
Код от AI-агентов: чеклист до продакшена

AI-агенты пишут код: чеклист контроля до продакшена для CTO — риски утечек, лицензий и тихих багов, ворота ревью и ориентир потерь в ₽ при инциденте.

Читать статью
DevOps и SRE8 июля 2026 г.
Мониторинг сайта в production: 4 метрики, которые увидит даже не-IT

Мониторинг production простыми словами: скорость сайта, ошибки, нагрузка и запас мощности сервера. Что проверить до рекламы и как не узнавать о сбое из чата с клиентами. DevOps, Grafana, Prometheus.

Читать статью
DevOps и SRE19 июня 2026 г.
DevOps и CI/CD в production: что настроить в первую очередь

DevOps услуги для бизнеса: пайплайн сборки, staging, деплой без простоя, мониторинг и rollback — приоритеты на первые 4–6 недель.

Читать статью
DevOps и SRE19 июня 2026 г.
Kubernetes в production: чеклист для CTO перед запуском кластера

Kubernetes настройка для production: RBAC, ресурсы, Ingress, GitOps, мониторинг и типичные ошибки — чеклист перед выходом в бой.

Читать статью