Сколько реально стоит час простоя: считаем потери и пересматриваем SLA

AlexPet

New member
Пару лет назад я искренне считал, что час простоя — это просто час, когда сервис не приносит деньги. Красивая формула: умножаем среднюю выручку в час на длительность аварии, добавляем штрафы по договору и получаем цифру для отчёта. Реальность оказалась куда интереснее и заметно дороже. Первый же серьёзный инцидент на моём проекте показал, что настоящие потери почти не совпадают с тем, что мы посчитали в тот вечер в спешке.

Начну с того, что считали мы тогда. У нас был маркетплейс с оборотом порядка двух миллионов рублей в сутки, то есть около восьмидесяти тысяч в час. Авария длилась три часа, значит, прямые потери — примерно двести сорок тысяч. Звучит внушительно, но это была лишь верхушка айсберга, и я понял это, когда через месяц перечитал отчёты уже спокойно, без горящих глаз.

К прямому недополученному доходу добавилось всё остальное. Часть заказов клиенты не отменили, а перенесли — то есть выручка вернулась, а вот доверие нет. Поддержка получила тройной поток обращений, и ребятам пришлось выйти в выходные с двойной оплатой. Разработчики почти сутки не занимались фичами, которые мы обещали выпустить, и это тоже стоимость часа простоя, просто она не попала в первый расчёт. Плюс компенсации по договорам с ключевыми партнёрами и один крупный клиент, который ушёл к конкуренту после второго похожего случая.

По итогам квартала мы посчитали честно и получили, что реальная стоимость часа простоя примерно в два с половиной раза выше той, что мы рисовали по одной выручке. И это без учёта сделок, которые просто не случились, потому что человек увидел ошибку и ушёл на другой сайт. С тех пор я считаю простой не одной цифрой, а моделью: прямые потери, операционные расходы на ликвидацию, упущенная работа команды и репутационный хвост, который тянется месяцами.

Отдельная история — SLA. Долгое время он у нас был написан под клиента, то есть красиво и необязательно. Мы обещали девяносто девять и девять десятых процента доступности, но по факту не понимали, что это значит. А это, если пересчитать, около сорока трёх минут в месяц и почти девять часов в год. Когда я перевёл проценты в минуты и умножил на реальную стоимость часа, SLA перестал быть формальностью и превратился в бюджетное ограничение. Именно тогда мы пересмотрели уровни: критичные сервисы получили более строгие обязательства и резервирование, а внутренние инструменты — честно пониженные, потому что платить за их идеальную доступность было бессмысленно.

Что я советую тем, кто только берётся за эту тему. Считайте потери по функциям, а не по сервисам целиком: падение раздела с отзывами и падение оплаты — это совершенно разные деньги, и путать их дорого. Разделяйте горячий путь, где каждая минута действительно стоит много, и всё остальное, где разумнее сэкономить. Заведите привычку после каждого инцидента писать честный разбор с суммой ущерба — не для наказания виноватых, а для нормальных решений. И держите в голове, что надёжность тоже стоит денег, поэтому вопрос всегда не «как избежать простоя вообще», а «сколько мы готовы заплатить за то, чтобы этот риск стал меньше».

Ещё одно наблюдение напоследок: руководители прекрасно слышат язык денег и почти не слышат язык технологий. Фраза «нам нужен второй кластер» вызывает только вопросы, а фраза «это снижает ожидаемые потери на два миллиона в год при затратах в четыреста тысяч» обсуждается сразу по существу. Я до сих пор учусь переводить технические риски в деньги, и это, пожалуй, самый полезный навык, который я вынес из всей этой истории с простоями.

А теперь интересно послушать вас: как в вашей компании считают стоимость часа простоя и приходилось ли пересматривать SLA после того, как реальные потери оказались куда выше ожидаемых? Делитесь историями и подходами — уверен, у многих найдутся цифры, от которых волосы дыбом встают, и чужой опыт здесь экономит целые месяцы грабель.
 
Назад
Вверх