Запуск продукта не завершает разработку. После него начинается эксплуатация, где нужны владельцы, наблюдаемость и понятный порядок изменения системы.
Определите уровни критичности
Инцидент, который блокирует всех клиентов, отличается от ошибки в редком отчете. Для каждого уровня задайте время реакции, канал связи, ответственного и частоту обновлений статуса.
SLA должен быть измеримым
Зафиксируйте часы поддержки, доступность, исключения и метод расчета. Не обещайте круглосуточную реакцию без дежурной команды. Внутренние цели можно оформить как SLO и отслеживать по тем же данным.
Мониторьте пользовательский путь
- доступность и задержка
- ошибки ключевых операций
- очереди и фоновые задачи
- срок сертификатов и резервные копии
Зеленый сервер не гарантирует, что клиент может оформить заказ. Технические метрики связывайте с бизнес-сценарием.
Управляйте релизами
Ведите журнал изменений, план отката и окно для рискованных миграций. Минимальный процесс описан в статье про CI/CD небольшой команды.
После серьезного инцидента проведите разбор без поиска виноватого, зафиксируйте причины и конкретные меры. База знаний должна обновляться по результатам реальных обращений.