В середине 2026 года компания OpsWerks опубликовала отчет
The State of SRE Operations 2026. Компания опросила практиков в области SRE, платформенной и инфраструктурной инженерии, чтобы понять, с чем они сталкиваются в своей работе. Вопросы охватывали проблемы эксплуатации, соотношение реактивной и проактивной работы, модель покрытия, качество алертов, критерии выбора вендоров, приоритеты инвестиций, распределение инженерных усилий, а также численность и бюджет команд.
Что интересного мы отметили в отчете:
- Шум алертов и поддержка разработчиков отнимают у команд больше всего сил. Усталость от алертов и перегрузка инцидентами (25%) являются самой значимой операционной проблемой. Сложности с поддержкой платформы и разработчиков следуют сразу за ними (22%). В сумме 47% команд называют их основным источником потери пропускной способности. Далее следуют критически важные миграции или вывод систем из эксплуатации и legacy системы, блокирующие инновации (по 16%). Выгорание на дежурствах и масштабирование AI/ML-инфраструктуры замыкают список;
- Большинство команд работают реактивно как минимум половину времени. Только 38% сообщают, что тратят на проактивную работу больше времени, чем на реактивную. Большинство работает в соотношении 50/50 или хуже, при этом 31% команд находятся в равновесии 50/50. Это структурно затрудняет снижение будущей нагрузки от инцидентов;
- Покрытие 24/7 почти полностью обеспечивается внутренними ротациями дежурств. 72% полагаются на внутренние дежурства. Только 9% полностью передают покрытие MSP (Managed Service Provider) или на аутсорс. С учетом гибридных схем внешний вендор задействован лишь в 13% случаев. Столько же команд, сколько использует аутсорсинг, не имеют покрытия 24/7;
- Шум алертов является типичным операционным фоном. 63% сообщают, что менее половины их алертов требуют действий (Actionable), и только у 16% команд действий требуют более 75% алертов. Шум алертов является операционной нормой для большинства команд и усугубляет все остальные проблемы с пропускной способностью;
- Техническая экспертиза является главным критерием при оценке вендора. Техническая экспертиза в конкретном стеке команды стала наиболее часто упоминаемым фактором выбора вендора, ее назвали 66%. Скорость онбординга, покрытие 24/7 с SLA по времени реакции и культурная совместимость с инженерной командой определяют попадание вендора в шорт-лист. Прозрачное ценообразование, подтвержденный опыт и гибкость масштабирования имеют меньшее значение;
- Наблюдаемость и технический долг лидируют среди приоритетов инвестиций. Улучшение наблюдаемости и мониторинга (31%) возглавляет список инвестиционных приоритетов. Снижение технического долга (25%) находится на втором месте. Далее следуют AI/ML-инфраструктура и инструменты, создание внутренних платформ для разработчиков и повышение квалификации команды. Оба лидирующих приоритета отражают одно ограничение: команды тратят слишком много времени на тушение пожаров, и у них остается мало времени на исправление систем, которые эти пожары вызывают;
- Наблюдаемость требует больше всего инженерных усилий. 66% команд тратят больше всего инженерных усилий на пайплайны наблюдаемости и мониторинга. Половина команд называет Kubernetes и оркестрацию контейнеров, а также CI/CD и автоматизацию развертывания. Далее следуют безопасность и соответствие требованиям, надежность баз данных, мультиоблачные сети и FinOps;
- Нагрузка на команды растет быстрее их численности и бюджета. 38% команд оценивают укомплектованность и бюджет за последний год как стабильные на бумаге при растущем объеме задач. Еще четверть считает их стабильными и соответствующими потребностям, рост отмечают 22%, сокращение или заморозку 15%.
Основные инсайты из отчета State of SRE Operations 2026 приведены ниже: