Новый стандарт: почему AIOps уходит в прошлое

В марте 2025 года аналитическое агентство Gartner официально переименовало рыночную категорию AIOps в Event Intelligence Solutions — решения для интеллектуальной обработки событий. Причиной стал избыток маркетингового шума: вендоры называли искусственным интеллектом любые инструменты, от простых регулярных выражений до тяжелых LLM. Это привело к разочарованию ИТ-директоров и росту нагрузки на инженеров, которым пришлось работать с непредсказуемой автоматикой.

Несмотря на смену названия, термин AIOps продолжает использоваться в профессиональной среде как исторически сложившийся. Однако новый подход Event Intelligence более точно описывает суть технологии: это специализированный слой обработки данных, использующий классическое машинное обучение (ML), теорию графов и статистический анализ для решения узких задач автоматизации.

Кризис алертов и выгорание инженеров

Современная эксплуатация столкнулась с проблемой масштабирования статических порогов. Классический алертинг генерирует лавину уведомлений, из-за которой инженеры пропускают критические сбои. Согласно отчету Splunk «State of Observability 2025», 73% организаций сталкивались с простоями систем именно из-за проигнорированных или подавленных оповещений.

Избыток уведомлений ведет к «alert fatigue» — снижению внимания и доверия к системе. Это напрямую влияет на состояние команды: отчет Catchpoint «The SRE Report 2025» фиксирует рост доли ручной операционной рутины (Toil) с 25% до 30% за последние пять лет. При этом почти 70% инженеров по надежности называют стресс от дежурств одним из главных факторов выгорания.

Три задачи интеллектуальной обработки событий

Вместо «магии» общего искусственного интеллекта современные системы используют три прикладные ML-задачи:

  • Дедупликация и кластеризация: алгоритмы анализируют метаданные (таймстампы, ID кластеров) и объединяют сотни разрозненных событий в один инцидент. Например, вместо 50 алертов о падении подов в Kubernetes система выдает одно уведомление о деградации конкретного Deployment из-за потери ноды.
  • Корреляция по топологии: система сопоставляет временные ряды с картой зависимостей инфраструктуры (Service Dependency Map). Это позволяет выстроить цепочку от симптома (ошибки 500 на API) к первопричине (деградация дискового массива).
  • Обнаружение аномалий: вместо жестких статических порогов (например, CPU > 85%) ML-модели строят динамическую «базовую линию» на основе исторических данных. Это позволяет игнорировать ожидаемые всплески трафика в периоды распродаж и мгновенно реагировать на аномальные падения нагрузки.

Практический опыт: Яндекс и Флант

Крупные игроки уже внедрили эти подходы. В Яндексе в системе метрик Monium на 46 регионах Яндекс Такси заменили статические пороги на алгоритмы авторегрессии и MEDIFF. Это позволило инженерам реагировать на все уведомления без риска пропустить сбой. Команда Фланта использует логику лейблов в Kubernetes для дедупликации миллионов событий в день, сводя их к обозримому числу инцидентов.