Стало ли реально хуже после изменения
После релиза или миграции кажется, что сбоев стало больше. Откатывать? Чинить? Или это просто пара неудачных дней, и всё в порядке?
Какую задачу решаем?
«Кажется» - плохой аргумент. Команда всегда найдёт объяснение, почему «это не у нас», а руководству нужен факт, а не впечатление. Несколько плохих дней подряд бывают и без всякой причины - поэтому нужно доказательство, что разница реальная, а не случайное колебание.
Наши результаты
На реальных данных движок сравнил период до и после известной даты изменения тестом Манна-Уитни (он сравнивает две выборки, не требуя, чтобы данные были «идеально ровными» - поэтому надёжен на реальных логах с выбросами):
Как это считается
Метод из семейства поиска отклонений - «где и что не так?».
- Сравнение «до / после» (Манн-Уитни). В начале бот спрашивает дату изменения - релиз, миграция, смена провайдера - в формате ГГГГ-ММ-ДД (можно пропустить). Движок сравнивает выборку «до» и «после» и выдаёт p-value: меньше 0.05 - разницу считаем реальной; больше - прямо пишет «различие не значимо». Второе тоже ценно: не нужно неделями искать причину того, чего на самом деле нет.
Если точной даты нет - движок сам находит точку смены режима (changepoint-детекция) и строит сравнение вокруг неё. Для устойчивого результата нужно хотя бы около 10 инцидентов с каждой стороны от даты.
Проверить своё «стало хуже» или «стало лучше»
Загрузите историю инцидентов и укажите дату изменения - движок скажет, реальна разница или это случайность.
Все данные обрабатываются изолированно и не передаются третьим лицам.