Рабочий словарь

Термины инцидент-менеджмента

Короткие определения для кейса AAA, процесса, шаблона PIR и журнала инцидентов. Это язык минимального процесса небольшой продуктовой команды, а не отраслевой стандарт.

Production-инцидент

Нарушение работающего для пользователей сценария в боевой среде: ошибка, деградация, недоступность или потеря данных. Его начинают вести как отдельный случай, когда команде нужно восстановить работу и сохранить проверяемый след решений.

PIR

Post-Incident Review (PIR) — документ разбора одного инцидента: влияние, хронология, факты, гипотезы, подтверждённая причина, восстановление и действия, которые должны предотвратить повторение.

RCA

Root Cause Analysis (RCA), или анализ корневых причин, — проверяемое объяснение, почему инцидент стал возможен. Он отделяет подтверждённую причину от гипотез и не является поиском виноватого.

DRI

Directly Responsible Individual (DRI) — человек, который отвечает за следующий шаг: ведёт тред, координирует расследование и не даёт процессу остановиться. DRI не обязательно автор исправления и не заменяет владельца риска.

Тред инцидента

Продолжение корневого сообщения в корпоративном канале. Там фиксируют ход расследования, факты, гипотезы, действия и следующий шаг; PIR хранит итоговый проверяемый разбор.

Текущее исправление

Действие, которое возвращает пользователю рабочий сценарий сейчас: hotfix, откат или временный обходной путь. Оно ещё не означает, что причина устранена и PIR можно закрыть.

Предотвращающее действие

Задача, которая устраняет причину или условие повторения. У неё должны быть владелец, срок и способ проверки; иначе PIR остаётся открытым даже после восстановления сервиса.

Статусы 👀, 🏁 и

👀 — инженер увидел инцидент и взял его в работу. 🏁 — исправление или обходной путь готов к проверке. — восстановление подтверждено. Ни один из статусов не равен закрытию PIR.