Что это значит

Сервисы Directum RX периодически проверяют свои зависимости: базу, брокер, хранилище, поиск. Когда результат меняется, например с «здоров» на «не здоров» и обратно, в лог пишется эта строка уровнем Error, даже если сервис вернулся в норму.

Сама по себе запись не означает аварию. Важно, какая проверка отказала и как долго это длилось.

Как проверить

  1. Соседние записи того же сервиса: в них видно, какая проверка не прошла.
  2. Состояние проверки прямо сейчас, через адрес проверки работоспособности сервиса или через пробу в Kubernetes:
kubectl describe pod <под> | grep -iA3 -E "liveness|readiness"
  1. Если смены идут парами «плохо → хорошо» за секунды, это дребезг: зависимость отвечает на грани таймаута.

Что сделать

  1. Алерт строить по самой проверке работоспособности или по пробам Kubernetes, а не по этой строке в логе.
  2. Частый дребезг разобрать по зависимости, которая отвечает медленно: база, брокер, хранилище.
  3. Если проверка падает при штатной нагрузке, проверить её таймауты: слишком жёсткие приводят к лишним перезапускам.