Что это значит

Сервер Directum RX или узел Kubernetes обращается к общей папке по NFS, а NFS-сервер не отвечает. При монтировании с параметром hard (по умолчанию) клиент ждёт бесконечно и повторяет запросы. Процессы, которые читают или пишут в эту папку, зависают в состоянии D, их не убить. Когда сервер вернётся, в журнале появится nfs: server … OK, и всё продолжится.

Как проверить

  1. Журнал ядра на клиенте:
dmesg -T | grep -i nfs
  1. Доступность сервера и порта: rpcinfo -p <сервер>, nc -zv <сервер> 2049.
  2. Повторные отправки на клиенте: nfsstat -rc. Рост retrans означает потери в сети или перегруженный сервер.
  3. Нагрузка и диски на самом NFS-сервере.

Что сделать

  1. Вернуть NFS-сервер или сеть до него. Зависшие процессы продолжат работу сами.
  2. Не использовать soft для данных, где важна целостность: при таймауте запись тихо потеряется.
  3. Задать разумные timeo и retrans и следить за повторными отправками в мониторинге: рост ретрансмитов заранее показывает проблемы с сетью или сервером.