Оценка и устранение проблем со здоровьем кластера
Оценка и устранение проблем со здоровьем кластера
Kubernetes (new) упрощает процесс оценки здоровья кластеров, позволяя легко отслеживать сигналы здоровья и метрики в вашей среде. Он предоставляет чёткую информацию о здоровье кластера, помогая выявлять и устранять проблемы и обеспечивая эффективное функционирование ваших кластеров.
Состояние здоровья от Ключ-АСТРОМ Intelligence
Получите быстрый обзор здоровья с помощью состояния здоровья от Ключ-АСТРОМ Intelligence. Ключ-АСТРОМ Intelligence автоматически оценивает и агрегирует здоровье кластеров, нод, пространств имён и рабочих нагрузок Kubernetes. Эта функция визуализирует текущее состояние здоровья на высоком уровне, позволяя легко выявлять как здоровые, так и нездоровые кластеры, ноды, пространства имён и рабочие нагрузки.
Устранение проблем нездоровых ресурсов
В этом примере мы наблюдаем на вкладке Кластер, что некоторые ноды, пространства имён и рабочие нагрузки находятся в нездоровом состоянии, отмеченном красным.
Чтобы устранить проблемы этих нездоровых объектов Kubernetes:
1. Просмотр нездоровых нод
Выберите красное число в разделе Ноды панели состояния здоровья Ключ-АСТРОМ Intelligence.
Это действие раскрывает список нездоровых объектов в соответствующей таблице списка нод, предоставляя дополнительную информацию о характере проблем, с которыми они сталкиваются. Например, вы можете заметить ноду, отображающую предупреждение BackOff с последней причиной завершения out-of-memory killed, что указывает на то, что контейнер превысил свой лимит памяти, и Kubernetes откладывает перезапуски.
2. Анализ использования памяти ноды
В детальном представлении вы можете увидеть разбивку использования ресурсов ноды.
Обратите внимание на плитку Память. Если использование памяти превышает выделенные запросы, это указывает на потенциальную нагрузку на ресурсы.
Kubernetes, стремясь поддерживать стабильность ноды, может начать вытеснять поды для освобождения памяти. Это часто является ответом на то, что поды потребляют больше памяти, чем доступно, исходя из их зарезервированных запросов. Kubernetes может сообщать о нехватке памяти на уровне ноды, и затронутые контейнеры могут быть завершены с out-of-memory killed, когда они превышают свои лимиты.
3. Переход к событиям ноды
Чтобы определить, какие поды были завершены из-за нехватки памяти, перейдите на вкладку События для этой ноды.
4. Определение подов, завершённых из-за нехватки памяти, по событиям
Найдите в списке событий BackOff, выберите соответствующую запись и детализируйте её, чтобы просмотреть полные сведения о событии. В сведениях о событии вы можете определить под и развёртывание, которые были завершены из-за OOMKill после превышения лимита памяти.
5. Изучение затронутой рабочей нагрузки
Закройте детальное представление и перейдите в Рабочая нагрузка > Рабочие нагрузки верхнего уровня. Отфильтруйте по имени развёртывания, чтобы найти соответствующую рабочую нагрузку, и выберите эту рабочую нагрузку для отображения подробностей.
В разделе Использование вы сможете быстро заметить ошибки конфигурации запросов ресурсов.