<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>https://doc.ruscomtech.ru/index.php?action=history&amp;feed=atom&amp;title=%D0%A3%D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B5%D0%BD%D0%B8%D0%B5_%D1%80%D0%B0%D1%81%D0%BF%D1%80%D0%BE%D1%81%D1%82%D1%80%D0%B0%D0%BD%D1%91%D0%BD%D0%BD%D1%8B%D1%85_%D0%BF%D1%80%D0%BE%D0%B1%D0%BB%D0%B5%D0%BC_%D1%81%D0%BE_%D0%B7%D0%B4%D0%BE%D1%80%D0%BE%D0%B2%D1%8C%D0%B5%D0%BC_%D1%80%D0%B0%D0%B1%D0%BE%D1%87%D0%B8%D1%85_%D0%BD%D0%B0%D0%B3%D1%80%D1%83%D0%B7%D0%BE%D0%BA_Kubernetes</id>
	<title>Устранение распространённых проблем со здоровьем рабочих нагрузок Kubernetes - История изменений</title>
	<link rel="self" type="application/atom+xml" href="https://doc.ruscomtech.ru/index.php?action=history&amp;feed=atom&amp;title=%D0%A3%D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B5%D0%BD%D0%B8%D0%B5_%D1%80%D0%B0%D1%81%D0%BF%D1%80%D0%BE%D1%81%D1%82%D1%80%D0%B0%D0%BD%D1%91%D0%BD%D0%BD%D1%8B%D1%85_%D0%BF%D1%80%D0%BE%D0%B1%D0%BB%D0%B5%D0%BC_%D1%81%D0%BE_%D0%B7%D0%B4%D0%BE%D1%80%D0%BE%D0%B2%D1%8C%D0%B5%D0%BC_%D1%80%D0%B0%D0%B1%D0%BE%D1%87%D0%B8%D1%85_%D0%BD%D0%B0%D0%B3%D1%80%D1%83%D0%B7%D0%BE%D0%BA_Kubernetes"/>
	<link rel="alternate" type="text/html" href="https://doc.ruscomtech.ru/index.php?title=%D0%A3%D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B5%D0%BD%D0%B8%D0%B5_%D1%80%D0%B0%D1%81%D0%BF%D1%80%D0%BE%D1%81%D1%82%D1%80%D0%B0%D0%BD%D1%91%D0%BD%D0%BD%D1%8B%D1%85_%D0%BF%D1%80%D0%BE%D0%B1%D0%BB%D0%B5%D0%BC_%D1%81%D0%BE_%D0%B7%D0%B4%D0%BE%D1%80%D0%BE%D0%B2%D1%8C%D0%B5%D0%BC_%D1%80%D0%B0%D0%B1%D0%BE%D1%87%D0%B8%D1%85_%D0%BD%D0%B0%D0%B3%D1%80%D1%83%D0%B7%D0%BE%D0%BA_Kubernetes&amp;action=history"/>
	<updated>2026-10-06T20:21:04Z</updated>
	<subtitle>История изменений этой страницы в вики</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://doc.ruscomtech.ru/index.php?title=%D0%A3%D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B5%D0%BD%D0%B8%D0%B5_%D1%80%D0%B0%D1%81%D0%BF%D1%80%D0%BE%D1%81%D1%82%D1%80%D0%B0%D0%BD%D1%91%D0%BD%D0%BD%D1%8B%D1%85_%D0%BF%D1%80%D0%BE%D0%B1%D0%BB%D0%B5%D0%BC_%D1%81%D0%BE_%D0%B7%D0%B4%D0%BE%D1%80%D0%BE%D0%B2%D1%8C%D0%B5%D0%BC_%D1%80%D0%B0%D0%B1%D0%BE%D1%87%D0%B8%D1%85_%D0%BD%D0%B0%D0%B3%D1%80%D1%83%D0%B7%D0%BE%D0%BA_Kubernetes&amp;diff=6728&amp;oldid=prev</id>
		<title>IKuznetsov: Новая страница: « = Устранение распространённых проблем со здоровьем рабочих нагрузок Kubernetes = Даже при надёжной инфраструктуре могут возникать проблемы, приводящие к снижению качества обслуживания или, в худшем случае, к ошибкам, видимым пользователям. Работа с &#039;&#039;&#039;Kubernete...»</title>
		<link rel="alternate" type="text/html" href="https://doc.ruscomtech.ru/index.php?title=%D0%A3%D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B5%D0%BD%D0%B8%D0%B5_%D1%80%D0%B0%D1%81%D0%BF%D1%80%D0%BE%D1%81%D1%82%D1%80%D0%B0%D0%BD%D1%91%D0%BD%D0%BD%D1%8B%D1%85_%D0%BF%D1%80%D0%BE%D0%B1%D0%BB%D0%B5%D0%BC_%D1%81%D0%BE_%D0%B7%D0%B4%D0%BE%D1%80%D0%BE%D0%B2%D1%8C%D0%B5%D0%BC_%D1%80%D0%B0%D0%B1%D0%BE%D1%87%D0%B8%D1%85_%D0%BD%D0%B0%D0%B3%D1%80%D1%83%D0%B7%D0%BE%D0%BA_Kubernetes&amp;diff=6728&amp;oldid=prev"/>
		<updated>2026-09-21T12:24:00Z</updated>

		<summary type="html">&lt;p&gt;Новая страница: « = Устранение распространённых проблем со здоровьем рабочих нагрузок Kubernetes = Даже при надёжной инфраструктуре могут возникать проблемы, приводящие к снижению качества обслуживания или, в худшем случае, к ошибкам, видимым пользователям. Работа с &amp;#039;&amp;#039;&amp;#039;Kubernete...»&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Новая страница&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&lt;br /&gt;
= Устранение распространённых проблем со здоровьем рабочих нагрузок Kubernetes =&lt;br /&gt;
Даже при надёжной инфраструктуре могут возникать проблемы, приводящие к снижению качества обслуживания или, в худшем случае, к ошибкам, видимым пользователям. Работа с &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039; предлагает набор инструментов для визуализации и устранения проблем, помогая выявлять проблемы до их обострения.&lt;br /&gt;
&lt;br /&gt;
Это руководство предназначено для специалистов по эксплуатации, DevOps и DevSecOps, управляющих кластерами &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;. Предполагается базовое понимание концепций &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;, таких как запросы/лимиты ресурсов, поды и ноды, однако экспертиза в &amp;#039;&amp;#039;&amp;#039;Ключ-АСТРОМ&amp;#039;&amp;#039;&amp;#039; или управлении кластерами не требуется.&lt;br /&gt;
&lt;br /&gt;
== Сценарий ==&lt;br /&gt;
&lt;br /&gt;
* В приложении &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039; для кластеров и рабочих нагрузок появляются индикаторы ошибок или предупреждений.&lt;br /&gt;
* Состояние здоровья от &amp;#039;&amp;#039;&amp;#039;Ключ-АСТРОМ Intelligence&amp;#039;&amp;#039;&amp;#039; отображается жёлтым или красным для определённых рабочих нагрузок, нод или кластеров.&lt;br /&gt;
&lt;br /&gt;
== Предварительные требования ==&lt;br /&gt;
&lt;br /&gt;
* Доступ к кластеру &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;.&lt;br /&gt;
* Настроен новый опыт работы с &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;.&lt;br /&gt;
&lt;br /&gt;
== Выявление и устранение проблем со здоровьем ==&lt;br /&gt;
Следующие шаги проведут вас через этапы выявления проблемных рабочих нагрузок в ваших кластерах и процесс их устранения.&lt;br /&gt;
&lt;br /&gt;
=== 1. Выявление проблемных рабочих нагрузок ===&lt;br /&gt;
Выберите красное число на плитке рабочих нагрузок, чтобы применить фильтр, отображающий все текущие нездоровые рабочие нагрузки в ваших отслеживаемых кластерах.&lt;br /&gt;
&lt;br /&gt;
Среди перечисленных рабочих нагрузок вы можете видеть, что рабочая нагрузка &amp;lt;code&amp;gt;prom-problem-sim&amp;lt;/code&amp;gt; проявляет признаки проблем.&lt;br /&gt;
&lt;br /&gt;
=== 2. Анализ проблем рабочей нагрузки ===&lt;br /&gt;
Мы выявили важную рабочую нагрузку, отображающую проблемы, которые делают её нездоровой. Чтобы лучше понять основные проблемы, мы рассмотрим эту рабочую нагрузку подробнее.&lt;br /&gt;
&lt;br /&gt;
На странице рабочей нагрузки просмотрите индикаторы проблем, отображаемые вверху (например, &amp;#039;&amp;#039;&amp;#039;Использование CPU близко к лимитам&amp;#039;&amp;#039;&amp;#039;).&lt;br /&gt;
&lt;br /&gt;
Выберите &amp;#039;&amp;#039;&amp;#039;Использование CPU близко к лимитам&amp;#039;&amp;#039;&amp;#039;, чтобы войти в режим проблемы. &amp;#039;&amp;#039;&amp;#039;Ключ-АСТРОМ&amp;#039;&amp;#039;&amp;#039; открывает специальное представление проблемы, где вы можете:&lt;br /&gt;
&lt;br /&gt;
* Увидеть точную формулировку проблемы и её длительность.&lt;br /&gt;
* Понять, почему рабочая нагрузка затронута (например, превышены лимиты &amp;#039;&amp;#039;&amp;#039;CPU&amp;#039;&amp;#039;&amp;#039; или обнаружен троттлинг).&lt;br /&gt;
* Сопоставить использование ресурсов (например, &amp;#039;&amp;#039;&amp;#039;CPU&amp;#039;&amp;#039;&amp;#039; и память) с проблемой.&lt;br /&gt;
&lt;br /&gt;
Находясь в режиме проблемы, перейдите на вкладку &amp;#039;&amp;#039;&amp;#039;Использование&amp;#039;&amp;#039;&amp;#039;. &amp;#039;&amp;#039;&amp;#039;Ключ-АСТРОМ&amp;#039;&amp;#039;&amp;#039; автоматически выделяет затронутый ресурс (например, &amp;#039;&amp;#039;&amp;#039;CPU&amp;#039;&amp;#039;&amp;#039;) и накладывает проблему на соответствующий график. Это помогает увидеть, как использование ресурсов связано с активной проблемой.&lt;br /&gt;
&lt;br /&gt;
Вкладка &amp;#039;&amp;#039;&amp;#039;События&amp;#039;&amp;#039;&amp;#039; представляет график, отображающий количество недавних событий по типам, а также таблицу с подробным описанием этих событий.&lt;br /&gt;
&lt;br /&gt;
Под графиком список событий предоставляет подробные сообщения платформы, такие как &amp;lt;code&amp;gt;OOMKilled&amp;lt;/code&amp;gt;, за которыми следуют события &amp;lt;code&amp;gt;Created&amp;lt;/code&amp;gt; и &amp;lt;code&amp;gt;Started&amp;lt;/code&amp;gt; контейнера. Эта последовательность указывает на то, что контейнер превысил свой лимит памяти и был завершён &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;.&lt;br /&gt;
&lt;br /&gt;
=== 3. Устранение проблем рабочей нагрузки ===&lt;br /&gt;
Временная шкала событий показывает повторяющиеся сгруппированные события, которые представляют перезапуски контейнера. В списке событий записи &amp;lt;code&amp;gt;OOMKilled&amp;lt;/code&amp;gt; сопровождаются событиями &amp;lt;code&amp;gt;Created&amp;lt;/code&amp;gt; и &amp;lt;code&amp;gt;Started&amp;lt;/code&amp;gt; для контейнера &amp;lt;code&amp;gt;prometheus-problem-simulator&amp;lt;/code&amp;gt;. Эта последовательность указывает на то, что контейнер превысил свой лимит памяти, был завершён &amp;lt;code&amp;gt;kubelet&amp;lt;/code&amp;gt;, а затем автоматически пересоздан &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;.&lt;br /&gt;
&lt;br /&gt;
Используйте эту информацию, чтобы понять, как рабочая нагрузка ведёт себя с течением времени, и выявить повторяющиеся события жизненного цикла контейнера, которые способствуют проблеме.&lt;br /&gt;
&lt;br /&gt;
=== 4. Исследование редких проблем рабочей нагрузки ===&lt;br /&gt;
Большинство проблем можно найти и исследовать, следуя шагам, описанным выше. Однако некоторые проблемы могут быть более сложными, поскольку они не происходят регулярно или возникают с большими интервалами. &amp;#039;&amp;#039;&amp;#039;Ключ-АСТРОМ&amp;#039;&amp;#039;&amp;#039; помогает преодолеть эти трудности, выделяя ключевые метрики и предоставляя полезные подсказки в &amp;#039;&amp;#039;&amp;#039;Kubernetes (new)&amp;#039;&amp;#039;&amp;#039;.&lt;br /&gt;
&lt;br /&gt;
Распространённая и потенциально проблемная ситуация связана с завершением контейнеров из-за нехватки памяти (&amp;#039;&amp;#039;&amp;#039;OOM&amp;#039;&amp;#039;&amp;#039;). &amp;#039;&amp;#039;&amp;#039;Ключ-АСТРОМ&amp;#039;&amp;#039;&amp;#039; может помочь обнаружить такие инциденты. В перспективе здоровья списка рабочих нагрузок есть специальный столбец, отображающий события &amp;#039;&amp;#039;&amp;#039;OOM kill&amp;#039;&amp;#039;&amp;#039; для каждой рабочей нагрузки.&lt;br /&gt;
&lt;br /&gt;
Учитывая, что &amp;#039;&amp;#039;&amp;#039;Kubernetes (new)&amp;#039;&amp;#039;&amp;#039; отображает текущее состояние вашей среды &amp;#039;&amp;#039;&amp;#039;Kubernetes&amp;#039;&amp;#039;&amp;#039;, мы можем использовать возможности &amp;#039;&amp;#039;&amp;#039;DQL&amp;#039;&amp;#039;&amp;#039; для выявления рабочих нагрузок с &amp;#039;&amp;#039;&amp;#039;OOM kill&amp;#039;&amp;#039;&amp;#039; за любой выбранный период времени.&lt;br /&gt;
&lt;br /&gt;
Это достигается с помощью &amp;#039;&amp;#039;&amp;#039;Notebooks&amp;#039;&amp;#039;&amp;#039;, куда добавляется следующий запрос &amp;#039;&amp;#039;&amp;#039;DQL&amp;#039;&amp;#039;&amp;#039;.&amp;lt;pre&amp;gt;&lt;br /&gt;
// Aggregate OOM kills per pod over time&lt;br /&gt;
timeseries values = sum(dt.kubernetes.container.oom_kills, rollup:sum),&lt;br /&gt;
  by:{ dt.smartscape.k8s_pod },&lt;br /&gt;
  filter: isNotNull(dt.smartscape.k8s_pod)&lt;br /&gt;
// calculate total OOM kills and retain pod id for lookup&lt;br /&gt;
| fieldsAdd container_oom_kills = toLong(arraySum(values)), dt.smartscape.k8s_pod&lt;br /&gt;
// fetch pod metadata&lt;br /&gt;
| lookup [&lt;br /&gt;
  smartscapeNodes { K8S_POD }&lt;br /&gt;
], sourceField: dt.smartscape.k8s_pod, lookupField:id, fields:{k8s.workload.name, k8s.workload.kind, name, type}, executionOrder:leftFirst&lt;br /&gt;
// select fields for the result&lt;br /&gt;
| fields dt.smartscape.k8s_pod, type, k8s.workload.name, k8s.workload.kind, name, container_oom_kills&lt;br /&gt;
// order by OOM kill count in descending order&lt;br /&gt;
| sort container_oom_kills desc&lt;br /&gt;
&amp;lt;/pre&amp;gt;Этот запрос создаёт таблицу со списком рабочих нагрузок, у которых были &amp;#039;&amp;#039;&amp;#039;OOM kill&amp;#039;&amp;#039;&amp;#039; за последние 7 дней, включая сведения о том, установлены ли у них лимиты памяти и изменялись ли эти лимиты в течение указанного периода.&lt;/div&gt;</summary>
		<author><name>IKuznetsov</name></author>
	</entry>
</feed>