# 7.3.2 и потеря мастера

**URL:** https://discuss.elastic.co/t/7-3-2/201228
**Category:** Вопросы на русском языке
**Created:** [September 26, 2019, 12:24pm UTC](https://discuss.elastic.co/t/7-3-2/201228 "2019-09-26T12:24:20Z")
**Posts on this page:** 20
**Page:** 2

<div class="post-metadata">

### Author: ![Igor\_Motov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/igor_motov/32/45193_2.png) [@Igor\_Motov](https://discuss.elastic.co/u/Igor_Motov)
#### Post date: [October 15, 2019, 8:28am UTC](https://discuss.elastic.co/t/7-3-2/201228/21 "2019-10-15T08:28:53Z")

</div>

> [@Denis\_Lamanov](#):
>
> и ещё снимаем раз в минуту статистику по Heap Size и Open descriptors

Чем снимаете статистику по heap size и приходит-ли эта статистика всегда без задержек?

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 15, 2019, 8:44am UTC](https://discuss.elastic.co/t/7-3-2/201228/22 "2019-10-15T08:44:05Z")

</div>

> [@Igor\_Motov](#):
>
> Чем снимаете статистику по heap size и приходит-ли эта статистика всегда без задержек?

Делаем запрос через NEST на .Net:`client.Nodes.StatsAsync()`и пишем в базу, потом отображаем в Графане. Да, всегда без задержек.  
Можно, конечно, подкрутить `cluster.fault_detection.follower_check.timeout` до 60s, но мне кажется это не выход. Проблема всегда с одной нодой

Вот во время инцидента из базы статистика. С node-00 пришла без задержек.

 ![image](https://us1.discourse-cdn.com/elastic/original/3X/1/d/1d1712c14bf335391e8db29040a095a15b6c8d26.png)

Кстати, ещё раз в 10 секунд снимает статистику [GitHub - opserver/Opserver: Stack Exchange's Monitoring System](https://github.com/opserver/Opserver)

---

<div class="post-metadata">

### Author: ![andrx](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/andrx/32/35028_2.png) [@andrx](https://discuss.elastic.co/u/andrx)
#### Post date: [October 15, 2019, 2:38pm UTC](https://discuss.elastic.co/t/7-3-2/201228/23 "2019-10-15T14:38:12Z")

</div>

мы тоже пытаемся перейти с ES6.8.2 на ES7.4. В моем случае данные не мигрировали, а заново были загружены. все вроде хорошо, ноды не уходят как у вас, но иногда такие же warnings, когда пытаемся грузить:

```
 [WARN][o.e.t.TransportService] [master-1] Received response for a request that has timed out, sent [12407ms] ago, timed out [2401ms] ago,
action [internal:coordination/fault_detection/follower_check], node [{data-1}{2kpk52EcT-KFIU7oH6CkRA}{6gLIJNVARFS8Y-5ec3jYGA}{10.15.1.227}{10.15.1.227:9300}{di}{xpack.installed=true, role=data}], id [2069258]

```

я не совсем понимаю, чем это может быть обусловлено и как можно проверить?

проверяем статус кластера через datadog - там никаких отклонений от норм.

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 15, 2019, 2:45pm UTC](https://discuss.elastic.co/t/7-3-2/201228/24 "2019-10-15T14:45:13Z")

</div>

Есть 3 попытки на follower\_check. У вас response вовремя приходит на 2 или 3. Поэтому нода и не отпадает.

Но да, это плохо. То, что без проблем работало и с большей нагрузкой в 6-ке плохо работает в 7-ке

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 15, 2019, 2:56pm UTC](https://discuss.elastic.co/t/7-3-2/201228/25 "2019-10-15T14:56:14Z")

</div>

А поможет ли переход на G1GC? У него ведь на порядок меньше задержки

---

<div class="post-metadata">

### Author: ![andrx](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/andrx/32/35028_2.png) [@andrx](https://discuss.elastic.co/u/andrx)
#### Post date: [October 15, 2019, 2:56pm UTC](https://discuss.elastic.co/t/7-3-2/201228/26 "2019-10-15T14:56:31Z")

</div>

a, вот нашел [здесь](https://www.elastic.co/guide/en/elasticsearch/reference/master/modules-discovery-settings.html). спасибо, @Denis_Lamanov , непонятно тогда почему это появилось, потому что настройки связанные с конфигурацией сети не меняли.

т.е. можно попробовать увеличить значение с десяти секунд на что-то другое, но наверное, это не выход.

Мне интересно, чему этот параметр равен в ES6.8? в документации к шестой версии ничего не сказано. Если это новая фича семерки, то какой аналог или как себя вела шестая версия?

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 15, 2019, 3:29pm UTC](https://discuss.elastic.co/t/7-3-2/201228/27 "2019-10-15T15:29:48Z")

</div>

В 6-ой версии тоже были настройки  
[https://www.elastic.co/guide/en/elasticsearch/reference/6.8/modules-discovery-zen.html](https://www.elastic.co/guide/en/elasticsearch/reference/6.8/modules-discovery-zen.html)  
Там `ping_timeout` был 30s  
В 7-ке принципиально новій механизм:

> **[A new era for cluster coordination in Elasticsearch](https://www.elastic.co/blog/a-new-era-for-cluster-coordination-in-elasticsearch)**
>
> Meet the new cluster coordination subsystem in Elasticsearch 7.0: simpler configuration, faster master elections, effortless cluster scaling, and improved resilience.

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 15, 2019, 3:55pm UTC](https://discuss.elastic.co/t/7-3-2/201228/28 "2019-10-15T15:55:11Z")

</div>

Мне кажется это всё и объясняет: раньше timeout был 30s и даже ваш @andrx первый респонс 12407ms влезал в него. Наши влезали со второй попытки

---

<div class="post-metadata">

### Author: ![andrx](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/andrx/32/35028_2.png) [@andrx](https://discuss.elastic.co/u/andrx)
#### Post date: [October 15, 2019, 4:02pm UTC](https://discuss.elastic.co/t/7-3-2/201228/29 "2019-10-15T16:02:54Z")

</div>

спасибо, понял. я сейчас поменяю на 30с, дам нагрузку потестирую кластер.  
у меня 13 нод по 32GB RAM, heap: 50%. думаешь G1GC подойдет для такого случая.

---

<div class="post-metadata">

### Author: ![andrx](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/andrx/32/35028_2.png) [@andrx](https://discuss.elastic.co/u/andrx)
#### Post date: [October 15, 2019, 10:36pm UTC](https://discuss.elastic.co/t/7-3-2/201228/30 "2019-10-15T22:36:44Z")

</div>

@Denis_Lamanov после стресс тестов такого warning'a не увидел. спасибо

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 16, 2019, 7:30am UTC](https://discuss.elastic.co/t/7-3-2/201228/31 "2019-10-16T07:30:47Z")

</div>

Аналогичная ситуация после изменения таймаута. Но причина думаю кроется в VM или GC.  
Сейчас тестируем G1GC на тестовом кластере

---

<div class="post-metadata">

### Author: ![andrx](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/andrx/32/35028_2.png) [@andrx](https://discuss.elastic.co/u/andrx)
#### Post date: [October 16, 2019, 12:16pm UTC](https://discuss.elastic.co/t/7-3-2/201228/32 "2019-10-16T12:16:03Z")

</div>

@Denis_Lamanov буду признателен, если поделитесь результатами

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 20, 2019, 7:07pm UTC](https://discuss.elastic.co/t/7-3-2/201228/33 "2019-10-20T19:07:20Z")

</div>

Единственная ошибка которая осталась:

```
[2019-10-20T19:03:03,414][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412594] overhead, spent [278ms] collecting in the last [1s]
[2019-10-20T19:03:04,415][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412595] overhead, spent [383ms] collecting in the last [1s]
[2019-10-20T19:03:09,533][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412596] overhead, spent [285ms] collecting in the last [1s]
[2019-10-20T19:03:10,249][ERROR][o.e.x.m.c.n.NodeStatsCollector] [node-06] collector [node_stats] timed out when collecting data
[2019-10-20T19:03:11,723][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412598] overhead, spent [279ms] collecting in the last [1s]
[2019-10-20T19:03:12,724][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412599] overhead, spent [270ms] collecting in the last [1s]
[2019-10-20T19:03:16,765][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412603] overhead, spent [366ms] collecting in the last [1s]

```

И как всегда Игорь был прав: статистика часто падает с таймаутом и в этот момент на этой ноде трафик индексации проседает на пару секунд. Всё что извне требует статистику по нодам я отключил: Кибану, наш сервис.

Это такой баг или упёрлись в какой-то ресурс?  
Как можно увеличить таймаут?

---

<div class="post-metadata">

### Author: ![Igor\_Motov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/igor_motov/32/45193_2.png) [@Igor\_Motov](https://discuss.elastic.co/u/Igor_Motov)
#### Post date: [October 21, 2019, 12:56pm UTC](https://discuss.elastic.co/t/7-3-2/201228/34 "2019-10-21T12:56:10Z")

</div>

Надо выяснить почему такие длинные GC. `logs/gc.log` куда-нибудь выложить можете?

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 21, 2019, 3:07pm UTC](https://discuss.elastic.co/t/7-3-2/201228/35 "2019-10-21T15:07:10Z")

</div>

Лог с мастера: [https://drive.google.com/file/d/1YBttuU96bubcnlw915p20FhQYSQXZOew/view?usp=sharing](https://drive.google.com/file/d/1YBttuU96bubcnlw915p20FhQYSQXZOew/view?usp=sharing)

---

<div class="post-metadata">

### Author: ![Igor\_Motov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/igor_motov/32/45193_2.png) [@Igor\_Motov](https://discuss.elastic.co/u/Igor_Motov)
#### Post date: [October 21, 2019, 4:40pm UTC](https://discuss.elastic.co/t/7-3-2/201228/36 "2019-10-21T16:40:56Z")

</div>

Там нет, к сожалению, того, что я искал. Вы не поищите в прошлых gc.log последнюю строку `MaxNewSize` и не пришлете ее сюда?

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 21, 2019, 4:42pm UTC](https://discuss.elastic.co/t/7-3-2/201228/37 "2019-10-21T16:42:36Z")

</div>

Сделаю. Поищу и на всех нодах

---

<div class="post-metadata">

### Author: ![Igor\_Motov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/igor_motov/32/45193_2.png) [@Igor\_Motov](https://discuss.elastic.co/u/Igor_Motov)
#### Post date: [October 21, 2019, 4:43pm UTC](https://discuss.elastic.co/t/7-3-2/201228/38 "2019-10-21T16:43:39Z")

</div>

Желательно на том узле, с которого вы прислали последний gc.log. Кстати, на мастере вы видите строки типа:

```auto
[2019-10-20T19:03:16,765][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412603] overhead, spent [366ms] collecting in the last [1s]

```

Если нет - то мне нужна вся эта информация с узлов, на которых это GC появляются в логах.

---

<div class="post-metadata">

### Author: ![Denis\_Lamanov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/denis_lamanov/32/13111_2.png) [@Denis\_Lamanov](https://discuss.elastic.co/u/Denis_Lamanov)
#### Post date: [October 21, 2019, 6:14pm UTC](https://discuss.elastic.co/t/7-3-2/201228/39 "2019-10-21T18:14:07Z")

</div>

На этой же ноде(мастере) в gc.log за октябрь нет строк с `MaxNewSize`. Только в марте  
На других нода во всех gc.log тоже нет таких строк

```auto
[2019-10-20T19:03:16,765][INFO][o.e.m.j.JvmGcMonitorService] [node-06] [gc][412603] overhead, spent [366ms] collecting in the last [1s]

```

Да, на мастере и на остальных нода такие записи постоянны

Логи Эластика за сегодня с мастера и другой ноды  
Сейчас мы убрали где-то четверть нагрузки и четверть шард для разгрузки.  
Хотим роль мастера повесить на отдельную виртуалку и сделать полный кластера  
Этот кластер и раньше прокачивал такой трафик и даже на четверть больше и таких проблем не было на 6.8 и даже на 7.3.2

[https://drive.google.com/drive/folders/1Iejb1Oh4jh-BxpBigJflBd-thcgulN-K?usp=sharing](https://drive.google.com/drive/folders/1Iejb1Oh4jh-BxpBigJflBd-thcgulN-K?usp=sharing)

---

<div class="post-metadata">

### Author: ![Igor\_Motov](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/igor_motov/32/45193_2.png) [@Igor\_Motov](https://discuss.elastic.co/u/Igor_Motov)
#### Post date: [October 21, 2019, 6:27pm UTC](https://discuss.elastic.co/t/7-3-2/201228/40 "2019-10-21T18:27:59Z")

</div>

По ссылке появляется пустая папка. Наверное, ничего еще не загрузилось. Давайте тогда `GET _nodes` и `GET _nodes/stats` посмотрим. Надо посмотреть, как вы эти узлы настроили. У меня такое впечатление, что вы им больше чем [30 гигов](https://www.elastic.co/blog/a-heap-of-trouble) хипа дали.

[Previous page](https://discuss.elastic.co/t/7-3-2/201228.md?page=1)

[Next page](https://discuss.elastic.co/t/7-3-2/201228.md?page=3)
