# Bulk indexing rejected threads

**URL:** https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679
**Category:** Elasticsearch
**Created:** [March 16, 2020, 1:29am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679 "2020-03-16T01:29:57Z")
**Posts on this page:** 15
**Page:** 1

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 1:29am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/1 "2020-03-16T01:29:58Z")

</div>

Hello, I am pretty new to elasticsearch I made my project and everything works really well except bulk indexing. The problem is I am getting alot of rejected write threads. I looked up thread pool and I got this:  
node\_name write 0 0 121044

My current configuration of index is 100 primary shards and 0 replicas. I am running this on single node(32gb heap size, database is stored on NVMe storage,8core/16thread AMD cpu).  
my index:  
{  
"mapping": {  
"\_doc": {  
"properties": {  
"hash": {  
"type": "text",  
"fields": {  
"keyword": {  
"type": "keyword",  
"ignore\_above": 256  
}  
}  
},  
"uri": {  
"type": "text",  
"fields": {  
"keyword": {  
"type": "keyword",  
"ignore\_above": 256  
}  
}  
},  
"path": {  
"type": "text",  
"fields": {  
"keyword": {  
"type": "keyword",  
"ignore\_above": 256  
}  
}  
}  
}  
}  
}  
}  
hash- 600-700 character string(the field I am searching using query\_string)  
url/path - 100 characters max.  
each document is around 1-1.2kb, I will be having 800 million documents ~915GB data.  
I am using NEST to do the BULK index with settings:  
BackOffRetries 10  
BackOffTime 5 seconds  
MaxDegreeOfParallelism 5  
Size 5000

With my experience I couldn't resolve it. I would appreciate if someone points me to right the direction 😃

---

<div class="post-metadata">

### Author: ![warkolm](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/warkolm/32/39224_2.png) [@warkolm](https://discuss.elastic.co/u/warkolm)
#### Post date: [March 16, 2020, 1:33am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/2 "2020-03-16T01:33:32Z")

</div>

> [@adrian\_luighi](#):
>
> My current configuration of index is 100 primary shards and 0 replicas. I am running this on single node(32gb heap size, database is stored on NVMe storage,8core/16thread AMD cpu).

That's way too many shards, why did you pick this?

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 1:53am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/3 "2020-03-16T01:53:42Z")

</div>

I read article that I needed 1 shard per 5mil documents

EDIT: how many shards should I use for my use case?

---

<div class="post-metadata">

### Author: ![warkolm](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/warkolm/32/39224_2.png) [@warkolm](https://discuss.elastic.co/u/warkolm)
#### Post date: [March 16, 2020, 2:00am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/4 "2020-03-16T02:00:00Z")

</div>

Not sure what article that is, but I'd suggest it's not accurate, and you're wasting resources with such a large shard count.

Aim for 30-50GB per shard instead.

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 2:04am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/5 "2020-03-16T02:04:55Z")

</div>

Alright understood I will reduce shard amount to 35. One small question tho, do I need replicas?

---

<div class="post-metadata">

### Author: ![warkolm](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/warkolm/32/39224_2.png) [@warkolm](https://discuss.elastic.co/u/warkolm)
#### Post date: [March 16, 2020, 2:06am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/6 "2020-03-16T02:06:34Z")

</div>

You only have a single node cluster, so it's not really relevant if you have them or not 🙂

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 2:21am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/7 "2020-03-16T02:21:13Z")

</div>

Actually reducing shard amount resolved my issue. I am no longer getting rejected writes and I've indexed ~500 thousand document right now. Will be updating this thread after a day or two after testing. Thank you.

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 5:35am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/8 "2020-03-16T05:35:52Z")

</div>

It still happens but it happens way less times. Where can I see logs so I can see whats happening?

---

<div class="post-metadata">

### Author: ![warkolm](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/warkolm/32/39224_2.png) [@warkolm](https://discuss.elastic.co/u/warkolm)
#### Post date: [March 16, 2020, 6:47am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/9 "2020-03-16T06:47:03Z")

</div>

Check Monitoring to see what is happening, are you hitting disk or CPU limits?

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 8:05am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/10 "2020-03-16T08:05:46Z")

</div>

I barely saturate CPU and storage(raid 0 nvme). I can't setup HeartBeat I get the error:  
[invalid\_index\_name\_exception] Invalid index name [_security], must not start with '_', '-', or '+', with { index\_uuid="_na_" & index="\_security" }: Check the Elasticsearch Monitoring cluster network connection or the load level of the nodes.

---

<div class="post-metadata">

### Author: ![Christian\_Dahlqvist](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/christian_dahlqvist/32/4617_2.png) [@Christian\_Dahlqvist](https://discuss.elastic.co/u/Christian_Dahlqvist)
#### Post date: [March 16, 2020, 8:37am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/11 "2020-03-16T08:37:28Z")

</div>

Are you indexing new documents only or are you also performing updates?

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 8:54am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/12 "2020-03-16T08:54:46Z")

</div>

before I bulk index I set update interval to -1 then bulk index with parameters mentioned above and after it's done I set back interval to 1s thats it. indexing MAY happen in parallel.

---

<div class="post-metadata">

### Author: ![Christian\_Dahlqvist](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/christian_dahlqvist/32/4617_2.png) [@Christian\_Dahlqvist](https://discuss.elastic.co/u/Christian_Dahlqvist)
#### Post date: [March 16, 2020, 9:33am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/13 "2020-03-16T09:33:12Z")

</div>

That does not answer my question.

---

<div class="post-metadata">

### Author: ![adrian\_luighi](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/adrian_luighi/32/60470_2.png) [@adrian\_luighi](https://discuss.elastic.co/u/adrian_luighi)
#### Post date: [March 16, 2020, 9:41am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/14 "2020-03-16T09:41:55Z")

</div>

What you mean in updates? if you mean updating existing ones no.

---

<div class="post-metadata">

### Author: ![system](https://us1.discourse-cdn.com/elastic/original/3X/1/a/1ac57faf039f6b580b3f104ef42a2a89e41014de.png) [@system](https://discuss.elastic.co/u/system)
#### Post date: [April 13, 2020, 9:42am UTC](https://discuss.elastic.co/t/bulk-indexing-rejected-threads/223679/15 "2020-04-13T09:42:01Z")

</div>

This topic was automatically closed 28 days after the last reply. New replies are no longer allowed.
