# Ingestion en double dans elastic search

**URL:** https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478
**Category:** Discussions en français
**Created:** [April 30, 2020, 7:05am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478 "2020-04-30T07:05:49Z")
**Posts on this page:** 8
**Page:** 1

<div class="post-metadata">

### Author: ![Youssef\_SBAI](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/youssef_sbai/32/64242_2.png) [@Youssef\_SBAI](https://discuss.elastic.co/u/Youssef_SBAI)
#### Post date: [April 30, 2020, 7:05am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/1 "2020-04-30T07:05:49Z")

</div>

Bonjour

J'utilise Logstsh et file beat pour l'ingestion d'un fichier csv dans Elastic j'ai remarquer que mes data double de volume dans elastic search pouvez vous m'expliquer pourquoi ??

bien cordialement

---

<div class="post-metadata">

### Author: ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)
#### Post date: [April 30, 2020, 7:25am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/2 "2020-04-30T07:25:58Z")

</div>

Ca depend du mapping. Mais en gros (c'est très schématique), chaque champ texte est mis 3 fois dans elasticsearch avec le mapping par défaut:

- dans l'index inversé pour la recherche fulltext
- sous forme orienté colonne pour les aggregations et les tris
- sous forme brute dans `_source`

---

<div class="post-metadata">

### Author: ![Youssef\_SBAI](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/youssef_sbai/32/64242_2.png) [@Youssef\_SBAI](https://discuss.elastic.co/u/Youssef_SBAI)
#### Post date: [April 30, 2020, 7:40am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/3 "2020-04-30T07:40:23Z")

</div>

ce mapping est il possible de changer pour avoir le meme nombre de ligne dans elastic?

---

<div class="post-metadata">

### Author: ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)
#### Post date: [April 30, 2020, 8:16am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/4 "2020-04-30T08:16:33Z")

</div>

Si tu n'as pas envie de chercher, tu peux désactiver toute l'indexation et que stocker dans `_source`. Mais ça n'a pas trop d'intérêt.  
Si tu ne veux pas faire d'aggrégation, supprime le champ `keyword` du mapping.  
Si tu ne veux pas récupérer le document source mais juste faire des aggrégations, disable le champ `_source`.

MAIS. A mon avis, il faut partir du besoin et laisser la technique de côté. Est-ce que tu veux être capable de rechercher dans tes lignes de CSV? Si oui, tu auras besoin d'indexer.  
Est-ce que tu veux faire du calcul aggrégé ? Tu auras besoin d'un champ de type keyword. Ou tu peux activer `fielddata` mais ça te coutera plus cher en HEAP.  
Veux-tu être capable de visualiser tout ton document dans les résultats ? Conserve `_source` alors.

Je te conseille toutefois de regarder champ par champ ce que tu veux faire pour optimiser le mapping en supprimant là où ce n'est pas nécessaire les champs `keyword` ou les champs `text`.  
Voici par exemple un mapping que j'utilise pour injecter dans une démo 1 million de documents. Ca prend environ 180 Mo sur disque:

> <https://github.com/dadoonet/legacy-search/blob/03-mapping/src/main/resources/elasticsearch/person/_settings.json>

Est-ce que tu as un problème d'espace disque ?

---

<div class="post-metadata">

### Author: ![Youssef\_SBAI](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/youssef_sbai/32/64242_2.png) [@Youssef\_SBAI](https://discuss.elastic.co/u/Youssef_SBAI)
#### Post date: [April 30, 2020, 8:34am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/5 "2020-04-30T08:34:22Z")

</div>

je voulais visualiser tout mon document mais dans ma visualisation cependant j'ai des visualisation en double  
par exemple si j'intègre un fichier de 14 000 ligne elastic il ingére 28000doc c'est normal? je souhaite conserver mes 14000 ligne dans elastic

---

<div class="post-metadata">

### Author: ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)
#### Post date: [April 30, 2020, 9:41am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/6 "2020-04-30T09:41:19Z")

</div>

Aussi à lire: [https://www.elastic.co/guide/en/elasticsearch/reference/current/tune-for-disk-usage.html](https://www.elastic.co/guide/en/elasticsearch/reference/current/tune-for-disk-usage.html)

---

<div class="post-metadata">

### Author: ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)
#### Post date: [April 30, 2020, 9:42am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/7 "2020-04-30T09:42:22Z")

</div>

C'est une autre question (il vaut mieux créer une autre discussion) à laquelle j'ai répondu ici:

> [@Ingestion of several double lines in elastic research](https://discuss.elastic.co/t/ingestion-of-several-double-lines-in-elastic-research/229682/3):
>
> I moved the question to #beats:filebeat. Have a look at [https://www.elastic.co/guide/en/beats/filebeat/current/filebeat-deduplication.html](https://www.elastic.co/guide/en/beats/filebeat/current/filebeat-deduplication.html)

---

<div class="post-metadata">

### Author: ![system](https://us1.discourse-cdn.com/elastic/original/3X/1/a/1ac57faf039f6b580b3f104ef42a2a89e41014de.png) [@system](https://discuss.elastic.co/u/system)
#### Post date: [May 28, 2020, 9:57am UTC](https://discuss.elastic.co/t/ingestion-en-double-dans-elastic-search/230478/8 "2020-05-28T09:57:47Z")

</div>

This topic was automatically closed 28 days after the last reply. New replies are no longer allowed.
