# Reading structured streaming data from Elasticsearch into Spark using Python

**URL:** <https://discuss.elastic.co/t/reading-structured-streaming-data-from-elasticsearch-into-spark-using-python/298815>\
**Category:** Elasticsearch\
**Tags:** es-hadoop\
**Created:** [March 4, 2022, 6:17am UTC](https://discuss.elastic.co/t/reading-structured-streaming-data-from-elasticsearch-into-spark-using-python/298815 "2022-03-04T06:17:50Z")\
**Posts on this page:** 4\
**Page:** 1

<div class="post-metadata">

**Author:** ![saurab](https://avatars.discourse-cdn.com/v4/letter/s/e274bd/32.png) [@saurab](https://discuss.elastic.co/u/saurab)\
**Post date:** [March 4, 2022, 6:17am UTC](https://discuss.elastic.co/t/reading-structured-streaming-data-from-elasticsearch-into-spark-using-python/298815/1 "2022-03-04T06:17:50Z")

</div>

I believe Elasticsearch supports Spark Structured Streaming since version 6. I have seen examples of WRITING structured streaming data from spark to Elasticsearch in append mode. But I have not seen a single example of reading from Elasticsearch.

For example, here is how you write to ES:

```auto
query = df.writeStream \
.outputMode("append") \
.queryName("writing_to_es") \
.format("org.elasticsearch.spark.sql") \
.option("checkpointLocation", "/tmp/") \
.option("es.resource", "index/type") \
.option("es.nodes", "localhost") \
.start()

query.awaitTermination()

```

But how do you read from ES using spark structured streaming ? Please share an example .....

Thanks,  
Saurab

---

<div class="post-metadata">

**Author:** ![Keith\_Massey](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/keith_massey/32/83666_2.png) [@Keith\_Massey](https://discuss.elastic.co/u/Keith_Massey)\
**Post date:** [March 4, 2022, 4:00pm UTC](https://discuss.elastic.co/t/reading-structured-streaming-data-from-elasticsearch-into-spark-using-python/298815/2 "2022-03-04T16:00:30Z")

</div>

Hi @saurab. As you mention, es-spark does support writing to Elasticsearch with spark structured streaming. But it does not support reading from Elasticsearch as a spark structured streaming source.

---

<div class="post-metadata">

**Author:** ![Keith\_Massey](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/keith_massey/32/83666_2.png) [@Keith\_Massey](https://discuss.elastic.co/u/Keith_Massey)\
**Post date:** [March 4, 2022, 4:34pm UTC](https://discuss.elastic.co/t/reading-structured-streaming-data-from-elasticsearch-into-spark-using-python/298815/3 "2022-03-04T16:34:13Z")

</div>

Here is the ticket for the work -- [Support Spark Structured Streaming read from ES · Issue #1227 · elastic/elasticsearch-hadoop · GitHub](https://github.com/elastic/elasticsearch-hadoop/issues/1227). The problem is that we currently don't have an efficient way to listen for changes to an Elasticsearch index.

---

<div class="post-metadata">

**Author:** ![system](https://us1.discourse-cdn.com/elastic/original/3X/1/a/1ac57faf039f6b580b3f104ef42a2a89e41014de.png) [@system](https://discuss.elastic.co/u/system)\
**Post date:** [April 1, 2022, 4:34pm UTC](https://discuss.elastic.co/t/reading-structured-streaming-data-from-elasticsearch-into-spark-using-python/298815/4 "2022-04-01T16:34:59Z")

</div>

This topic was automatically closed 28 days after the last reply. New replies are no longer allowed.
