# Could not see OCR text in "content" field

**URL:** <https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653>\
**Category:** Elasticsearch\
**Created:** [June 25, 2020, 11:39am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653 "2020-06-25T11:39:31Z")\
**Posts on this page:** 20\
**Page:** 1

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [June 25, 2020, 11:39am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/1 "2020-06-25T11:39:31Z")

</div>

I am using fs crawler with below settings

```auto
---
name: "test2"
fs:
  url: "/home/local/es"
  update_rate: "2m"
  excludes:
  - "*/~*"
  json_support: false
  filename_as_id: false
  add_filesize: true
  remove_deleted: true
  add_as_inner_object: false
  store_source: false
  index_content: true
  attributes_support: false
  raw_metadata: false
  xml_support: false
  index_folders: true
  lang_detect: true
  continue_on_error: false
  ocr:
    enabled: true
    language: "eng"
    path: "/home/local/bin"
    data_path: "/home/local/share/tessdata"
    pdf_strategy: "ocr_and_text"
  follow_symlinks: false
elasticsearch:
  nodes:
  - url: "http://127.0.0.1:9200"
  bulk_size: 100
  flush_interval: "5s"
  byte_size: "10mb"

```

started with

```auto
./fscrawler --restart --trace

```

No error in OCR.Still not able to see the OCR text both for image,pdf and tiff

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [June 25, 2020, 11:44am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/2 "2020-06-25T11:44:03Z")

</div>

```auto
13:30:54,074 DEBUG [f.p.e.c.f.c.v.ElasticsearchClientV7] wait for yellow health on index [test2_folder]
13:30:54,077 TRACE [f.p.e.c.f.c.v.ElasticsearchClientV7] health response: {"cluster_name":"elasticsearch","status":"yellow","timed_out":false,"number_of_nodes":1,"number_of_data_nodes":1,"active_primary_shards":1,"active_shards":1,"relocating_shards":0,"initializing_shards":0,"unassigned_shards":1,"delayed_unassigned_shards":0,"number_of_pending_tasks":0,"number_of_in_flight_fetch":0,"task_max_waiting_in_queue_millis":0,"active_shards_percent_as_number":61.111111111111114}
13:30:54,080 DEBUG [f.p.e.c.f.FsParserAbstract] creating fs crawler thread [test2] for [/home/local/es] every [2m]
13:30:54,080 INFO [f.p.e.c.f.FsParserAbstract] FS crawler started for [test2] for [/home/local/es] every [2m]
13:30:54,080 DEBUG [f.p.e.c.f.FsParserAbstract] Fs crawler thread [test2] is now running. Run #1...
13:30:54,088 DEBUG [f.p.e.c.f.f.FsCrawlerUtil] computeVirtualPathName(/home/local/es, /home/local/es) = /
13:30:54,091 DEBUG [f.p.e.c.f.FsParserAbstract] Indexing test2_folder/8a4fb678d07a821dbc3abeb4aeb337a?pipeline=null
13:30:54,091 TRACE [f.p.e.c.f.FsParserAbstract] JSon indexed : {
  "root" : "bd7d7b2d64521cab5e6db3ff54a0711c",
  "virtual" : "/",
  "real" : "/home/local/es"
}
13:30:54,094 DEBUG [f.p.e.c.f.FsParserAbstract] indexing [/home/local/es] content
13:30:54,094 DEBUG [f.p.e.c.f.c.f.FileAbstractorFile] Listing local files from /home/local/es
13:30:54,099 DEBUG [f.p.e.c.f.c.f.FileAbstractorFile] 3 local files found
13:30:54,100 TRACE [f.p.e.c.f.FsParserAbstract] FileAbstractModel = FileAbstractModel{name='test-ocr.pdf', file=true, directory=false, lastModifiedDate=2020-06-25T12:13:16.999936, creationDate=2020-06-25T12:13:16.999936, accessDate=2020-06-25T12:13:16.999936, path='/home/local/es', owner='', group='', permissions=777, extension='pdf', fullpath='/home/local/es/test-ocr.pdf', size=112983}
13:30:54,100 DEBUG [f.p.e.c.f.f.FsCrawlerUtil] computeVirtualPathName(/home/local/es, /home/local/es/test-ocr.pdf) = /test-ocr.pdf
13:30:54,100 DEBUG [f.p.e.c.f.f.FsCrawlerUtil] directory = [false], filename = [/test-ocr.pdf], includes = [null], excludes = [[*/~*]]
13:30:54,100 DEBUG [f.p.e.c.f.f.FsCrawlerUtil] filename = [/test-ocr.pdf], excludes = [[*/~*]]
13:30:54,100 TRACE [f.p.e.c.f.f.FsCrawlerUtil] regex is [.*?/~.*?]
13:30:54,101 TRACE [f.p.e.c.f.f.FsCrawlerUtil] does not match any exclude pattern
13:30:54,101 DEBUG [f.p.e.c.f.f.FsCrawlerUtil] filename = [/test-ocr.pdf], includes = [null]
13:30:54,101 TRACE [f.p.e.c.f.f.FsCrawlerUtil] no include rules
13:30:54,101 DEBUG [f.p.e.c.f.FsParserAbstract] [/test-ocr.pdf] can be indexed: [true]
13:30:54,101 DEBUG [f.p.e.c.f.FsParserAbstract] - file: /test-ocr.pdf
13:30:54,101 DEBUG [f.p.e.c.f.FsParserAbstract] fetching content from [/home/local/es],[test-ocr.pdf]
13:30:54,104 DEBUG [f.p.e.c.f.f.FsCrawlerUtil] computeVirtualPathName(/home/local/es, /home/local/es/test-ocr.pdf) = /test-ocr.pdf
13:30:54,105 TRACE [f.p.e.c.f.t.TikaDocParser] Generating document [/home/local/es/test-ocr.pdf]
13:30:54,113 TRACE [f.p.e.c.f.t.TikaDocParser] Beginning Tika extraction
13:30:54,128 DEBUG [f.p.e.c.f.t.TikaInstance] OCR is activated.
13:30:54,164 DEBUG [f.p.e.c.f.t.TikaInstance] OCR strategy for PDF documents is [ocr_and_text] and tesseract was found.
13:30:54,472 WARN [o.a.t.p.PDFParser] J2KImageReader not loaded. JPEG2000 files will not be processed.
See https://pdfbox.apache.org/2.0/dependencies.html#jai-image-io
for optional dependencies.

13:30:54,755 DEBUG [f.p.e.c.f.t.TikaInstance] OCR is activated so we need to configure Tesseract in case we have specific settings.
13:30:54,756 DEBUG [f.p.e.c.f.t.TikaInstance] Tesseract Path set to [/home/local/bin].
13:30:54,756 DEBUG [f.p.e.c.f.t.TikaInstance] Tesseract Data Path set to [/home/local/share/tessdata].
13:30:54,756 DEBUG [f.p.e.c.f.t.TikaInstance] Tesseract Language set to [eng].
13:30:56,277 TRACE [f.p.e.c.f.t.TikaDocParser] End of Tika extraction
13:30:56,285 TRACE [f.p.e.c.f.t.TikaDocParser] End document generation
13:30:56,285 TRACE [f.p.e.c.f.f.FsCrawlerUtil] No pattern always matches.
13:30:56,298 DEBUG [f.p.e.c.f.FsParserAbstract] Indexing test2/2e9faf9314bd6ea61ede8b7559f253b?pipeline=null
13:30:56,298 TRACE [f.p.e.c.f.FsParserAbstract] JSon indexed : {
  "content" : "\n \n\n \n\nThis file also contains text. \n\n \n\n\n\nThis second part of the text is in Page 2 \n\n \n\n\n",
  "meta" : {
    "author" : "David Pilato",
    "title" : "Test Tika title",
    "date" : "2019-03-02T11:42:36.000+00:00",
    "keywords" : ["keyword1", " keyword2"],
    "language" : "en-US",
    "format" : "application/pdf; version=1.7",
    "creator_tool" : "Microsoft Word",
    "description" : "Test Tika Object",
    "created" : "2019-03-02T11:42:36.000+00:00"
  },
  "file" : {
    "extension" : "pdf",
    "content_type" : "application/pdf",
    "created" : "2020-06-25T10:13:16.999+00:00",
    "last_modified" : "2020-06-25T10:13:16.999+00:00",
    "last_accessed" : "2020-06-25T10:13:16.999+00:00",
    "indexing_date" : "2020-06-25T11:30:54.103+00:00",
    "filesize" : 112983,
    "filename" : "test-ocr.pdf",
    "url" : "file:///home/local/es/test-ocr.pdf"
  },
  "path" : {
    "root" : "8a4fb678d07a821dbc3abeb4aeb337a",
    "virtual" : "/test-ocr.pdf",
    "real" : "/home/local/es/test-ocr.pdf"
  }
}
13:30:56,298 TRACE [f.p.e.c.f.FsParserAbstract] FileAbstractModel = FileAbstractModel{name='index.png', file=true, directory=false, lastModifiedDate=2020-06-25T12:31:29.664488, creationDate=2020-06-25T12:31:29.664488, accessDate=2020-06-25T12:31:29.664488, path='/home/local/es', owner='', 

```

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [June 25, 2020, 11:48am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/3 "2020-06-25T11:48:53Z")

</div>

Please format your code, logs or configuration files using `</>` icon as explained in [this guide](https://discuss.elastic.co/t/about-the-elasticsearch-category/21) and not the citation button. It will make your post more readable.

Or use markdown style like:

````
```
CODE
```

````

This is the icon to use if you are not using markdown format:

 ![image](https://us1.discourse-cdn.com/elastic/original/3X/7/e/7e6e239431ec2d71cbf1beef741f2e93e7cc762c.jpg)

There's a live preview panel for exactly this reasons.

Lots of people read these forums, and many of them will simply skip over a post that is difficult to read, because it's just too large an investment of their time to try and follow a wall of badly formatted text.  
If your goal is to get an answer to your questions, it's in your interest to make it as easy to read and understand as possible.  
Please update your post.

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [June 25, 2020, 3:41pm UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/4 "2020-06-25T15:41:49Z")

</div>

Thanks for your reply. I did the formatting. Could you please check and revert.

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [June 26, 2020, 3:59pm UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/5 "2020-06-26T15:59:18Z")

</div>

Indeed. Some text is missing.

Are you able to run `/home/local/bin/tesseract`?

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [June 26, 2020, 6:26pm UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/6 "2020-06-26T18:26:26Z")

</div>

Yes.. Tesseract is running.. But not recognizing the text.. Value is coming as "/n"  
And my tesseract executable file in /home/local/bin

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [June 26, 2020, 11:48pm UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/7 "2020-06-26T23:48:59Z")

</div>

Could you share the output of:

```
ls -l /home/local/bin/tesseract
```

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [June 27, 2020, 3:40am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/8 "2020-06-27T03:40:36Z")

</div>

![Screenshot from 2020-06-27 05-39-12](https://us1.discourse-cdn.com/elastic/original/3X/9/e/9e9503a9099449b275cf390573ecbf83ab3b323a.png)

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [July 2, 2020, 9:55am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/9 "2020-07-02T09:55:24Z")

</div>

That's weird.

What is the version of tesseract?

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [July 2, 2020, 4:16pm UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/10 "2020-07-02T16:16:44Z")

</div>

i used both 4.1.1 and 3.02.02, but none of these are working.

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [July 3, 2020, 10:01am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/11 "2020-07-03T10:01:13Z")

</div>

That's weird. I honestly don't know. I would need to try on a proper installation. May be it's related to this `J2KImageReader` warning message.... I have an opened issue about this one.

> <https://github.com/dadoonet/fscrawler/issues/927>
>
> Even though we manually add to the lib dir:
> for JBIG2 images, you need to add levigo-jbig2-imageio:2.0 library
> for TIFF images, you need...

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [July 3, 2020, 10:36am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/12 "2020-07-03T10:36:01Z")

</div>

Sending you the tessdata screenshot. Please check if it is adequate or not?

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [July 3, 2020, 10:37am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/13 "2020-07-03T10:37:03Z")

</div>

![image](https://us1.discourse-cdn.com/elastic/original/3X/2/b/2b0e5d3204078c94e5a1ae949a1ead37f7755daf.png)

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [July 3, 2020, 10:56am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/14 "2020-07-03T10:56:20Z")

</div>

I don't know. Best thing to do would be to make an image like a PNG and send it on the command line to tesseract to check that it runs correctly.

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [July 3, 2020, 11:58am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/15 "2020-07-03T11:58:08Z")

</div>

Thanks for the help.I finally got the issue.

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [July 3, 2020, 2:13pm UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/16 "2020-07-03T14:13:15Z")

</div>

Could you share what happened as it could be super useful for others? Thanks

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [July 6, 2020, 4:18am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/17 "2020-07-06T04:18:45Z")

</div>

Along with leptonica, we need to install couple of libraries(libpng/libjpeg/libtiff) to perform the ocr on png/jpeg.

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [July 6, 2020, 5:46am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/18 "2020-07-06T05:46:39Z")

</div>

Great to know. Is it something we should document In the project?

---

<div class="post-metadata">

**Author:** ![saikat189](https://avatars.discourse-cdn.com/v4/letter/s/41988e/32.png) [@saikat189](https://discuss.elastic.co/u/saikat189)\
**Post date:** [July 6, 2020, 7:40am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/19 "2020-07-06T07:40:23Z")

</div>

Not really. It should be documented in Tesseract Installation.

---

<div class="post-metadata">

**Author:** ![system](https://us1.discourse-cdn.com/elastic/original/3X/1/a/1ac57faf039f6b580b3f104ef42a2a89e41014de.png) [@system](https://discuss.elastic.co/u/system)\
**Post date:** [August 3, 2020, 7:40am UTC](https://discuss.elastic.co/t/could-not-see-ocr-text-in-content-field/238653/20 "2020-08-03T07:40:37Z")

</div>

This topic was automatically closed 28 days after the last reply. New replies are no longer allowed.
