# Runtime Environment Requirement for FS Crawler

**URL:** <https://discuss.elastic.co/t/runtime-environment-requirement-for-fs-crawler/312753>\
**Category:** Elasticsearch\
**Created:** [August 24, 2022, 2:31am UTC](https://discuss.elastic.co/t/runtime-environment-requirement-for-fs-crawler/312753 "2022-08-24T02:31:35Z")\
**Posts on this page:** 3\
**Page:** 1

<div class="post-metadata">

**Author:** ![zxuz111](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/zxuz111/32/100222_2.png) [@zxuz111](https://discuss.elastic.co/u/zxuz111)\
**Post date:** [August 24, 2022, 2:31am UTC](https://discuss.elastic.co/t/runtime-environment-requirement-for-fs-crawler/312753/1 "2022-08-24T02:31:35Z")

</div>

We are planning to deploy FS Crawler to the VM on Azure, and I am trying to provisioning the VM. Here is the information to support the provision:

- OS: Ubuntu 20.4
- PDF files total size: 1.5 TB
- FS Crawler Schedule: Set a OS daily cron job to run FS Crawler once per day

As per FS Crawler documentation ([Tips and tricks — FSCrawler 2.10-SNAPSHOT documentation](https://fscrawler.readthedocs.io/en/latest/user/tips.html)), it will generate huge temporary files, and we can set cron job to do cleanup periodically. This raise a concern when I do the provisioning the VM on cloud. Can anyone recommend what kind of configuration I need for the VM, such as number of CPU cores, storage?

Any help will be greatly appreciated.

---

<div class="post-metadata">

**Author:** ![dadoonet](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/dadoonet/32/137187_2.png) [@dadoonet](https://discuss.elastic.co/u/dadoonet)\
**Post date:** [August 25, 2022, 12:07pm UTC](https://discuss.elastic.co/t/runtime-environment-requirement-for-fs-crawler/312753/2 "2022-08-25T12:07:39Z")

</div>

> [@zxuz111](#):
>
> As per FS Crawler documentation ([Tips and tricks — FSCrawler 2.10-SNAPSHOT documentation](https://fscrawler.readthedocs.io/en/latest/user/tips.html)), it will generate huge temporary files

I think this advice in the documentation only applies to media files and specifically mp4 videos.  
Is that what you want to index?

---

<div class="post-metadata">

**Author:** ![system](https://us1.discourse-cdn.com/elastic/original/3X/1/a/1ac57faf039f6b580b3f104ef42a2a89e41014de.png) [@system](https://discuss.elastic.co/u/system)\
**Post date:** [September 22, 2022, 12:08pm UTC](https://discuss.elastic.co/t/runtime-environment-requirement-for-fs-crawler/312753/3 "2022-09-22T12:08:33Z")

</div>

This topic was automatically closed 28 days after the last reply. New replies are no longer allowed.
