# クローラについて

**URL:** https://discuss.elastic.co/t/topic/153890
**Category:** 日本語による質問・議論はこちら
**Created:** [October 25, 2018, 1:24am UTC](https://discuss.elastic.co/t/topic/153890 "2018-10-25T01:24:15Z")
**Posts on this page:** 7
**Page:** 1

<div class="post-metadata">

### Author: ![norinori](https://avatars.discourse-cdn.com/v4/letter/n/ec9cab/32.png) [@norinori](https://discuss.elastic.co/u/norinori)
#### Post date: [October 25, 2018, 1:24am UTC](https://discuss.elastic.co/t/topic/153890/1 "2018-10-25T01:24:15Z")

</div>

定期的にファイルサーバー内のファイルの中身をElasticsearchでインデックス化したいのですが、インデックス化対象のファイルにはCADファイル(複数形式)があり、作り込みが必要と考えています。  
機能拡張可能なクローラ？またはLogstashのプラグインを作成？など情報があれば教えて頂きたいと思います。

---

<div class="post-metadata">

### Author: ![tsgkdt](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/tsgkdt/32/39151_2.png) [@tsgkdt](https://discuss.elastic.co/u/tsgkdt)
#### Post date: [October 26, 2018, 6:07am UTC](https://discuss.elastic.co/t/topic/153890/2 "2018-10-26T06:07:15Z")

</div>

CADファイル（複数形式）のところについて

既にご存知かもしれませんが、  
ElasticsearchのIngestNodeでファイルからテキストを抽出するのには、Apache Tikaを使っています。

> **[Ingest Attachment plugin | Elasticsearch Plugins and Integrations \[master\] |...](https://www.elastic.co/guide/en/elasticsearch/plugins/master/ingest-attachment.html)**

> The ingest attachment plugin lets Elasticsearch extract file attachments in common formats (such as PPT, XLS, and PDF) by using the Apache text extraction library [Tika](http://lucene.apache.org/tika/).

また、ファイルサーバのクローラ実装の多くは、Apache TikaやPOIをご利用のようなので、まずIndex対象となっているCADファイルのそれぞれの形式が、Tikaで期待するテキストが抽出できるかを確認されるのが良いと思います。

そこで、Tikaじゃ対応していない形式だ！ 期待するテキストが取れてない！  
となりましたら、他のテキスト抽出方法を検討することになるでしょう。  
例えば、こういう製品なんかもあります。

> **[TextPorter 抽出対象ファイル形式](https://www.antenna.co.jp/axx/function02.html)**
>
> Office Server Document Converterのご紹介

これを、ファイルサーバのクローラの選定の前にまず確認しておいた方が良いかなと思いました。  
参考になれば幸いです。

---

<div class="post-metadata">

### Author: ![norinori](https://avatars.discourse-cdn.com/v4/letter/n/ec9cab/32.png) [@norinori](https://discuss.elastic.co/u/norinori)
#### Post date: [October 26, 2018, 8:38am UTC](https://discuss.elastic.co/t/topic/153890/3 "2018-10-26T08:38:52Z")

</div>

ありがとうございます。  
Tikaでは期待した情報が取得できないものもあるようなので、まずはそこをどうするか検討したいと思います。

---

<div class="post-metadata">

### Author: ![johtani](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/johtani/32/44956_2.png) [@johtani](https://discuss.elastic.co/u/johtani)
#### Post date: [October 31, 2018, 9:09am UTC](https://discuss.elastic.co/t/topic/153890/4 "2018-10-31T09:09:46Z")

</div>

クローラーはこんなものもあります。参考になればと。

[https://fscrawler.readthedocs.io/en/fscrawler-2.5/](https://fscrawler.readthedocs.io/en/fscrawler-2.5/)

残念ながらCADの形式がどんなもので、どのような検索をしたいのかがわかりませんが。。。  
JSONやXMLにすればファイルをクロールするといったことが可能です。  
もしくは、Tikaを使うパターンなども。

---

<div class="post-metadata">

### Author: ![norinori](https://avatars.discourse-cdn.com/v4/letter/n/ec9cab/32.png) [@norinori](https://discuss.elastic.co/u/norinori)
#### Post date: [November 1, 2018, 5:02am UTC](https://discuss.elastic.co/t/topic/153890/5 "2018-11-01T05:02:53Z")

</div>

ありがとうございます。

事前にCADファイルから必要な情報をJSONやXMLで抜き出し、ファイルで保存。  
クローラが拾ってインデックス化という事でしょうか。

事前に情報を抜き出せない場合、クロール時にクローラの機能を拡張して特定のファイルからは必要な情報を抜き出してインデックス化する事も可能でしょうか？

---

<div class="post-metadata">

### Author: ![johtani](https://sea2.discourse-cdn.com/elastic/user_avatar/discuss.elastic.co/johtani/32/44956_2.png) [@johtani](https://discuss.elastic.co/u/johtani)
#### Post date: [November 1, 2018, 5:28am UTC](https://discuss.elastic.co/t/topic/153890/6 "2018-11-01T05:28:26Z")

</div>

このクローラーが対応してるかどうかはドキュメントやソースを読んでみていただくのがいいかなぁと。

---

<div class="post-metadata">

### Author: ![system](https://us1.discourse-cdn.com/elastic/original/3X/1/a/1ac57faf039f6b580b3f104ef42a2a89e41014de.png) [@system](https://discuss.elastic.co/u/system)
#### Post date: [November 29, 2018, 5:28am UTC](https://discuss.elastic.co/t/topic/153890/7 "2018-11-29T05:28:30Z")

</div>

This topic was automatically closed 28 days after the last reply. New replies are no longer allowed.
