ファイルサーバーをクロールし続けると、重複した資料や長く更新されていない文書がたまってきます。Fessの管理画面に文書レポート、fess-kopfに文書インデックスの統計画面が追加され、整理対象を調べやすくなりました。
重複と休眠文書を調べる
Fessの「システム情報」>「文書レポート」で、重複と休眠文書のタブを切り替えます。smb://server/share/などのURL接頭辞で対象を絞り、CSVで取り出せます。管理ロールはadmin-docreport、閲覧専用はadmin-docreport-viewです。
fess_config.propertiesの初期値は次のとおりです。
docreport.duplicate.group.size=100
docreport.duplicate.docs.size=10
docreport.duplicate.export.page.size=10000
docreport.dormant.days=365
画面は最大100の重複グループ、各グループ10文書を表示します。重複判定には本文のMinHash署名content_minhash_bitsを使うので、完全一致だけでなく近い内容も含み得ます。ファイルのバイナリーが同一であることを保証する判定ではありません。トークンのない本文は誤った巨大グループになるため除外します。
通常のマッピングでは既存の署名を使い、署名のためだけの再インデックスは不要です。cloudやawsのマッピングでは署名を計算しないため、重複レポートを利用できません。大きなインデックスでは画面の集計が見落とす組み合わせもあり、全体確認にはページングで取得するCSVを使います。
休眠文書は初期値で365日以上更新されていない文書です。最終更新日時のない文書は含めません。「検索結果から一度も開かれていない」条件はクリック数が正でない文書を対象にします。画面のページングには結果ウィンドウの上限があるため、それを超える確認はCSVで行います。
インデックスの全体像を見る
fess-kopfのdocuments画面では、ファイル種別、MIMEタイプ、ホスト、ラベル、所有者、最終更新者の上位20件と、その他・値なしの件数を表示します。サイズ分布、更新年、インデックス登録年、最大サイズの10文書も確認できます。
fess.searchエイリアスがある環境で文書タブを表示します。インデックスのメニューから過去の世代を指定することもできます。画面を開くときと更新時に取得し、クラスターポーリングごとの集計は行いません。
数字の読み方と制限
createdは元ファイルの作成日ではなくFessへ登録した時刻です。ファイルの年齢を見るときはlast_modifiedを使います。年の集計は閲覧側のタイムゾーンに従い、サイズはバイナリー単位です。
古いインデックスのフィールド型によっては集計できない項目があります。利用可能な.keywordが全ての対象インデックスにある場合は代用し、それ以外は集計不能と表示します。fess-kopf側にはCSV出力と定期レポート機能はありません。
両画面とも調査のための読み取り機能です。重複や休眠というだけで不要と判断せず、原本や保管義務、実際の利用状況を確認してからファイル整理へつなげてください。
利用できるバージョン
Fess 15.9.0に含まれる予定の機能になります。現時点では、まだ、リリースしていないので、今後のテストで変更される可能性もあります。