FessのCSV取り込みでコメント直後の空行による読み込み停止を防ぐ

CSVのコメント行と空行を同時に無視する設定で、コメントの直後に空行があると、その後のデータを読み込まず終了する問題が修正されました。エラーを出さず0件のクロールになることもあるため、投入件数の確認が役立ちます。

問題が起きる設定と入力

CSVデータストアのパラメーターで次の2項目を同時に指定した場合が対象です。

ignore_line_patterns=^#.*
ignore_empty_lines=true

例えばコメント、空行、データ行という並びで読み込みが止まりました。ignore_empty_lines の初期値はfalse、ignore_line_patterns は未指定なら行パターンによる除外は行いません。それぞれ単独で指定する使い方は従来どおりです。

修正後の確認手順

両方を指定した場合は、空行も行除外のパターン側で扱うことで、使用ライブラリーの読み込み停止を回避します。コメントと空行がデータの前や途中にあるCSVを使い、修正を含むプラグインでクロール件数と検索結果を確認してください。今回の変更を有効にするための新しい設定はありません。

既存のデータストア設定を維持したままプラグインを更新し、CSVを再クロールして、これまで読み込まれなかった行を登録します。ヘッダーを飛ばす skip_lines や列から本文へのマッピングは別設定なので、読み込み件数が想定と違う場合は併せて確認します。

CSVから消した行はすぐ消えるとは限らない

同日の15.9文書修正では、旧文書の削除条件も明確になりました。delete_old_docs と keep_expires_docs はいずれも初期値trueです。通常は全般設定の「以前のドキュメントを削除」による有効期限が文書に付くため、再登録されなかった文書もkeep_expires_docsによって残り、期限後にドキュメントパージャーが削除します。

CSVの行削除が直ちにインデックス削除になると決めつけないでください。keep_expires_docs=false の指定や有効期限設定の無効化で挙動が変わります。同じデータ設定に別々のCSVを投入して蓄積する環境では、旧文書削除との関係を確認します。この文書変更は削除機能を新設したものではありません。

関連PR

Fessの検索APIでファセット指定の誤りを400として扱う

Fessの/api/v2/searchでファセットの数値を誤ったとき、検索結果が0件だったのか、リクエストが間違っていたのかを区別しやすくする修正を行いました。APIを利用する検索画面や連携プログラム向けの変更です。

空の検索結果からリクエストエラーへ

従来はfacet.size=abc、facet.size=0、facet.size=-1やfacet.minDocCount=xを指定すると、HTTP 200でrecord_countが0、partial=trueの応答になる場合がありました。修正後は検索を開始する前に検証し、HTTP 400のinvalid_requestとして返します。

facet.sizeは1以上の整数、facet.minDocCountは整数で指定します。facet.fieldやfacet.queryの要素数・文字列長の制限超過も、検索開始前のリクエストエラーとして扱います。

指定例と初期値

curl --get 'http://localhost:8080/api/v2/search'   --data-urlencode 'q=manual'   --data-urlencode 'facet.field=label'   --data-urlencode 'facet.size=20'   --data-urlencode 'facet.minDocCount=1'

数値を省略した場合は設定値を使います。開発版の初期値はquery.facet.fields.size=100、query.facet.fields.min_doc_count=1です。facet.sizeの上限を制御するquery.facet.fields.size.maxは1000、最小文書数の上限query.facet.fields.min_doc_count.maxは2147483647です。

上限を超える有効な数値は従来どおり上限へ調整されます。負のfacet.minDocCountも拒否する変更ではなく、検索側で0に調整されます。クライアントでは意味の分かりやすい0以上の値を指定するとよいと思います。

クライアントでの確認

HTTPステータスを確認してから検索結果を扱い、400 invalid_requestなら送信したパラメーターを見直します。特に「ファセットを出さない」という意味でfacet.size=0を送っている実装は、不要なfacet.fieldやfacet.queryを送らない形へ変更します。ファセットを要求しない場合、facet.sizeとfacet.minDocCountは読み取られません。

検索エンジンなどの障害時に空の部分的結果を返す挙動は維持されます。partial=trueを一律に入力誤りと判断しないでください。変更対象はv2 APIで、旧v1 APIや他の検索経路へ一律に適用するものではありません。num=abcやstart=abcが既定値になる挙動も今回の対象外です。

関連PR

FessをCodeLibsプラグインなしのOpenSearchへ接続するvanilla設定

Fessの15.9開発版に、CodeLibsの検索エンジンプラグインを導入できないOpenSearch向けの種別 vanilla が追加されました。マネージドサービスなどを使う場合に、作成するインデックスと利用できる管理機能を明示できます。

初期値と使い分け

search_engine.type の初期値は default です。これはCodeLibsのanalysis-fess、analysis-extension、minhash、configsyncを導入したOpenSearchを前提にします。プラグインなしでは vanilla を指定します。aws も同じインデックス定義を使い、cloud は非推奨の別名として起動時に警告を出します。プラグインの自動判定はありません。

設定手順

DockerではFessサービスに次の環境変数を追加します。接続先URLは実際のOpenSearchに合わせてください。

SEARCH_ENGINE_HTTP_URL=http://search01:9200
SEARCH_ENGINE_TYPE=vanilla

ZIP/RPM/DEB版では fess_config.properties に search_engine.type=vanilla を指定し、Fessを再起動します。Docker以外の bin/fess.in.sh は SEARCH_ENGINE_TYPE を読み込まないため、環境変数だけで設定したつもりにならないようにします。

初回起動前に種別を決めてください。後から変更しても既存インデックスのマッピングは変わりません。独自の _aws / _cloud 定義を使っていた環境は、15.9で _vanilla が使われる点も確認します。

利用条件と制限

CodeLibsのプラグインは不要ですが、OpenSearch公式の analysis-kuromoji、analysis-nori、analysis-smartcn、opensearch-knn は必要です。起動時のプラグイン確認は不足を警告するだけで、起動継続をもって全機能の利用可能とは判断できません。

辞書管理と辞書API、辞書初期化、ドキュメントインデックスのリロード、検索結果の重複折り畳み、重複文書レポートは利用できません。休眠文書レポートは利用できます。日本語などの解析はOpenSearch標準の解析器になり、default と分割結果が異なります。ベトナム語と繁体字中国語の専用言語フィールドは空の解析器ですが、共通のcontent/titleフィールドには登録されます。

Amazon OpenSearch ServiceではOpenSearch 3.x、必要なプラグイン(Noriはオプションのパッケージ)、HTTPS、内部ユーザーのBasic認証を確認します。IAMのSigV4署名にはまだ対応していません。

関連PR