TCI内部向けProz Answersの検索ロジック概要

初回掲載日:2026-10-07
最終更新日:2026-10-07

1. 基本的な検索の考え方

● 複数のキーワードをカンマ区切りで入力すると、現在のアプリケーションではAND検索として処理されます。
● ただし、カンマ自体は検索演算子ではなく、解析処理上は句読点・区切り文字として扱われます。
● 検索結果は、入力語句とFAQ本文等がどのように分割・正規化され、インデックスに登録されているかによって変わります。

入力例

入力例

処理の考え方

補足

カード,紛失

カード AND 紛失

両方に関連するFAQへ絞り込み

カード 紛失

解析結果に基づいて検索

空白の扱いは検索設定・解析結果の影響を受ける


2. 利用できる主なLucene検索構文

検索にはLuceneを利用しており、検索結果を絞り込むための一部の特殊構文を利用できます。

構文

用途

入力例

動作イメージ

" "

フレーズ検索

"クレジットカード"

囲んだ語句を、ひとまとまりのフレーズとして検索

OR

OR検索

カード OR クレカ

いずれかのキーワードを含む結果を検索

-

除外検索

カード -解約

指定したキーワードを含む結果を除外

*

ワイルドカード

クレジット*

指定文字列で始まる語句を検索

重要

これらの演算子はGoogle検索とまったく同じ動作を保証するものではありません。


3. 解析処理・特殊記号に関する注意点

● 検索前の解析処理によって、文章は検索可能な単位(トークン)に分割されます。
● 検索結果は、FAQ登録時と検索時に、各語句がどのように分割・正規化されたかによって異なる場合があります。
● 「#」および全角の「#」は、通常、句読点・記号として扱われ、検索可能な語句としてインデックスに登録されない場合があります。
● そのため、FAQ本文に「#」「#」が含まれていても、記号のみで検索した場合は結果が返らないことがあります。

運用上の推奨

記号だけに依存した検索は避け、検索対象となる名称・単語もFAQ本文やタイトルに含めてください。特殊構文を利用する場合も、実際のFAQデータで検索結果を確認することを推奨します。


4. 8,000トークンを超えるナレッジの扱い

検索対象外となる条件

1件のナレッジが約8,000トークンを超える場合、そのナレッジは検索インデックスに登録されません。判定対象には、タイトル・本文・登録キーワード等が含まれます。

● インデックスに登録されていないナレッジは、FAQ検索結果に表示されません。
● 登録キーワードを追加すると、その分もトークン数に含まれます。
● 長文ナレッジは、内容ごとに複数のナレッジへ分割する運用を推奨します。
● 文字数とトークン数は一致しません。日本語、英数字、記号等の構成によってトークン数は変動します。


5. AIエージェントとの関係

項目

FAQ検索

AIエージェント

検索インデックス

検索用インデックスを参照

ナレッジ取得に共通のインデックス基盤を利用

8,000トークン超

検索結果に表示されない

AIエージェントの参照対象にもならない

検索キーワード機能

FAQ検索の検索対象に含まれる

登録キーワード自体は直接参照しない

整理すると

FAQ検索とAIエージェントは、ナレッジを検索・取得する基盤の一部を共通利用しています。そのため、8,000トークン超でインデックスされていないナレッジは、どちらからも参照できません。また、AIエージェントはFAQに設定された登録キーワードを直接見て回答を生成する仕組みではありません。


6. TCI運用時の確認ポイント

● 複数条件で絞り込む場合は、カンマ区切りまたはLucene構文を利用する。
● 特殊構文はGoogle検索と同一ではないため、対象環境・実データで結果を確認する。
● 「#」「#」などの記号のみを検索キーにしない。
● 長文ナレッジは8,000トークンを超えないよう分割する。
● AIエージェントの回答精度改善では、登録キーワードだけでなく、タイトル・本文に適切な表現を記載する。

参考:Microsoft Learn「Azure AI Search での Lucene クエリ構文」


この記事は役に立ちましたか?
この記事内