資料の一つ一つを、数字の並びに置き換えて保管する方法があります。似た意味のものが近い場所に来るように並べるので、質問も同じやり方で数字にすれば、近くにあるものが答えの候補になります。
この方法の強みは、言葉が違っても届くことです。「解約したい」と聞かれたときに「ご契約の終了手続き」と書かれた資料を拾えます。表記のゆれにも強く、社内資料の探し方としては相性が良いところです。
社内の資料は、書いた人によって言い方が違います。同じことを、ある部署は「請求書」と呼び、別の部署は「ご精算のご案内」と書く。人が探すときには読み替えられますが、語をそのまま照合する方法では届きません。ここを埋められるのが、この探し方の値打ちです。
意味の近さを、位置の近さとして扱えるようにする工程です。当社は 768 の数字の組で扱っています。
次元の数は精度と費用の両方に効くので、資料の量に合わせて選びます。
仕組みの解説は Google のクラッシュコースが分かりやすいです。Google for Developers「エンベディング」↗
意味に寄せるぶん、一字違いを区別しません。ここが実務でいちばん困ります。
型番・品番 ── 「A-200」と「A-2000」が近いものとして扱われます。
固有名詞 ── 似た社名、似た人名を取り違えます。
数字と日付 ── 金額の桁や年度の違いが、意味の差になりません。
打ち消し ── 「対象です」と「対象外です」がとても近くなります。
四つめは重い外し方です。除外条件が書かれた資料を、該当条件として拾ってきます。「この特約は対象外です」と書かれた一節を根拠に、対象だと答えてしまう。読んだ人が気づかなければ、そのまま通ります。ですから、契約や規程を扱う仕組みでは、語の照合を必ず併せます。
では語をそのまま照合すればよいのか。こちらは型番や固有名詞に強く、打ち消しの語も落としません。ただし言い換えに届きません。「解約」で探すと「終了手続き」は出てこない。
社内資料は、部署ごとに言い方が違います。片方だけでは、探せない資料が必ず残ります。
1. 両方で集める ── 意味で数件、語で数件。多めに拾います。
2. 混ぜて重複を消す ── どちらにも出たものは、確度が高い候補です。
3. 並べ替えて絞る ── 質問との関係が強い順に並べ、上の数件だけAIに渡します。
この形にしておくと、片方の弱点がもう片方で埋まります。三つめで絞るのは、余分を渡すとAIが引っ張られるからです(A-03-1 資料の切り分け)。
どちらから始めるかは、資料の性質で決めます。手引きや議事録のように文章が中心なら、意味で探すほうから。仕様書や部品表のように番号が中心なら、語で探すほうから。先に片方を入れて、外れた質問を集めてから、もう片方を足すのが手戻りの少ない進め方です。
言い換えの差が大きい会社では、社内の言い方と一般的な言い方を対応させた一覧を用意します。手作業ですが、効き方は大きいところです。三十語ほど並べるだけで、外れの半分近くが消えることもあります。
また、資料に区分の札を付けておくと、探す前に範囲を絞れます。「料金」「手順」「契約」といった単位です。探し方を良くするより、探す範囲を狭めるほうが速い場面は多いです。
どの資料を根拠にしたかを必ず一緒に返させます。答えが合っていても、根拠がまるで別の資料だったという例は起きます。そのままにすると、次に条件が変わったときに外れます。
定期的に同じ質問を流し、拾ってきた資料が変わっていないかを見る。測り方は第6章 評価にまとめました。
次の記事は、RAGを検討するとき必ず出るご質問です。渡した資料は、いったいどこへ行くのか。
章と記事の全体は図書館の見取り図で一枚にまとめています。