LLMが学んだのは、公開されている膨大な文章です。当然そこに、あなたの会社の見積書も、去年の議事録も、社内のルールも入っていません。
それでも尋ねれば、AIは何か答えます。第2章で見たとおり、AIは「それらしい続き」を出す装置だからです。知らないことを聞かれても、黙らない。ここが危ないところです。
解決の方向はふたつあります。AIに覚え直させるか、答える前に調べさせるか。実務でまず選ぶべきなのは、後者です。
RAG(ラグ)は Retrieval-Augmented Generation の略で、直訳すれば「検索で補強した生成」。順番はこうです。
AI自身は賢くなっていません。答える直前に、正解の載ったページを開いて渡してあげている、それだけです。
「持ち込み可の試験」を思い浮かべてください。記憶に頼って書くと間違えますが、資料を見ながらなら正確に答えられる。RAGがやっているのは、まさにこれです。第2章の言い方でいえば、文脈の窓に、必要な資料を入れてから聞いているということになります。
ここで問題になるのが、探し方です。ふつうの検索は、言葉が一致しないと当たりません。「退職金」で検索しても、資料に「退職手当」としか書いていなければ、見つからない。
そこで使うのがベクトル検索です。文章を、意味の近さを表す数字の並びに変換しておき(この変換を埋め込みと呼びます)、言葉ではなく意味が近いものを探します。だから「退職金」で「退職手当」の項目にたどり着けます。
数字に変換した文章をためておき、意味の近いものを高速で取り出せるようにした保管庫。RAGの裏側にはたいていこれがいます。
百ページの資料をまるごと渡すことはできません。窓に入りきらないうえ、要らない部分がノイズになって精度が落ちます。
そこで文書を、意味のまとまりごとに数百文字ずつ切り分けて登録します。この一片をチャンクと呼びます。切り方は地味ですが重要で、話の途中でぶつ切りにすると、検索で当たっても意味が通じない断片が届いてしまいます。RAGの精度は、AIの賢さより、資料の整え方で決まります。
効き目ははっきりしています。第一に、幻覚が減る。手元に資料があるので、でっち上げる必要がなくなります。第二に、出典を示せる。「この回答は、この文書のここに基づく」と言えるようになり、人間が検証できます。第三に、更新が速い。資料を差し替えれば、その瞬間から新しい内容で答えます。
限界もあります。検索で拾えなかったものには、答えられません。資料自体が古ければ、古い答えが自信満々で返ってきます。RAGは万能薬ではなく、「資料の整理」という地味な仕事の上に成り立つ仕組みです。
よく聞かれる不安です。「うちの資料をAIに読ませたら、そのまま覚えられて、他社への回答に使われてしまうのでは」。
RAGの場合、渡した資料がAIの中身を書き換えることはありません。第1章で書いたとおり、学習と推論は別の時間だからです。RAGは推論のとき、その場かぎりで資料を見せているだけ。窓を閉じれば、AIの側には何も残りません。
そのうえで実務では、入力を学習に使わない条件の契約を選ぶ、秘密の度合いによって置き場所を分ける、誰がどの資料を引けるかを役割ごとに制限する、といった線引きをします。どの資料を、どこまで見せるか。これを決めるのは技術ではなく人間の仕事です。
もうひとつの道が、ファインチューニング(追加学習)です。AI自体に追加で学習させて、覚え込ませます。
違いは、こう考えると分かりやすいと思います。RAGは資料を持たせること。追加学習は研修を受けさせること。事実や数字を扱いたいならRAG、文体や答え方の癖を揃えたいなら追加学習。費用も手間もRAGのほうが軽く、間違いに気づいたその日に直せます。だからまずRAGから始めるのが定石です。
ここまでで、AIは「調べて答える」ようになりました。次の章は、その先。AIが自分で道具を使い、手を動かしはじめます。
A-03-1 資料の切り分け ── 探せるかどうかは、切り方で決まります。
A-03-2 意味と語、両方で探す ── 片方だけでは外れます。両方を使う理由。
A-03-3 渡した資料はどこへ行くのか ── 学習に使われるのか、どこに残るのか。
YOHAKU OS では、会社の記憶を整理する役割のエージェントがこの層を担当しています。「AIの中身」のページに実測値をまとめています。