ここまでのAIは、質問に文章を返すだけでした。エージェントは、そこに「道具を使う手」と「段取りを考える頭」を足したものです。
たとえば「先月の売上を調べて、報告書にまとめて」と頼んだとします。エージェントは、こう動きます。データベースを検索する。数字を集計する。文章にまとめる。ファイルに保存する。
一段階ずつ指示を出さなくても、目的さえ伝えれば、途中の手順を自分で埋めて最後まで走る。ここではじめてAIは、「答える人」から「働く人」になります。
エージェントの正体は、実はとても地味です。LLMに使える道具の一覧を渡してあるだけ、と言ってもいいくらいです。
「検索する」「メールを送る」「表を読む」といった機能を用意し、それぞれに説明書きを付けて渡しておく。するとAIは、目的に応じて「いま必要なのはこの道具だ」と選び、必要な情報を埋めて呼び出します。この呼び出しの仕組みを関数呼び出し(ファンクションコール)と呼びます。
AIに使わせるために用意した外部の機能のこと。検索、社内システムの照会、ファイル操作など。この道具を差し込む共通の作法として、近年は MCP という規格も広まっています。
つまり、できることの範囲は、渡した道具の数で決まります。道具を渡さなければ、どれだけ賢いAIでも、しゃべること以外は何もできません。
エージェントは、一直線に走るわけではありません。短い輪を回しながら進みます。
検索して空振りなら、言葉を変えてもう一度。エラーが出れば、別のやり方を試す。この輪を、目的に届くまで繰り返します。
人間の仕事の進め方と、ほとんど同じです。違うのは、疲れないことと、桁違いに速いこと。そして──間違った方向にも、同じ速さで進んでしまうことです。
輪を回すには、途中経過を覚えておく必要があります。エージェントの記憶は、二段構えになっています。
短期の記憶は、いま取り組んでいる仕事の中だけの覚え書き。第2章の「文脈の窓」に置かれ、仕事が終われば消えます。
長期の記憶は、外に書き出して保存するものです。ここで効いてくるのが第3章のRAGです。過去の判断や失敗を文書として残し、必要なときに検索して読み込む。覚えているのではなく、そのつど思い出していると言ったほうが正確です。
エージェントに任せてよく効くのは、手順がある程度決まっていて、量が多く、間違えても取り返せる仕事です。情報を集める。下書きをつくる。異常がないか見回る。一件ずつは軽いけれど毎日発生する仕事ほど、効果が積み上がっていきます。
向かないのは、その裏返しです。前例のない判断。相手の感情が絡む調整。そして、一度きりで取り返しのつかない決定。ここに置くと、速さがそのまま事故の速さになります。
だから最初の一歩は、「いちばん難しい仕事をAIに任せる」ではありません。毎日発生していて、失敗しても謝れば済む仕事から渡す。そこで記録を取り、精度を確かめてから、少しずつ範囲を広げる。地味ですが、これがいちばん早い道です。
手を持ったAIは、便利であると同時に危険です。だから歯止めを先に設計します。
権限を絞る。その仕事に必要な道具だけを渡します。読むだけで済むなら、書き込む道具は渡さない。削除や送金のような取り返しのつかない操作は、そもそも道具の一覧に入れません。
実行前に確認を挟む。外部に影響が出る操作──送信、公開、支払い──は、人間の承認を必ず通します。
記録を残す。いつ、どの道具を、何のために使ったか。すべて残しておけば、おかしくなったとき、どこで曲がったかを人間が追えます。
YOHAKU OS でも、AIが自動でできる範囲と、人間の承認が要る範囲を、はっきり線引きしています。速さのために、この線を消さないこと。ここは譲れないところです。
ところが、一体のエージェントに何もかも任せると、かえって精度が落ちます。次の章で、いよいよマルチエージェントとオーケストレーションです。
B-04-1 何を渡し、何を渡さないか ── 道具を持たせる前に、決めておくこと。
B-04-2 ループを止める設計 ── 上限と、戻し方と、記録。三つで止めます。
B-04-3 短期と長期の記憶 ── 忘れてよいものと、残しておくもの。