評価セットを百件用意しても、指示文を直すたびに百件を読み直すのでは続きません。続かない仕組みは、やがて使われなくなります。
ですから採点も、機械にできるところは機械に渡します。順番としては、まず完全一致で判定できるものから自動にします。分類の結果や、金額の抜き出しなど、答えが一つに決まるものです。ここはAIを使うまでもありません。
費用の面でも同じです。採点のたびにAIを呼べば、そのぶん使った量が増えます(第9章 費用)。機械で判定できるところにAIを使わないのは、安く済ませるためでもあります。
問題は、答えが一つに決まらない仕事です。文面の下書き、要約、説明の分かりやすさ。ここで使われるのが、別のAIに採点役をさせるやり方です。採点基準を渡して、点と理由を返させます。
答えを作るAIと、採点するAIは別に置きます。同じ流れの中で自分の答えを自分で採点させると、甘くなります。
渡すのは、問題・答え・採点基準の三つだけです。作った側の言い分は渡しません。
評価の仕組みを部品として提供する例もあります。Google Cloud「Gen AI Evaluation Service の概要」↗
採点役が得意なのは、決めた形を守れているかどうかの確認です。必要な項目が全部あるか。禁止した語が入っていないか。長さが範囲に収まっているか。前提と違うことを書いていないか。
この種の判定は、人が見ても答えが割れません。答えが割れない仕事ほど、任せて安全です。
「この文面はお客様に出してよいか」の判断は、任せません。採点役も同じ性質の仕組みですから、もっともらしい文章に高い点を付ける傾向があります。読みやすいけれど中身が薄い答えが、上位に来ることがあります。
それに、人によって判断が割れる問いは、そもそも点数で決める話ではありません。ここは決める場面として人に残します(C-07-1 自動にしないと決めた仕事)。
点数が付くと、それだけで確かなものに見えてしまいます。数字は、付いているというだけでは根拠になりません。何を基準に付いた数字なのかを、いつでも言えるようにしておきます。
使い始める前に、必ずやることがあります。人が採点した二十件を、同じ基準で採点役にも解かせて、ずれ方を見ます。全体に甘いのか、特定の型だけ外すのか。
癖が分かれば、そのぶんを見込んで読めます。癖を測らずに点数だけを見ると、上がった下がったの原因が分からなくなります。
測り直すのは、採点役に使うモデルを替えたときです。同じ基準でも、替えれば点は動きます。点が動いたのが中身のせいか、採点役のせいかを混ぜないためです。
「良い文章かどうか」では、採点役ごとに答えが変わります。基準は具体的な文にします。「金額と期日が本文にあること」「社内用語を使っていないこと」「四百字以内であること」。
基準を書く作業そのものが、実は価値があります。何を良しとするかは、書き出してみると人によって違っていることが分かります。採点を自動にする前に、そこが揃います。
当社では、機械での検査と人の確認を分けています。形の検査は自動、良し悪しは人。書き込みまで自分の判断でできるのは、稼働 85体 のうち 17体 だけで、残りは読んで記録する係です。採点役も、この読む側に置いています。
点数が下がったときに何を直すかは、人が決めます。判断の材料を増やす道具として使い、判断そのものは渡しません(B-05-3 反証させる価値と費用)。
ここまでで、合っているかの確かめ方を見てきました。次の章は、確かめたうえで何を人に残すかという線引きの話です。
章と記事の全体は図書館の見取り図で一枚にまとめています。