導入してすぐの時期は、AIが答えを返してくるだけで感心してしまいます。文章になっている、口調も整っている、それらしい。ところが、そこで確かめ終えた気になるのが、いちばん多い落とし穴です。
第2章で書いたとおり、AIはもっともらしい嘘を、自信のある口調で書きます。動作の確認と、内容の確認は別の作業です。前者は「返ってきたか」を見ればすみますが、後者は「合っているか」を測らなければ分かりません。
測り方は、仕事の性質で二つに分かれます。
正解が決まっている仕事 ── 分類、抜き出し、計算、判定。
→ 正解の一覧を先に作れば、機械が自動で採点できます。
正解が一つでない仕事 ── 文章、要約、提案、返信の下書き。
→ 採点の基準を、人が言葉で書いておく必要があります。
会社の業務は、たいてい後者が多く含まれます。ですから「AIの精度は何パーセントですか」という問いには、そのままでは答えられません。何を正解とするかを決めた人がいて、はじめて割合が出せます。
後者の仕事を測るには、採点基準を文章にします。「出典が付いているか」「事実と意見が分かれているか」「依頼の範囲を超えていないか」といった項目を、五つほど。誰が採点しても近い結果になる程度の具体さで書きます。
大事なのは、出てきた答えを見る前に書くことです。あとから作ると、目の前の出力に合わせて基準がゆるみます。人はそういうふうにできています。先に書いた基準だけが、判定の役に立ちます。
件数が増えれば、全件を人が読むのは無理になります。そこで抜き取りで採点します。二十件ほどで、傾向はかなり見えます。
ただし選び方を固定してください。目についたものを拾うと、印象の強いものばかりが集まります。無作為に選んだぶんと、難しいと分かっている場合を意図して入れたぶん。この二つを分けて数えると、平均点と、いちばん危ないところの両方が見えます。
採点そのものを、AIに手伝わせることもできます。ただし条件が一つあります。答えを書いたAIと、採点するAIを別にすることです。
同じAIに自己採点させると、点は甘くなります。自分が出した文章は、そのAIにとって「それらしい」に決まっているからです。第5章で書いた提案役と批判役を分ける話は、そのまま評価にも当てはまります。「これは間違っている、と言えるか」と問う役を、別に立ててください。
点数そのものに意味はありません。意味があるのは、前回と比べて上がったか下がったかです。ですから、いつ・どの条件で・何点だったかを記録に残せる形にしておきます。残っていなければ、比べようがありません。
当社の場合は、6時間ごとに正しさを測る仕組みを回しています。あわせて、判断の材料が十分たまるまでは自動採用しない決まりを置いています。実績の記録が10件集まるまでは、そのAIの提案を自動では取り込みません。少ない成功で「うまくいっている」と決めてしまうのを防ぐためです。
※実測: 2026-07-25 JST・YOHAKU OS 本番データベース。
測る仕組みを先に置いておくと、あとから「効いているのか」で揉めずにすみます。導入の順番としては、動かす仕組みと同じくらい早い段階で組んでおくことをおすすめします。
C-06-1 何を測るかを先に決める ── 「良くなった」を、数で言えるようにします。
C-06-2 評価セットの作り方 ── 正解つきの例を、どう集めるか。
C-06-3 AIに採点させる ── 採点も自動にできますが、条件があります。
測り方の実際は「AIの中身」に、宣言と実証を分けて数えた実測値として載せています。次の章では、そもそも測る前に「任せない」と決めているものを開きます。