ホーム / 図書館 / 第6章 / C-06-3

棚C まかせたあとを守る ── 第6章の深掘り 2026-07-26 読了 約4分

AIに採点させる
使える場面と、使えない場面

この記事について

百件の答案を毎回人が読むのは大変です。そこで採点そのものをAIにやらせるという手が出てきます。実際に使えますが、向く仕事と向かない仕事があります。ここを分けずに全部任せると、点数だけが一人歩きします。

第6章「評価」を深く読む 全3本C-06-3 / 全3本
  1. 入口評価 ── 「動いた」と「合っている」は別
  2. C-06-1何を測るかを先に決める ── 「良くなった」を数で
  3. C-06-2評価セットの作り方 ── 百件あれば始められます
  4. C-06-3AIに採点させる ── 使える場面と使えない場面

01採点にも、手間がかかります

評価セットを百件用意しても、指示文を直すたびに百件を読み直すのでは続きません。続かない仕組みは、やがて使われなくなります。

ですから採点も、機械にできるところは機械に渡します。順番としては、まず完全一致で判定できるものから自動にします。分類の結果や、金額の抜き出しなど、答えが一つに決まるものです。ここはAIを使うまでもありません。

費用の面でも同じです。採点のたびにAIを呼べば、そのぶん使った量が増えます(第9章 費用)。機械で判定できるところにAIを使わないのは、安く済ませるためでもあります。

02文章の採点を、AIに頼む

問題は、答えが一つに決まらない仕事です。文面の下書き、要約、説明の分かりやすさ。ここで使われるのが、別のAIに採点役をさせるやり方です。採点基準を渡して、点と理由を返させます。

採点役をどう置くか

答えを作るAIと、採点するAIは別に置きます。同じ流れの中で自分の答えを自分で採点させると、甘くなります。

渡すのは、問題・答え・採点基準の三つだけです。作った側の言い分は渡しません。

評価の仕組みを部品として提供する例もあります。Google Cloud「Gen AI Evaluation Service の概要」↗

03向いているのは、形と抜けの確認です

採点役が得意なのは、決めた形を守れているかどうかの確認です。必要な項目が全部あるか。禁止した語が入っていないか。長さが範囲に収まっているか。前提と違うことを書いていないか。

この種の判定は、人が見ても答えが割れません。答えが割れない仕事ほど、任せて安全です。

04向いていないのは、良し悪しの最終判断です

「この文面はお客様に出してよいか」の判断は、任せません。採点役も同じ性質の仕組みですから、もっともらしい文章に高い点を付ける傾向があります。読みやすいけれど中身が薄い答えが、上位に来ることがあります。

それに、人によって判断が割れる問いは、そもそも点数で決める話ではありません。ここは決める場面として人に残します(C-07-1 自動にしないと決めた仕事)。

点数が付くと、それだけで確かなものに見えてしまいます。数字は、付いているというだけでは根拠になりません。何を基準に付いた数字なのかを、いつでも言えるようにしておきます。

05採点役の癖を、先に測ります

使い始める前に、必ずやることがあります。人が採点した二十件を、同じ基準で採点役にも解かせて、ずれ方を見ます。全体に甘いのか、特定の型だけ外すのか。

癖が分かれば、そのぶんを見込んで読めます。癖を測らずに点数だけを見ると、上がった下がったの原因が分からなくなります。

測り直すのは、採点役に使うモデルを替えたときです。同じ基準でも、替えれば点は動きます。点が動いたのが中身のせいか、採点役のせいかを混ぜないためです。

06採点基準は、文で書きます

「良い文章かどうか」では、採点役ごとに答えが変わります。基準は具体的な文にします。「金額と期日が本文にあること」「社内用語を使っていないこと」「四百字以内であること」。

基準を書く作業そのものが、実は価値があります。何を良しとするかは、書き出してみると人によって違っていることが分かります。採点を自動にする前に、そこが揃います。

07当社の場合

当社では、機械での検査と人の確認を分けています。形の検査は自動、良し悪しは人。書き込みまで自分の判断でできるのは、稼働 85体 のうち 17体 だけで、残りは読んで記録する係です。採点役も、この読む側に置いています。

点数が下がったときに何を直すかは、人が決めます。判断の材料を増やす道具として使い、判断そのものは渡しません(B-05-3 反証させる価値と費用)。

08まとめ

ここまでで、合っているかの確かめ方を見てきました。次の章は、確かめたうえで何を人に残すかという線引きの話です。

第6章の枝 ── いま読んでいる位置
第6章 評価 C-06-1 何を測るかを先に決める C-06-2 評価セットの作り方 C-06-3 AIに採点させる(いまここ)

章と記事の全体は図書館の見取り図で一枚にまとめています。

当社は形の検査を機械、良し悪しを人に分けています。稼働 85体 のうち自分の判断で書き込めるのは 17体。採点役は読む側に置いています。内訳は「AIの中身」に開いています。

← 図書館へ戻る

/NEXT

では、何を
人に残すのか。

確かめ方が決まっても、任せる範囲は別に決めることです。第7章は、自動にしない線の引き方から。

第7章 人が決めること を読む