導入して最初に分かるのは、動いたかどうかです。落ちずに応答が返り、画面に何かが出る。ここまでは目で確かめられます。
けれども、返ってきた内容が合っているかどうかは、目では分かりません。もっともらしい文章は、間違っていても違和感がないからです(A-02-3 嘘を減らす順番)。動いていることと、合っていることは、別々に確かめます。
いちばん手近な物差しは、全体のうち当たった割合です。ただし、これだけでは判断を誤ります。百件のうち、本当に手を打つべきものが三件しかない仕事を考えてみます。全部「該当なし」と答えるだけで、当たった割合は 97% になります。何もしない仕組みが、高い点を取ります。
ですから、拾えた割合と、拾ったもののうち正しかった割合を、分けて見ます。前者を落とすと見逃しが増え、後者を落とすと空振りが増えます。
拾えた割合 ── 本当に該当するもののうち、いくつ拾えたか。低いと見逃しが増えます。
正しかった割合 ── 拾ったもののうち、いくつが正しかったか。低いと空振りが増えます。
片方を上げると、もう片方は下がりやすくなります。両方を同時に最高にすることはできません。どちらを優先するかを決めるのが、物差しを決めるということです。
用語と計算式は Google の教材が簡潔です。Google「分類: 精度、再現率、適合率、関連指標」↗
この問いに答えられれば、物差しは半分決まります。不具合の検知なら、見逃しのほうが痛いはずです。多少の空振りは、人が見て消せます。
反対に、お客様へお送りする文面の下書きなら、空振りのほうが痛くなります。おかしなものが混じるより、拾えない件が残るほうが安全です。同じ仕組みでも、用途によって優先は逆になります。
両方を同時に上げたいときは、拾う基準の厳しさを動かして、ちょうどよい点を探します。厳しくすれば空振りが減り、緩めれば見逃しが増えます。つまみは一つしかないと思っておくと、話が早く済みます。
順番が大切です。先に作ってから「何を見て良し悪しを言うか」を考えると、良く見える数字を選んでしまいます。悪意ではなく、人はそう見えるほうを選びます。
ですから当社では、着手前に一行で書きます。「この仕組みは、◯◯を◯割まで拾えれば合格」。この一行が無い依頼は、いったん止めてご相談します。
先に指標を決める順序は、機械学習の実務でも定石として書かれています。Google「機械学習のルール」↗
一つだけにすると、その一つに寄せた作りになります。拾えた割合だけを追うと、片端から拾う仕組みができあがります。
当社は、精度の物差しに加えて、費用と、人の手間を必ず並べます。精度が少し上がっても、確認の手間が倍になるなら採りません。判断の材料は、三つあれば足ります。
三つ以上に増やすと、今度は見なくなります。並べた物差しは、毎週見る前提のものだけにしておきます。
文章の良し悪しのように、数で言いにくい仕事もあります。その場合は、良し悪しそのものではなく、守れているかどうかを数えます。禁止した語が入っていないか。必要な項目が全部あるか。長さが範囲に収まっているか。
これなら機械で数えられます。中身の質は人が見て、形は機械が見る。この分担にすると、人が見る量が減ります。
当社が毎日数えているのは、稼働している体数 85体、自分の判断で書き込める 17体、直近7日の決定 88件、そしてエラー 3,521件 から教訓の候補が 3,518件 生まれた割合 99.9% です。数え方は「AIの中身」に開いています。
この 99.9% は「拾えた割合」の一種で、質の保証ではありません。拾えているかと、拾ったものが役に立つかは別です。後者は人が見ています。
測るものが決まったら、次は測るための材料です。正解つきの例を、どう集めるかを見ていきます。
章と記事の全体は図書館の見取り図で一枚にまとめています。