「前より良くなった気がする」を「良くなりました」に変えるには、同じ問題を同じように解かせて比べるしかありません。そのための問題集が、評価セットです。
問題と、期待する答え。この二つが揃った例を並べたものです。難しく考えなくても、過去に人が処理した記録が、そのまま材料になることがよくあります。
ご相談を受けた仕事でも、たいていは台帳や過去の対応の記録が残っています。新しく作るのではなく、すでにあるものから百件を選ぶところから始めます。作る作業だと思うと重くなりますが、選ぶ作業だと思えば半日で終わります。
ここを取り違えると、意味の薄い問題集ができます。うまくいった例ばかり集めると、どの作り方でも満点になり、比べられません。
入れるべきなのは、迷った例、間違えた例、例外だった例です。人が判断に時間をかけた案件ほど、価値のある一問になります。
1. 入力(実際に渡す形のまま。整えすぎません)
2. 期待する答え(一つに決まらない場合は、満たすべき条件)
3. なぜそれが正解なのか、一行の理由
4. どこから来た例か(出どころ。あとで確かめるため)
指示文を直すときに見た例で採点すると、点は上がります。その例に合わせて直したのですから、当然です。けれども、それは初めて見る問題に強くなったことを意味しません。
ですから、手元の例は最初に二つに分けます。直すときに見てよい分と、採点にだけ使って普段は開かない分です。開かない分は、月に一度だけ使います。
同じ例で調整と採点をすると、その例だけに強い仕組みができます。機械学習では基本の作法として、データを分けて扱います。
分け方の考え方は Google の教材にまとまっています。Google「データセット: 元のデータセットの分割」↗
数千件を用意しないと始められない、ということはありません。当社は百件を目安にしています。百件あれば、一割の改善は見えます。一件の違いが 1% ですから、数え間違いも起きません。
百件が難しければ、三十件でも比べられます。差が小さいときに判断できないだけで、大きく外している作りなら三十件で分かります。
むしろ、数を増やすほど正解を付ける手間が増えます。手間が増えると更新されなくなり、古い問題集で測り続けることになります。続けられる量に収めるほうが、結果として長く使えます。
評価セットは、一度作って終わりにしません。本番で間違いが見つかったら、その案件を一問にして足します。これを続けると、問題集が、その仕事の弱点の一覧になっていきます。
足すときに気をつけるのは、作り直さないことです。前の問題を消すと、以前との比較ができなくなります。積み上げる形にしておきます。
同じ型の問題ばかりが増えないようにも気をつけます。似た間違いを十件足しても、測れることは一件ぶんです。
文面の下書きのように、正解が一つに決まらない仕事もあります。その場合は、答えそのものではなく、満たすべき条件を書いておきます。金額が入っていること、期日が入っていること、禁止した語が無いこと。
条件なら機械で確かめられます。中身がふさわしいかどうかだけを、人が見ます(C-06-3 AIに採点させる)。
当社は、エラーの記録 3,521件 のうち 3,518件 を教訓の候補に変換しています。この教訓が、そのまま次の評価の問題になります。失敗の記録を捨てないことが、問題集を作る一番安い方法です。数え方は「AIの中身」に開いています。
問題集ができると、次は採点の手間が問題になります。採点そのものを自動にできるのか、を見ていきます。
章と記事の全体は図書館の見取り図で一枚にまとめています。