人へ作業を任せるとき、マニュアルを渡しただけで、いきなり1万件を処理してもらうことはありません。まず少量を依頼し、成果物を確認し、認識の違いを直してから本番へ進みます。

AIに検品を任せる場合も、やることは変わりません。品質基準を一度入力し、すぐに全件を判定させるのではなく、少量の実データで合否を確認します。AIが合格としたものを人が全件見て、そのまま納品できる状態かを確かめます。

その中に「これは合格にしてはいけない」と感じる成果物があれば、AIの判定方法を直すだけではありません。そもそも、その不良を品質基準として定義できていたかも見直します。

AI検品のフィジビリは、AIが人の正解を再現できるか試すだけの工程ではありません。実際の成果物を見ながら、人の頭の中にしかなかった品質基準を見つけ、AIと共有できる形にする工程でもあります。

最初から、すべての不良を想定することはできない

たとえば、レシート画像を収集する案件で、次のような品質基準を決めたとします。

  • レシート全体が画面内に収まっている
  • 文字が読める
  • 強い反射や影がない
  • 手や物で明細が隠れていない
  • 指定された種類のレシートである

この条件をAIへ渡せば、合格と不合格を判定できます。しかし、実際に画像が集まると、最初には想像していなかったものが含まれます。

  • 画像全体がわずかにピンぼけしている
  • 店舗名は読めるが、日付だけが不鮮明になっている
  • 複数のレシートが一枚の画像に写っている
  • 背景とレシートの色が近く、輪郭が分かりにくい
  • 同じレシートを角度だけ変えて重複提出している
  • レシートではあるが、今回の収集対象には含まれない

ピンぼけ画像が提出されると想定していなければ、ピンぼけは最初の不合格条件に入りません。AIがその画像を合格にしても、AIが指示に違反したとは限りません。人がAIへ渡した品質基準に、その条件が存在していなかった可能性があります。

AI検品の導入時に見つかる問題は、AIの誤判定だけではありません。人がまだ不合格条件を言語化できていないこともあります。

フィジビリでは、AIが合格にしたものを全件見る

AIを一次検品に使うと聞くと、AIが不合格にしたものだけを人が確認する運用を想像しやすいかもしれません。本番では、その方法によって人の確認件数を減らせます。

しかし、導入初期から不合格側だけを見ていると、AIが合格にした不良品を発見できません。そのまま二次工程や納品へ流れるため、AIを通過した成果物の品質を確認できない状態になります。

そのため、フィジビリでは少量の成果物をAIに判定させ、少なくとも合格側を人が全件確認します。

  1. 暫定的な品質基準を作る
  2. 少量の成果物を集める
  3. AIに合格・不合格を判定させる
  4. AIが合格とした成果物を人が全件確認する
  5. そのまま納品できないものを抜き出す
  6. 不合格にすべき理由を品質基準へ追加する
  7. AIの指示や判定方法を調整する
  8. 別の少量データでもう一度確認する

不合格側も人が確認すれば、AIが厳しく判定しすぎている条件を見つけられます。ただし、最初に見落としてはいけないのは合格側です。AIが不合格にした合格品は人が戻せますが、AIが合格にした不良品は、確認しなければそのまま流れてしまうからです。

AIの誤判定と、品質基準の不足を分ける

AIの合格品に不良が混ざっていた場合、すべてを「AIの精度が低い」でまとめると、何を修正すればよいか分からなくなります。

少なくとも、次の二つに分けて考えます。

基準にはあるが、AIが見落とした

「ピンぼけは不合格」と明示しているにもかかわらず、AIが明らかなピンぼけ画像を合格にした場合です。この場合は、指示の書き方、判定例、画像の渡し方、使用するモデルなどを調整します。

不合格条件として定義していなかった

成果物を見て初めて、「店舗名が読めても、日付が読めなければ使えない」と分かった場合です。これはAIが既存の基準を誤解したのではなく、品質基準に必要な条件が足りなかったと考えます。

後者までAIの誤判定として扱うと、AIに曖昧な修正指示を重ねることになります。先に、人が何を納品可能と判断しているのかを明確にしなければ、AIの判定も安定しません。

人へ仕事を任せるときも、同じ工程を通る

この流れは、AIに特有のものではありません。作業者へ検品や分類を任せる場合も同じです。

最初に少量を渡し、提出された成果物を全件確認します。認識が違っていれば説明を追加し、マニュアルに書かれていなかった例外が出れば判断基準を増やします。品質が安定した後に件数を増やし、本番初期も全件検品を続けます。

違うのは、調整方法です。

  • 人には、説明、マニュアル、作業例、フィードバックで基準を共有する
  • AIには、プロンプト、判定条件、合否例、参照データで基準を共有する

相手が人であってもAIであっても、最初から品質基準を完全に理解しているとは考えません。少量の成果物を介して認識を合わせ、安定したことを確認してから処理量を増やします。

AIの判定と人の判断を実データ上で一致させていくこの工程は、Calibrationと呼ばれます。ただし、単にAIを人へ近づけるだけではありません。実データから新しい不良条件を見つけ、人側の基準も具体化していく点が重要です。

AIは、誤った基準でも大量に処理できてしまう

人とAIでフィジビリの考え方は同じですが、問題が広がる速度は異なります。

一人の作業者が誤った理解で処理できる件数には限界があります。少量ずつ配り、提出と同時に検品していれば、大量の不良品が作られる前に止められます。

AIは、誤った基準のままでも短時間で大量に判定できます。処理が速いこと自体は利点ですが、基準の不足に気づかず全件を処理すれば、同じ誤りが全データへ一気に広がります。

そのため、AIを導入したからフィジビリを短縮できるとは限りません。むしろ、本番データを少量流し、合格側を人が確認し、判定基準を固めてから処理量を増やす必要があります。

AIが一万件を数時間で処理できるとしても、最初の100件で基準が合っていなければ、残り9,900件を急いで処理する意味はありません。

通過率と、納品できる割合を分けて測る

AI検品の結果を見るときは、「何件を合格にしたか」だけでは品質を判断できません。AIを通過する割合が高くても、その中に不良品が多ければ、後工程の検品や手戻りが増えます。

少なくとも、次の数字を分けて確認します。

  • 提出数のうち、AIが合格とした割合
  • AIの合格品のうち、人も合格とした割合
  • AIの不合格品のうち、人が合格へ戻した割合
  • 人の二次検品後、最終的に納品へ使えた割合

不合格条件を追加すると、AIを通過する割合は一時的に下がることがあります。しかし、AIの合格品が人の二次検品を通る割合は上がります。目的はAIに多くの件数を合格させることではなく、納品可能な成果物を高い確率で次工程へ渡すことです。

どの条件で人の判断とずれたかも記録すれば、「ピンぼけ判定は安定しているが、反射の判定は厳しすぎる」といった傾向も分かります。品質基準別に結果を確認することで、AIへ任せられる判定と、人の確認を残す判定を分けられます。

本番に入っても、品質基準は固定されない

フィジビリで基準を合わせても、本番では新しい種類の不良が出ます。募集人数が増え、端末や撮影環境、対象データの種類が広がれば、少量検証にはなかった成果物が混ざります。

そのため、本番初期はAIが合格としたものも人が全件確認します。十分な件数で品質が安定した後に、案件の許容水準に応じて抜き取り検品へ移します。

抜き取り検品へ移した後も、これまでにない不良が見つかれば、品質基準へ追加してAIの判定を再調整します。条件を追加した前後で通過率や誤判定率がどう変わったかも確認します。

AI検品は、完成した判定機能を設置して終わるものではありません。実データを見て基準を更新し、AIの合格側に不良が混ざっていないか監視する運用まで含めて成立します。

AIによって不要になるのは、基準が固まった後の反復作業

人に仕事を任せるときも、AIに判定を任せるときも、最初に少量を処理させ、成果物を確認し、判断基準を合わせます。相手が人かAIかによって調整方法は変わりますが、品質を安定させるための工程は変わりません。

AIを導入しても、フィジビリや本番初期の全件検品が不要になるわけではありません。実際の成果物から不良条件を発見し、それを仕様として定義する仕事は人に残ります。

AIによって減らせるのは、品質基準が固まった後に、同じ条件で何度も繰り返す一次判定です。人の判断をいきなり置き換えるのではなく、人が基準を作り、AIとすり合わせ、安定した部分から任せていく。この順番を守ることで、AI検品を大量処理の工程として使えるようになります。

AI QUALITY CALIBRATION

AIと人の品質基準をすり合わせます

株式会社イングクラウドでは、少量データによるフィジビリ、AIが合格とした成果物の全件確認、不良条件の整理、本番初期の検品まで、AIを大量処理へ組み込む品質管理工程をご提案します。

継続BPO・業務運用支援について相談する