人が何かに失敗した動画を見れば、私たちは「ここまでは予定どおりだったが、ここから失敗した」とおおよその境界を判断できます。

しかし、その境界をデータにするとなると簡単ではありません。ジャンプに失敗して転倒した場合、失敗が始まったのは着地した瞬間でしょうか。姿勢を崩した瞬間でしょうか。それとも、踏み切る位置を間違えた時点でしょうか。

Oops! Predicting Unintentional Action in Videoは、人の行動が意図的な状態から意図しない状態へ変わる瞬間を、動画から学習・評価するための研究です。

この研究の面白さは、失敗動画を集めたことだけではありません。「人の失敗をAIに認識させたい」という問いを、作業者が動画上の一点を指定するアノテーションへ変えた点にあります。

研究上の概念をそのまま作業者へ渡すことはできません。「失敗とは何か」を、観察できる対象、回答形式、除外条件、検品方法へ分解して初めてデータになります。

成功か失敗かではなく、途中の変化を測る

動画全体を「成功」「失敗」に分類するだけなら、失敗した結果は分かります。しかし、それでは行動のどこで異変が起きたのか、失敗の直前にどのような兆候があったのかを調べられません。

Oops!が対象にしたのは、行動の結果だけではなく、意図的な行動から意図しない行動への変化です。

例えば、スケートボードで技を始めるところまでは本人の意図した行動です。バランスを崩し、制御できなくなったところからは、本人が予定していなかった行動になります。この変化の境界を時刻として付ければ、少なくとも次の課題を作れます。

  • 映像が意図的な行動か、意図しない行動かを分類する
  • 意図しない行動が始まった時刻を特定する
  • 失敗が起こる前の映像から、その発生を予測する

一つの時間ラベルが、分類、位置特定、予測という複数の研究課題に使われています。何を知りたいかによって、必要なアノテーション単位が変わる例です。

2万本を超える動画を、そのまま作業者には渡さない

研究では、インターネット上の「fail」動画をもとに、20,338本、合計50時間を超える映像を収集しました。ただし、公開動画を集めただけではアノテーションを始められません。

編集されたまとめ動画には、複数の場面、字幕、余白、場面転換などが含まれます。そこで長い動画を場面ごとに分割し、3秒未満の短すぎる場面と、30秒を超える長い場面を除外しました。縦向き動画を横長画面に入れた際の余白も検出して切り取っています。

この前処理には、作業者へ「一つの出来事が始まり、結果が分かる範囲」を見せる意味があります。関係のない複数場面が一つの動画に入っていれば、どの失敗を回答すべきか判断できません。逆に、映像が途中から始まれば、意図的な行動から失敗へ移る境界が見えなくなります。

アノテーションの品質は、作業者の能力だけでは決まりません。作業対象をどの単位へ整えたかも、回答の一貫性に影響します。

作業者には「失敗が始まった瞬間」を指定してもらう

アノテーションにはAmazon Mechanical Turkが使われました。作業者は動画を見て、行動が意図しないものへ変わり始めた瞬間を指定します。

作業者は、承認率99%以上かつ過去の承認件数が1万件以上という条件で絞られており、誰にでも同じ動画を渡したわけではありません。

ただし、研究者が失敗動画として収集したものでも、すべてに明確な失敗が含まれるとは限りません。そのため時刻だけでなく、動画に意図しない行動が含まれているかどうかも回答させました。

この設計が重要です。作業者へ時刻の入力だけを求めると、失敗が見つからない動画でも、どこかに印を付けなければ先へ進めません。その結果、本来存在しない境界が作られる可能性があります。

「該当なし」「判断できない」といった選択肢は、回答を避けるための逃げ道ではありません。観察対象が成立していないデータを発見するためのラベルでもあります。

三人の回答を重ね、境界のばらつきを確認する

各動画のアノテーションは3回行われました。複数人が同じ動画を見れば、境界時刻は完全には一致しません。

一人は姿勢を崩した瞬間を選び、別の人は転倒が避けられなくなった瞬間を選ぶかもしれません。これは単純な作業ミスとは限らず、「意図が崩れた瞬間」という現象自体に幅があるためです。

論文では、作業者間で付けられた失敗時刻の標準偏差の中央値は、動画全体の長さの6.6%、実時間では約0.5秒でした。この研究では比較的一致していたと報告されていますが、回答を一人分だけ採用していたら、こうした一致度は分かりません。

時間アノテーションでは、最終的な代表時刻だけでなく、複数人の回答がどの程度離れたかを残すことで、その境界が明確だったか、判断が割れやすかったかを確認できます。

多数決だけでなく、不自然な回答の出方を見る

品質管理では、三人のうち多数が「意図しない行動はない」と答えた動画を除外しました。また、失敗時刻が動画の冒頭や末尾にあるものも除外しています。

冒頭に境界がある場合は、意図的な行動の部分が切れている可能性があります。末尾に境界がある場合は、失敗後の結果が十分に映っていない可能性があります。これは作業者の回答を誤りと決めつけるのではなく、その回答から動画の切り出し方に問題がなかったかを確認する方法です。

さらに研究者が少量の動画へ正解ラベルを付け、品質の低い回答を検出するために利用しました。テスト用データには4回目のアノテーションも行い、人同士の一致度を別途分析しています。

ここでは、同じ回答が多いから正しいとするだけでなく、作業対象、回答者、設問のどこに問題があるかを複数の方法で確認しています。

「失敗」という言葉を一種類にまとめる限界

Oops!には、転倒、衝突、物を落とすといった身体的な失敗だけでなく、計画や判断の誤り、技能不足、周囲の環境による失敗など、異なる出来事が含まれます。

また、インターネット上で「fail」として公開・編集された動画を利用しているため、日常に存在する失敗を均等に集めたものではありません。映像として面白く、公開されやすい失敗へ偏っている可能性があります。

動画を見た第三者が推測した「意図」と、撮影された本人の実際の意図も、必ず一致するとは限りません。このデータから分かるのは、人の内面を直接測定した結果ではなく、映像から観察者が判断できる意図の変化です。

研究上の概念をデータへ変換するときには、「何を測れるようになったか」と同時に、「その方法では何を測れないか」を明確にする必要があります。

研究の問いを、人が実行できる作業へ変える

Oops!の事例では、「AIは人の失敗を理解できるか」という問いを、そのまま作業者へ尋ねてはいません。

動画を一つの出来事に切り分け、意図しない行動の有無を確認し、変化が始まる時刻を指定し、複数人の時刻差を測る。このように研究上の概念を複数の作業へ分解しています。

新しい研究テーマでは、既存のラベル名やアノテーションツールを選ぶだけではデータを作れません。研究者が観察したい現象について、作業者が何を見て、どの形式で回答し、判断できない場合にどう記録するかを設計する必要があります。

そのうえで少量の試行を行い、回答の不一致が作業ミスなのか、指示の曖昧さなのか、対象となる現象の曖昧さなのかを切り分けます。研究者が定義する概念と、多人数が実行する作業の間をつなぐ工程です。

VIDEO ANNOTATION DATA

研究テーマに合わせた動画アノテーションをご相談いただけます

株式会社イングクラウドでは、研究上の問いをもとに、動画の収集・分割、時間情報を含むアノテーション、複数人評価、判断が分かれた事例の整理、品質管理まで設計します。

動画データ制作について相談する