会話の映像に二人の顔が映っていて、一人の口が動いている。それだけで、その人を話者と判断できるでしょうか。

映画やインタビューには、画面外から聞こえる声、声を出さずに口だけ動かす人物、別の人物の声に重なる反応、編集による映像と音声のずれがあります。映像だけを見て「口が動いている人」を選んでも、実際に聞こえている声の話者とは一致しません。

AVA ActiveSpeakerは、この問題を「顔が映っているか」ではなく、映像中の人物がその時点で発話し、その声が聞こえているかという単位に分解したデータセットです。

「話しているように見える」と「その人物の声が聞こえる」は別の判断です。映像と音声を組み合わせる研究では、この二つを一つのラベルへまとめない設計が重要になります。

動画全体ではなく顔の軌跡を追う

話者を記録するには、まず動画の各場面に登場する顔を検出し、同じ人物の顔を時間方向につなぐ必要があります。この連続した顔の領域は、一般にフェイストラックと呼ばれます。

一つの場面に三人が映っていれば、「この場面では誰が話しているか」という一問ではなく、三人それぞれの顔について発話状態を判定します。話者が途中で交代した場合も、顔ごと、時刻ごとの変化として記録できます。

この設計には、複数人が同時に話す場面を無理に一人へ絞らなくてよい利点があります。一方、横顔、遮蔽、急なカット、暗い場面では顔の追跡自体が不安定になります。発話ラベルの前に、誰の顔を追跡しているのかという基礎データの品質が問われます。

発話状態を三つに分ける

AVA ActiveSpeakerでは、顔の状態を大きく次のように区別します。

  • 話しており、その声が聞こえる
  • 話しているように見えるが、その声は聞こえない
  • 話していない

二番目の区分があることで、遠くにいる人物の口が動いている場面や、映像内では会話していても別の音声が重ねられている場面を、「聞こえる話者」と分けられます。

作業者には静止画だけを見せるのではなく、判定対象の前後を含む短い映像と音声を提示する必要があります。口の開閉だけで判断せず、声の開始・終了、顔の動き、場面の文脈を合わせて確認できるようにするためです。

口の動きと声のタイミングが一致するとは限らない

難しいのは、発話が始まる瞬間と終わる瞬間です。発音の前に口が動く場合もあれば、語尾の音が残っている間に口が閉じる場合もあります。笑い声、息、咳、相づちを発話へ含めるかによっても境界が変わります。

そのため、作業指示には「人の声が聞こえ、対象人物の口の動きと対応していること」のような判断基準に加え、歌、笑い、ささやき、吹き替え、画面外音声などの例外を示す必要があります。

複数の作業者が同じ区間を判定し、不一致が集中する場面を再確認すれば、単純な多数決では見えない曖昧さも把握できます。特に発話の切り替わり付近は、一定時間単位の一致率だけでなく、開始・終了時刻のずれも確認したい部分です。

「誰が話しているか」でも、研究目的によって正解が変わる

AVA ActiveSpeakerは、既存の映画映像から、画面に映る人物と聞こえる声を対応づける研究に向いています。しかし、同じ話者判定でも、目的が変われば必要な収録条件とラベルも変わります。

会議中の話者交代を調べるなら、参加者別のマイクや座席位置を利用できます。読唇研究では、声が聞こえるかより、口の形と音素がどの時刻で対応するかが重要です。対話ロボットの研究なら、話者だけでなく、視線、身体の向き、誰へ話しかけたかも必要になります。

日本語会話では「はい」「うん」「ええ」といった短い相づちも多く現れます。聞き手がうなずきながら口を動かす場面もあり、長い発話だけを想定した基準では取りこぼしが生じます。

「誰が映っているか」「誰の口が動いたか」「誰の声が聞こえたか」「誰へ話しかけたか」を別々に記録しておけば、研究目的に合わせて後から組み合わせられます。一つの話者ラベルを先に決めるより、観察できる事実を分けて残す方が再利用しやすいデータになります。

ACTIVE SPEAKER ANNOTATION

映像と音声を対応づける話者アノテーションを設計します

株式会社イングクラウドでは、研究目的に応じて、顔・話者・発話区間・視線・呼びかけ先の項目を整理し、相づちや同時発話の基準策定、複数評価者による検品まで対応します。

話者アノテーションについて相談する