四人で話しているとき、一人が発言しても、残る三人が同じように聞いているとは限りません。発言者を見る人、別の人を見る人、短い相づちを入れる人がいます。次に誰が話すかを調べるにも、今の発言者だけを撮っていては、ほかの人の動きが欠けます。

MPIIGroupInteractionは、初対面の三人・四人による議論を、全員の顔と身体が追える複数の視点と音声で記録したデータです。もともとは集団内でのラポール、つまり相手との関係が円滑だと感じる程度を調べるために収録されました。同じ録画に後から視線、発話状態、相づち、身体行動などの注釈が加わり、それぞれ異なる評価課題になっています。

初対面の三人・四人に、意見が分かれる話題を選んでもらう

最初の収録を報告した論文では、ドイツの大学キャンパスから募集したドイツ語話者78人を、四人組12組と三人組10組に分けています。女性は43人、年齢は18~38歳。同じ組の人は事前に知り合いではなく、一人が参加する会話は一回だけです。こうして初対面という条件をそろえ、性格、発言量、視線を向ける相手など、会話中に生じる違いを残しました。

各組には話題の候補を示し、組の中で最も意見が分かれそうなものを選んでもらいました。話題そのものは全組で同一ではありません。研究チームは参加者が議論に加わりやすくするためにこの方法を採りました。実験者が部屋を出た後、各組は約20分話し、合計22会話を収録しました。

初対面の最初のやり取りを記録するため、参加者には「最初は互いを知るための練習で、その後に本収録を行う」と説明しました。しかし録画は最初から始まっており、後続の本収録はありません。会話後には、この説明が事実と異なっていたことを伝えたうえで、データの研究利用と公開について自由意思による同意を得たと報告されています。この手続きは、この収録で実際に採られた方法として捉える必要があります。

全員の顔を追えるよう、8台のカメラを同期する

収録場所は、ほかの人が使わない静かなオフィスです。参加者は互いに向き合って議論できる位置に座りました。公式の収録図と説明によると、頭を動かしてもそれぞれの顔の近正面像が得られるよう、頭より少し高い位置に計8台のカメラを配置し、映像のフレームを同期しました。四人組の図では、各参加者の背後に2台ずつ置かれています。一台の全体映像だけに頼らず、頭を動かした参加者の顔や身体も複数の視点から追える配置です。こうして収録した映像は、後の研究で視線や身体行動を判定するためにも使われました。

音声には、無指向性のマイク4本を用いました。顔を隠さずに収音できるよう、参加者の前方で少し高い位置に置かれています。一方、この4本を「各参加者の声だけを収めた独立音声」とは説明していません。8台の映像がフレーム同期されていることと、4本のマイクが参加者別の独立音声であることは別です。

元の収録機材の数と、後に利用者へ渡す版の構成も分けて考えます。MultiMediateの視線・次話者などの課題では、一人につき正面映像一視点と、一会話につき一つのマイクの音声を提供すると公式ページが説明しています。身体行動認識向けの版では、各人の正面映像と側面映像二視点を提供します。8台の元映像と4本の元音声が、すべての評価課題でそのまま入力になるわけではありません。

同じ録画を、人物・相手・時刻の違う正解へ変える

収録時にラポールを調べるため、参加者は会話後にほかのメンバーそれぞれについて質問票へ回答しました。「グループ全体の雰囲気」という一つの印象ではなく、誰が誰に対してどう感じたかが出発点です。2018年の研究では、ある人について他のメンバーが付けたラポール評価を平均し、その人が集団内でどの程度ラポールを築けたかという予測値に変えました。参加者の性格も質問票で測定しています。

後続研究は同じ録画を別の問いに使いました。視線については2018年の研究で、誰の視線がどの人の顔へ向いたかを時点ごとに人手で記録しました。2021年のMultiMediateでは、後から追加された視線接触の注釈として6,254フレームを報告し、全録画の各時点で誰が話しているかも細かく付与しています。ここでいう「視線接触」は、二人が相互に見つめ合ったという判定ではなく、ある人が別の人の顔を見ているかという判定です。

知りたいこと 入力として見る範囲 正解の単位 記録する関係
視線接触 10秒の映像と音声 末尾の一時点における一人の視線 見る人から、顔を見られる人へ
次話者 10秒の映像と音声 終了1秒後に各人が話しているか 現在の発話状態から各人の将来の発話状態へ
バックチャネル 10秒の映像と音声 対象者の短い反応の有無・同意の程度 反応した人から、そのときの話者へ
身体行動 個人の正面・側面映像 行動の開始と終了、評価では短い映像区間 どの人が何をしたか

表の「次話者」は、実際に次の発話が始まった人だけを当てる課題ではありません。MultiMediateでは10秒を見た後、その1秒後に各参加者が話しているかを予測します。相づちや短い賛否の発言も「話している」に含め、笑い声、せき、会話を止めるほどの長い思考中の間は含めないという基準を設けました。複数人が同時に話す場合もあるため、各人について別々に判定する形式です。

相づちの有無と同意の程度は、別々に判定する

相づちなど、話者の発言中に聞き手が示す短い反応を「バックチャネル」と呼びます。2022年のMultiMediateでは後から、音声で聞こえる反応と映像で見えるうなずきなどをそれぞれ注釈し、重なるものを一つの反応として統合しました。単語だけで機械的に決めるのではなく、音声や映像から、その場で反応が起きたかを人が判定しています。評価では10秒の入力区間の終わりに対象の反応があるかを見ます。

さらに、見つけたバックチャネルが現在の話者へどの程度の同意を示すかを、三人の評価者が文脈を踏まえて採点し、平均を正解値にしました。「うん」が常に同意を示すとは限らないため、反応の発生と同意の強さは別のラベルです。注釈の誤りだと三人とも判断した反応は、評価用サンプルを作る際に除かれています。

2022年のBBSI研究は、さらに別の単位を採りました。78人それぞれの映像に、ジェスチャー、身づくろい、腕組み、姿勢を変える動きなどの開始・終了を付け、原論文では15種類の身体行動を扱っています。一人の全区間を一人の作業者が注釈し、別の作業者が確認しました。品質評価用には複数の作業者が同じ短い映像を判定し、行動によって一致のしやすさが違うことも確かめています。MultiMediate 2023の共有タスクでは、この注釈から選んだ14クラスを対象に、64フレームの短い区間を分類する課題が設けられました。

収録条件をそろえ、会話の違いを残す

同じ部屋、初対面の組、約20分という長さ、同時に記録する映像と音声をそろえたうえで、組の人数、選ぶ話題、誰を見るか、発言の順序、反応、身体行動には違いを残しています。ただし人数や話題を無作為に割り当てて効果を比較した実験ではありません。「四人だと三人より視線接触が増える」といった因果関係まで、この収録設計だけで答えることはできません。

MultiMediateの評価には、この22会話のほかに、収録時に作られながら公開されていなかった6会話もテスト用として使われました。その6会話では話題を無作為に決め、参加者に反対の立場を取らせており、22会話の話題選択方法とは異なります。人数を「28会話の公開データ」と足し合わせることはできません。

複数人の会話を後から評価データにするには、まず全員の顔・身体・声を同じ時間軸で追えるように収録し、次に「見る人→見られる人」「反応する人→話している人」のような関係を定めます。そのうえで、視線なら時点、次話者なら将来の発話状態、身体行動なら継続区間という単位を選ぶ。MPIIGroupInteractionは、同じ映像から答えたい問いに応じて切り出し方と正解を変えた例です。

RESEARCH DATA SUPPORT

複数人の会話収録と、人物間の行動アノテーションをご相談いただけます

株式会社イングクラウドでは、研究目的に応じた参加者募集、集団会話の収録、映像と音声の対応付け、発話・視線・身体行動のアノテーションや検品を支援しています。誰のどの行動を一件として記録するか、収録条件と作業指示を決める段階からご相談いただけます。

学術研究・実証実験支援について相談する