共同作業中の感情は、発話ごとに一つの名前へ切り分けられるとは限りません。意見が一致して安心する、順位づけで対立して緊張する、といった変化は時間の流れの中で起きます。その動きを音声・顔・生理反応と結びつけるには、収録と評価をどのように設計すればよいのでしょうか。

RECOLAは、2人がビデオ会議で共同課題に取り組む様子を、音声、映像、心電図(ECG)、皮膚電気活動(EDA)とともに記録したフランス語のマルチモーダルデータベースです。本記事では、46人を収録した研究全体と、27人を用いたAVEC等の評価セット、現在公開される23人分を区別して整理します。

46人を23組にし、別室から合意形成に取り組んでもらった

2013年の原論文では、フリブール大学心理学部から46人(女性27人、男性19人、平均22歳、標準偏差3歳)を募集し、23組のペアを作りました。全員がフランス語を話しますが、母語はフランス語33人、イタリア語8人、ドイツ語4人、ポルトガル語1人です。参加者の自己申告では、相手をよく知っていた人は20%だけでした。ペアを作る具体的な割当手順は論文に記載されていません。

2人は同じ大学内の別室に分かれ、Skypeの全画面ビデオ会議で対話しました。自宅同士を結んだ遠隔収録ではありません。課題は「冬季サバイバル課題」で、遭難時に必要な15品目を重要度順に並べます。最初に各自で最大10分間回答し、その後、相手と議論して一つの順位へ合意するよう求められました。共同討議は平均約15分でした。

感情を演じさせなかったが、気分と提示条件は操作した

参加者へ「怒る」「喜ぶ」といった感情表現は指示していません。一方で、まったく無操作の自然会話でもありません。開始時のSAMによる自己評価をもとに、各ペアの一方には肯定的または否定的な映像、もう一方には中立的なスクリーンセーバーを見せ、気分の条件を調整しました。共同討議開始時は否定条件12人、中立条件24人、肯定条件10人でした。

さらに半数のペアは、相手の感情状態を表す絵文字を映像上へ連続表示するEmotiBoardを使用しました。この絵文字は自動認識ではなく、別画面で参加者を見ていた実験担当者が操作するWizard-of-Oz方式です。したがって、RECOLAの会話は共同課題から生じた自発的行動ですが、気分誘導と感情フィードバックの実験条件を含みます。

9.5時間を収録し、各参加者の冒頭5分を評価した

全収録は9.5時間を超えますが、連続アノテーションの対象は各参加者の共同討議の冒頭5分です。論文は、冒頭ほど戦略について活発に話し合っていたことと、注釈量を抑えることを理由に挙げています。これにより評価対象は、46人分の音声・映像3.8時間、そのうち全モダリティがそろう部分2.9時間となりました。セッション全体の平均約15分と、注釈対象の5分を混同できません。

範囲 人数・時間 意味
研究全体 46人・23組、9.5時間超 音声・映像を収録した全体
連続評価 各人の冒頭5分、計3.8時間 感情価・覚醒度の注釈対象
全モダリティ評価 2.9時間 音声・映像・ECG・EDAがそろう部分

音声を基準に映像と生理信号を1ミリ秒精度でそろえた

高品質音声はAKG C520Lの単一指向性ヘッドセットマイク、Lexicon Omega外部サウンドカード、Audacityで44.1kHz・16bit収録しました。映像にはLogitech C270を使用し、可変30fpsの記録をH.264の固定25fps、1080×720画素へ変換しています。原論文はECG・EDAをBiopac MP36で1kHz収録したと記しますが、現行の公式モジュールページはMP150と記載しており、機種名には資料間の差があります。

映像と同期済みのウェブカメラ内蔵マイク音声と、高品質マイク音声の両方に明瞭に現れる破裂音などを人手で指定し、相互相関が最大になる位置を−10〜+10ミリ秒の範囲で1ミリ秒ずつ探索しました。ECG・EDAは、Biopacの開始パルスを高品質音声の右チャンネルへ記録してハードウェア同期しました。論文は、音声・映像・生理信号について1ミリ秒の同期精度を保証できるとしています。

収録ソフトの停止や電極脱落も発生しました。音声または映像に問題があるセッションは除外し、生理信号だけに問題がある場合は残したため、46人全員に音声・映像があり、完全なマルチモーダル収録は35人でした。欠損を一律に削除せず、利用可能なモダリティによって母数を分けた設計です。

6人が感情価と覚醒度を別々に連続評価した

評価者はフランス語話者6人(男性3人、女性3人)です。非フランス語話者の評価は変化が乏しかったため、言語情報と非言語情報の両方を利用できるフランス語話者に限定されました。評価にはウェブベースのANNEMOを用い、映像を見ながら−1〜+1、0.01刻みのスライダーを操作しました。覚醒度と感情価を同時には入力させず、認知負荷を抑えるため別々に評価しています。

評価者には口頭説明と4ページの手順書を渡し、SEMAINEの2映像で操作を練習させました。映像の停止や途中からの再評価もでき、再評価した値は以前の値へ上書きされました。収集中はスクリプトで、最初の入力が映像開始から5秒以内、連続する入力間の空白が20秒以下であることなどを検査し、不合格の系列は再評価させています。

反応の遅れを補正してから6人の曲線を統合した

連続評価は多数決ではありません。20秒未満の欠損を区分的3次補間し、映像と同じ40ミリ秒刻みへまとめた後、評価者・映像ごとの平均値の偏りをゼロ平均化しました。さらに各評価者の曲線を−2〜+2秒ずらし、ほかの評価者との組み合わせごとに平均二乗誤差が最小になる遅延を求め、その平均で時間位置を補正しました。最後に6人の評価を平均フィルタで統合し、正解系列を作っています。

原論文のCronbachのαは、生値で覚醒度0.80、感情価0.74、ゼロ平均化と同期補正後で0.80、0.75でした。後の非同期評価に関する論文やAVECでは、評価者同士の相関に応じて重みづけするEvaluator Weighted Estimator系の正規化も使われています。どの版の統合ラベルを使用したかは、研究ごとに確認が必要です。

RECOLA全体とAVECの27人分、現在の公開範囲は異なる

AVEC 2016は、音声・映像・生理信号がそろう27人を、話者非重複の訓練・開発・評価各9人に分け、性別と母語の構成をそろえました。一方、現在の公式ページは、46人中34人が外部共有へ同意し、訓練・開発区分の23人分を公開すると説明しています。評価区分の注釈は公開せず、規定に沿った性能評価を提供する方式です。研究全体46人、完全な全モダリティ27人、現在公開される23人は異なる母数です。

公開モジュールには、個別評価者の注釈、音声、1,308発話の開始・終了時刻、VAD・音響特徴、ECG・EDAと特徴量、属性・自己評価、映像、フレーム時刻、顔検出・視覚特徴が含まれます。利用申請ページによると、学術・非営利機関はEULAへの署名などを条件に無償利用でき、申請は常勤研究者が所属機関のメールアドレスから行います。商用利用は別ライセンスの問い合わせが必要です。

対話・連続評価データの制作で参考にしたい点

ここからは、以上の一次資料を踏まえた株式会社イングクラウドによる実務上の考察です。RECOLAで実施されたと確認できない工程を説明するものではありません。

  • 課題と感情操作を別に記録する:共同課題、気分誘導、相手へのフィードバック表示は、それぞれ感情へ影響し得ます。条件IDを分離し、自然発生した反応と実験操作を追跡できる構造が必要です。
  • 同期の基準信号を決める:機器名とサンプリング周波数だけでなく、何を基準時計とし、ずれをどう測り、どの精度で補正したかを工程として残します。
  • 評価者別の曲線を保存する:欠損補間、時間シフト、正規化、重みづけによって正解系列は変わります。個別値と処理後の統合値を分け、処理条件と版を管理します。
  • 母数をモダリティ別に示す:収録人数、注釈人数、全信号がそろう人数、公開人数を一つの「参加者数」にまとめないことが、利用可能性の判断に直結します。

RECOLAが示すのは、連続感情データの品質が評価者数だけでは決まらないことです。共同作業の条件、収録機器間の同期、評価者の言語条件、操作の空白、反応遅延、統合処理まで記録して初めて、音声・映像・生理反応と感情曲線を同じ時間軸で比較できます。

RESEARCH DATA SUPPORT

対話収録と連続アノテーションを研究設計から支援します

株式会社イングクラウドでは、共同作業課題と参加条件の設計、音声・映像の収録、時刻同期、連続感情アノテーション、評価者別データと統合値の品質管理まで支援します。

学術研究・実証実験支援について相談する