同じ「分かりました」という発話でも、声の強さ、表情、頭や手の動きによって、納得、怒り、失望など異なる感情に見えます。では、感情は声だけから読めるのでしょうか。それとも、相手とのやり取りや非言語行動まで同じ時間軸で記録する必要があるのでしょうか。
IEMOCAPは、この問いを検討するため、二人の俳優による対話を、音声、映像、書き起こし、顔・頭・手のモーションキャプチャとともに収録した英語データセットです。感情を単独の音声や一枚の表情として切り出さず、会話の流れの中で複数の手がかりがどう連動するかを扱えるようにしています。
IEMOCAPのラベルは、話者本人の内面を測定したものではありません。第三者が音声・映像と会話文脈から知覚した感情です。また、参加者は演技経験者であり、日常会話をそのまま記録したコーパスではありません。
10人の俳優を男女一組の5セッションに分けた
IEMOCAPの原論文によると、参加者はオーディションで選ばれた女性5人、男性5人の計10人です。内訳はプロの俳優7人と、南カリフォルニア大学演劇学科の上級学生3人でした。
男女一組で5組を作り、各組を一つの収録セッションとしています。各セッションは休憩を含めて約6時間、最終的なコーパスは約12時間です。「参加者10人」「5セッション」「約12時間」はそれぞれ異なる単位であり、会話数や発話数ではありません。原論文はコーパス全体の会話数を明記していないため、本記事でも推定値は示しません。
演技指導者の監督下で台本を覚え、狙った感情が誇張や戯画化にならないようリハーサルを行いました。参加者を単に「怒った声を出せる人」として集めるのではなく、相手との対話の中で感情を表現できる演技経験を参加条件にした設計です。
台本条件と即興条件では感情の引き出し方が異なる
IEMOCAPは、台本のある演技と、設定だけを与える即興の二つを収録しています。ただし、論文でspontaneousまたはunscriptedと呼ばれる部分も、日常生活を偶然記録したものではありません。俳優が研究者の用意した架空の状況に基づいて即興した対話です。
台本のある対話
研究チームは100本を超える約10分の戯曲を読み、演劇の専門家の監修を受けて3本を選びました。選定条件は、幸福、怒り、悲しみ、欲求不満、中立という対象感情を含むことと、男女一人ずつの役で構成されていることでした。
台詞と物語の進行が決まっているため、異なる組の演技を比較しやすい一方、劇中では感情が徐々に移り変わります。実際、後述する感情ラベルの一致率は、即興条件より台本条件の方が低くなりました。
状況と役割を与えた即興対話
即興条件では、過去に感情を生じさせた状況を人々から集めた先行研究を参考に、8種類の架空場面を作っています。たとえば、一時間並んだ後に必要書類の不足を理由に手続きを断られる場面では、一人を申請者、もう一人を窓口担当者とし、それぞれに欲求不満と怒りという異なる対象感情を設定しました。
ほかにも、結婚を友人へ報告する、航空会社に紛失手荷物への補償を求める、親しい友人を亡くした人を慰めるといった場面があります。参加者は台詞を指定されず、自分の言葉で会話しました。台本条件は言語内容を制御し、即興条件は設定と役割を制御するという違いがあります。
一度に計測した身体動作は一人分だけだった
モーションキャプチャでは、計測対象者の顔に直径約4ミリのマーカーを53個取り付けました。頭部のバンドに2個、両手首のバンドに各2個、両手に各1個を加え、合計61個のマーカーを使用しています。ただし、手指を個別に追跡できる構成ではなく、論文は手のおおまかな移動を取得するものと説明しています。
VICONのカメラ8台を計測対象者から約1メートルの位置に置き、毎秒120フレームで記録しました。参加者には、着席したまま自然に身振りを行い、手で顔を隠さないよう指示しています。収録開始時には、基準となる顔形状を得るため約2秒間の中立表情も記録しました。
二人へ同時にマーカーを付けると反射材や機器が干渉するため、一回の収録でモーションキャプチャしたのは一人だけです。台本と即興場面を収録した後、マーカーをもう一人へ付け替え、休憩を挟んで再度収録しました。したがって、同じ一回の会話について二人分の詳細なモーションデータが同時に存在するわけではありません。
音声・映像・動作を一つの時間軸へ合わせる
音声は二人へ向けたSchoeps CMIT 5Uショットガンマイク2本を使い、48kHzで収録しました。映像はSony DCR-TRV340を2台使用し、各参加者を斜め正面から記録しています。
マイク、デジタル映像、VICONの計測時刻を合わせるため、両端に反射マーカーを付けたカチンコを使用しました。音と映像だけでなく、モーションキャプチャ側にも同じ同期基準を残す仕組みです。
モーションデータの復元にはVICON iQ 2.5を使用しました。マーカー位置のテンプレートは人手で割り当て、ソフトウェアが追跡できなかった箇所も監督下で修正しています。欠損が30フレーム未満、すなわち0.25秒未満の場合は三次補間で埋めました。
急な動きがあっても自然な対話を優先して収録を止めなかったため、手の重なりやまぶたの動きによるマーカー欠損が残っています。IEMOCAPの品質管理は、欠損を完全に発生させない方式ではなく、復元工程と補間条件を定めて処理する方式でした。
10,039発話区間を人手で切り分けた
収録後、対話は話者ターン単位で人手分割されました。ターンは、一人の俳優が継続して能動的に話している区間と定義されています。「mmhh」のような短い能動的傾聴は独立した区間にしていません。
最終的なターン数は10,039件で、台本条件が5,255件、即興条件が4,784件です。平均時間は4.5秒、平均語数は11.4語でした。書き起こしは専門業者Ubiqusが作成し、Sphinx-IIIによる強制アライメントで単語境界と音素境界を推定しています。
ただし、原論文はアライメントを厳密には評価しておらず、予備的な確認で、とくに発話が重ならない区間では境界が正確に見えたと述べるにとどまります。したがって、単語・音素境界まで一律に検品済みと解釈することはできません。
収録時の狙いをそのまま感情ラベルにしなかった
収録で対象にした感情は、幸福、怒り、悲しみ、欲求不満、中立の5種類でした。しかし、即興対話には興奮、恐れ、驚きなども現れます。そのため注釈では、怒り、悲しみ、幸福、嫌悪、恐れ、驚き、欲求不満、興奮、中立の9カテゴリーを用意し、該当しない場合は「その他」とコメントを入力できるようにしました。
カテゴリー評価者は、英語に堪能なUSCの学生6人です。各発話区間を異なる3人が評価しました。評価者はANVIL上で映像を見ながらターンを順番に処理し、音声、映像、先行する会話文脈を参照しました。1回の作業は約45分に分け、セッション間に十分な休憩を取るよう指示されています。
原則として一つのラベルを選びますが、混合感情を表現できるよう複数選択も認めました。最多票が一意に決まったターンを一致としたところ、一致率は全体で74.6%、台本条件で66.9%、即興条件で83.1%でした。全ターンのFleissのκは0.27、一致したターンに限ると0.40です。
分布図など一部の分析では、最多票が一意に決まったターンだけを選別しています。ただし、公開データ全体から不一致ターンを削除したという意味ではありません。何を「正解ラベル」として学習・評価に使うかは、利用者側でも確認が必要です。
感情名だけでなく三つの連続尺度でも評価した
カテゴリーとは別に、感情価、活性度、優位性をそれぞれ1から5で評価するSAM方式も採用しました。この評価は2人が担当し、原論文執筆時点で全データの約85.5%まで完了していました。
評価者間信頼性を示すCronbachのαは、全体で感情価0.809、活性度0.607、優位性0.608でした。同じ「怒り」でも強さや快・不快の程度は異なるため、カテゴリー名と連続値を併用しています。
公開されるデータと利用条件
公式配布ページでは、約12時間のデータとして、二人の音声と映像、一方の話者の顔・頭・手のモーションキャプチャ、会話の書き起こし、単語・音素・音節単位のアライメント、複数評価者によるカテゴリー評価と次元評価を案内しています。
自由に再配布できる公開データではなく、申請と利用許諾が必要です。公式ライセンス文書では、内部の研究目的に用途を限定し、許可のない第三者提供や派生物の再配布、商用利用を認めていません。利用前には最新の申請画面とライセンスを確認する必要があります。
類似データを制作するときに分けて決めたいこと
第一に、「セッション」「会話」「発話区間」を別の管理単位にする必要があります。IEMOCAPでは短い相づちを独立区間にしていないため、同じ録音でも分割基準によって件数や感情分布が変わります。対象とする行動に相づちや無言の反応が含まれるなら、収録前に区間化ルールまで決める必要があります。
第二に、収録時に狙った感情と、評価者が知覚した感情を分けて保存することです。最終ラベルだけでなく、各評価者の回答、複数選択、不一致、評価時に参照した文脈を残せば、後から多数決以外の集約方法も検討できます。
第三に、同期精度と欠損処理を収録仕様へ含めることです。複数の機器を使う場合、同期基準、サンプリングレート、欠損の検出方法、補間可能な長さを事前に決めなければ、音声と表情・動作の時間的な関係を正しく分析できません。
IEMOCAPは、感情名を付けた音声を集めるだけでなく、感情を引き出す状況、参加者の演技経験、対話の区間化、評価者が見る文脈、複数信号の同期、欠損処理、利用許諾までを一つのデータ制作工程として設計した事例です。
RESEARCH DATA SUPPORT
感情対話の収録・同期・アノテーション設計をご相談いただけます
株式会社イングクラウドでは、感情研究やマルチモーダル研究に向けた参加者募集、対話課題の運営、音声・映像収録、発話区間の作成、複数評価者による感情アノテーション、検品を支援しています。研究上の問いを、参加者条件、収録シナリオ、作業指示、評価項目へ落とし込む段階からご相談いただけます。
