同じ広告を見た人でも、受け取り方や話し方は同じとは限りません。文化による違いを調べたいとき、映像を撮る場所だけを増やしても、見た広告や会話の話題まで違えば、何が反応の差につながったのか分かりにくくなります。

SEWAは、広告を見る順序と対話の話題をそろえ、異なる文化的背景を持つ参加者の反応を収録しました。さらに、本人が申告した感情と、録画を見聞きした第三者の評価を分けています。比較のために何を共通にし、どの違いを記録して残したのかが、このデータの収集設計の中心です。

広告を共通にして、反応と会話の違いを残す

SEWAの原論文が目指したのは、文化や言語が異なる人の表情、声、発話と感情評価を調べられるデータを作ることです。同じ刺激への反応だけでなく、その刺激について相手と話している間の振る舞いも記録しています。笑顔という特定の表情を全文化で同じ条件に作り、その意味を直接比べた実験ではありません。

参加者は一人ずつ、約60秒の広告を決まった順番で4本見ました。広告には家庭内暴力防止、自動車、香水、タッチ式水栓が含まれます。異なる反応を得るために選ばれた素材ですが、想定した感情が全員に生じたと決めつけることはできません。研究チームは言語による理解の差を小さくするため、台詞のない、映像と音楽が中心の広告を選びました。ただし、文化的背景に応じた字幕版も用意されており、画面上の文字まで全員が同一だったわけではありません。

各人は広告を見た後、質問票で自分の感情状態と広告への態度を答えます。4本目の水栓広告の後は、二人でその広告や商品についてビデオ通話で話しました。買いたいか、誰かに薦めたいか、どこが良かったか、改善するなら何かといった話題が示され、会話の後にも本人が感情と会話への態度を答えました。共通の入口を作りながら、発言内容や会話の進み方は台本で固定していません。

文化と言語を変え、知り合い同士の二人を収録する

対象は英国、ドイツ、ハンガリー、セルビア、ギリシャ、中国の6つの文化的背景です。二人は母語で対話します。登録時には文化的背景、年齢、性別、教育、性格特性、相手との面識を尋ね、文化的背景、年齢、性別を考慮して組み合わせました。実験前から互いに個人的な知り合いであることも条件でした。初対面の人に対して話す状況と、既知の相手に意見を述べる状況が混じらないようにした設計です。

最終的なデータベースを報告した原論文では、成功した198回の収録セッションに398人が参加したとされています。一人につき広告視聴4本と対話1本を別々に数えた録画は1,990クリップです。収録時間は広告への反応が1,600分、ビデオ通話が1,057分で、合計約44時間です。これは会話が1,990件あるという意味ではなく、広告を見ている個人の録画と、二人の対話を参加者ごとに記録した映像を数えたものです。

ただし、6文化の参加者が均等に集まったわけではなく、年齢構成や男女の組み合わせにも違いがあります。文化別の反応を見比べる際には、「英国と中国」という区分だけで説明を終えず、誰が誰と話した映像かまで照らし合わせる必要があります。SEWAがそろえたのは課題の大枠とペアの条件であり、参加者構成そのものではありません。

遠隔収録では、部屋と機材の違いも残る

広告の再生とビデオ通話には専用ウェブサイトを使い、参加者自身のパソコンのカメラとマイクで録音・録画しました。研究室で照明、背景、姿勢、画角やマイクを同じにした収録ではありません。背景雑音や機器の性能も異なり、映像の解像度と音声のサンプリング周波数にも幅があります。

そのため、同じ広告や会話の流れを採用しても、観察される表情や声の違いをすべて文化の違いとは扱えません。一方、このばらつきは収録方法そのものの特徴です。参加者が手元の機器で対話したデータとして読むことで、課題の共通部分と、撮影環境が変わる部分を区別できます。論文は照明や通信状態を文化ごとに完全に統一したとは述べていません。

本人の申告と、録画を見た人の判断を分ける

「その人がどう感じたか」には、本人の回答と他人から見た判断があります。SEWAでは、広告視聴後と会話後の質問票が自己評価です。これとは別に、第三者の評価者が会話映像の一部を見聞きし、対象者の感情価、覚醒度、広告への好感・反感を連続的に評価しました。感情価は肯定的か否定的か、覚醒度は感情の活発さを表す尺度です。

すべての録画を同じ細かさで評価したわけではありません。プロジェクト資料では、10~30秒の538区間からなる基本SEWAデータセットが整備されたと報告されています。一方、原論文が連続評価の対象として説明するのは、対象者が話し、会話相手が沈黙している場面から選んだ90区間です。高い・低い覚醒度、肯定的・否定的な感情価、好感・反感の六つの基準について各15区間を選び、全90区間へ感情価と覚醒度を、好感・反感に該当する30区間へその評価を付けました。

本人は出来事の後に質問票へ答え、第三者は選ばれた会話区間の変化を時系列で示します。評価の対象場面、長さ、回答者が違うため、二つの数値を同じ瞬間の「正解」として直接突き合わせることはできません。何を本人の報告として扱い、何を観察者が読み取った値として扱うかを分けている点が重要です。

音声だけ、映像だけ、両方で評価を分ける

第三者による連続評価には、各文化から対象者と同じ文化的背景の評価者5人を割り当てました。評価者は録画を再生しながらジョイスティックを動かし、感情価、覚醒度、好感・反感を別々に記録します。一度に三つを判断させず、評価する観点を分けた手順です。

さらに各観点について、音声のみ、映像のみ、音声と映像の両方という三つの提示条件を設けました。同じ区間でも、声から読み取る判断と表情から読み取る判断を分けて残せます。これは評価者に渡す情報を変えた比較であり、録画された参加者が三通りの会話を行ったわけではありません。

複数人の評価曲線は、そのまま平均していません。評価者によって反応を記録するタイミングがずれるため、時間的なずれを調整し、評価者間の一致と音声・映像の特徴との対応を使って一つの連続値に統合しました。この値は研究チームが作成した評価用の基準であり、本人だけが知る感情を直接測った値ではありません。なお、論文は感情価と覚醒度を評価する区間と、好感・反感まで連続評価した区間を同数とは記していません。

文化差を見るなら、評価者の条件も記録する

論文は、細かな感情変化を捉えるために対象者と同じ文化的背景の評価者を使い、評価者個人による判断の偏りを抑えるため各文化5人を配置したと説明しています。この配置は、評価者側の文化を収録対象と対応させる設計ですが、異なる文化の評価者が同じ発話をどう受け取るかを直接比較するものではありません。「文化ごとに同じ笑顔の意味が違う」といった結論も、この収集手順だけからは出せません。

類似のデータを作るなら、まず同じ刺激と会話課題を決め、どの言語や字幕を用いたか、誰が誰と話したか、収録環境に何が残ったかを記録します。そのうえで、本人の事後回答と、第三者による時間ごとの評価を別の情報として管理し、評価者の背景と提示した音声・映像の条件をそろえます。SEWAが示すのは、文化だけを変える完全な実験ではなく、そろえた課題と残った違いの双方を追える収集・評価の組み立て方です。

RESEARCH DATA SUPPORT

文化的背景を考慮した対話収録と感情評価をご相談いただけます

株式会社イングクラウドでは、参加者条件の整理と募集、遠隔対話の収録、本人への質問票、第三者による時系列アノテーションや検品を支援しています。比較したい違いを、共通の話題と評価者への指示に落とし込む段階からご相談いただけます。

学術研究・実証実験支援について相談する