人が動画で意見を話すとき、意味は言葉だけに含まれるわけではありません。「よかった」という文でも、声の調子や顔の動きによって受け取られ方は変わります。では、言葉・声・表情の寄与を調べられるデータは、どのような単位と手順で作ればよいのでしょうか。

CMU-MOSEIは、オンラインの意見動画を文単位に分け、テキスト・音声・映像を対応づけ、センチメントと6種類の感情を別々に注釈したコーパスです。本記事ではモデル性能ではなく、動画の選別から区間化、注釈、標準分割、現在の配布範囲までをたどります。

まず「動画・話者・発話区間・時間」を分けて数える

ACL 2018の原論文が報告した完成時の規模は、3,228本の動画、1,000の話者アイデンティティ、23,453の発話区間、合計65時間53分36秒です。話題は250種類、1動画当たりの区間数は平均7.3、1区間の長さは平均7.28秒でした。

単位 原論文の数値 数え方の注意
元動画 3,228本 選別後に残った動画
話者アイデンティティ 1,000 投稿チャンネルを人物の代理指標として使用
発話区間 23,453 句読点を手掛かりに分けた文単位
収録時間 65:53:36 動画・区間の件数とは別の総時間

「1,000人」は顔認証などで全動画の人物同一性を確認した人数ではありません。論文では、同じYouTubeチャンネルの動画は同じ人物によるものとみなし、チャンネルをアイデンティティの代理にしています。1チャンネルから採る動画は最大10本、各アイデンティティに含める文は10〜50文に制限されました。

YouTubeの独話を5,000本から3,228本へ絞った

素材はYouTube上の意見動画です。250の一般的な話題を検索語にし、顔検出によって画面内の話者が1人である独話を探しました。移動中の自撮りや車載カメラのようにカメラが動く動画は除外し、話者がカメラへ注意を向けていること、投稿者が作成した適切な句読点付きの書き起こしがあることを条件にしています。実験室収録ではないため、背景、照明、マイクなどを統一したとは論文に記されていません。

自動収集した5,000本を、14人の専門評価者が3カ月かけて映像・音声・書き起こしの品質について確認し、独話であることと性別も確認しました。最終的に3,228本が残り、話者の性別構成は男性57%、女性43%と報告されています。さらに、顔抽出の信頼度と強制アラインメントの信頼度による自動検査も行われました。年齢、母語、出身地などの参加者属性は、原論文と現行SDKの説明では確認できません。

発話区間は「感情の変わり目」ではなく句読点で切った

動画の分割単位は、投稿者による書き起こしの句読点から得た文です。論文では、無作為に選んだ20本について2人の専門家が確認し、この方法がStanford CoreNLPの文分割より良好だったとしています。感情や話題が変化した位置を人手で境界にした、顔が見える区間だけを後から切り出した、といった工程は記載されていません。

書き起こしはP2FAによって音素レベルで音声へ強制整列され、映像・音響特徴は単語の時間区間へ補間して対応づけられました。つまり、1つの発話IDに映像・音声・書き起こしが単に同梱されているのではなく、時刻区間を介して同じ発話・単語へ対応します。

映像・音声・テキストを別々に抽出して時間軸をそろえる

テキストには手動書き起こしとGloVe表現が使われました。映像は30Hzで処理し、MTCNNで顔領域を検出したうえで、OpenFaceの顔ランドマーク、頭部姿勢、視線など、FACETの表情関連特徴を抽出しています。音声にはCOVAREPを用い、MFCC、基本周波数、声帯音源に関する指標などを抽出しました。これらは原動画そのものではなく、各モダリティから計算した特徴量です。

公式Multimodal SDKでは、特徴量と開始・終了時刻を「computational sequence」としてCSD(HDF5)形式に格納します。現在のMOSEI配布定義には、時刻付き単語・音素、GloVe、COVAREP、OpenFace 2、FACET 4.2、全ラベルが含まれます。SDKは更新されており、音響特徴の問題を修正した版もあるため、再現実験では系列名と版を記録する必要があります。

センチメントと6感情は別の尺度で評価した

各発話区間はAmazon Mechanical Turkの3人が評価しました。評価者は承認率98%超のMasterワーカーに限定され、作業前に5分間の訓練動画を視聴しました。論文は、過度な訓練による暗黙の偏りを避け、群衆が知覚する感情を集めるためだったと説明しています。

注釈 尺度 意味
センチメント −3〜+3 強い否定、否定、弱い否定、中立、弱い肯定、肯定、強い肯定
6感情 各0〜3 幸福・悲しみ・怒り・恐れ・嫌悪・驚きについて、なし、弱い、あり、強い

公式のMOSEI READMEが示すとおり、感情は排他的な1クラス分類ではなく、同じ区間に複数の感情を付けられます。センチメントの方向と感情の種類・強さも別です。原論文本文と現行SDKのREADMEでは、3人の評価を最終値へ統合する詳しい手順や、κ係数など数値化された評価者間一致度は確認できませんでした。したがって、「多数決で決定した」「一定の一致度未満を除外した」とは断定できません。

標準分割は動画IDで分かれるが、話者非重複は確認できない

現行SDKの標準分割ファイルには、訓練2,249、検証300、評価678の相互に重複しない動画IDが列挙されています。これは発話区間数ではなく、元動画IDの数です。合計は3,227で、原論文の3,228本との差を説明する記載は確認できませんでした。

また、分割ファイルが保証するのは動画IDの非重複です。論文はチャンネルを人物の代理指標にしていますが、同じチャンネル/人物が複数分割へ入らないようにしたとの明記は、確認した原論文・公式SDK資料にはありません。未知話者への汎化を評価する用途では、「標準分割だから話者独立」と置かず、アイデンティティ単位の再点検が必要です。

現在公開されるのは原動画ではなく加工済み系列

2018年の論文は、収集対象を再配布可能なCreative Commons動画と説明していました。一方、現在の公式SDK FAQは、YouTube投稿者のプライバシーを理由に生動画を共有せず、匿名化した加工済み特徴量のみを共有すると明記しています。公開される時刻付き単語・音素、特徴量、ラベルと、元動画の映像・音声は区別しなければなりません。

SDKのコードにはMIT Licenseが示されていますが、それを元YouTube動画の利用許諾と読み替えることはできません。元動画の権利は投稿者と配信プラットフォームの条件に従い、現在の配布範囲は公式SDKの案内を基準に確認する必要があります。

データ制作で参考にしたい設計上の要点

ここからは、上記の事実を踏まえた株式会社イングクラウドによる実務上の考察です。CMU-MOSEIで実施された未記載の工程を補うものではありません。

  • 単位ごとにIDと母数を分ける:人物、収集元、動画、発話区間、時間を別項目にし、どの段階で除外されたか追跡できるようにします。
  • 分割規則を先に決める:評価対象が未知話者なら人物単位、未知チャンネルなら収集元単位で分割し、発話区間を作った後にランダム分割しない設計が必要です。
  • 二つの注釈課題を混ぜない:センチメントと個別感情は別画面・別定義で扱い、評価者別の生値、統合値、除外理由を残すと、曖昧さと品質を後から検証できます。
  • 境界と同期を検品対象にする:ラベルだけでなく、文境界、単語時刻、顔追跡、音響特徴の欠損を検査し、加工ツールと版も記録します。
  • 公開物を層別化する:原素材を配布できない場合に備え、特徴量、時刻情報、ラベル、メタデータごとに公開可否と利用条件を管理します。

CMU-MOSEIの価値は、23,453区間という規模だけではありません。公開動画を機械的に集めて終わりにせず、独話と書き起こしを条件に選び、文境界で区切り、三つのモダリティを時刻で対応づけ、センチメントと感情を異なる尺度で評価した点にあります。同時に、人物同一性の代理指標や版による配布差は、類似データを設計するときに明示すべき限界も示しています。

RESEARCH DATA SUPPORT

映像・音声・テキストを対応づけた研究データ制作を支援します

株式会社イングクラウドでは、研究目的に応じた収集条件と分割単位の設計から、文字起こし、時間同期、感情・センチメントのアノテーション、品質管理まで支援します。

学術研究・実証実験支援について相談する