自宅のスマートフォンで録った声と、別の国のパソコンで録った声。録音場所もマイクも違う二つの音声を、どう一つのデータセットに入れるのでしょうか。Mozilla Common Voiceがそろえたのは部屋や機材ではありません。読む文章を用意し、画面に表示して録音し、文章と声が合うかを聞き、公開時に分類するという工程です。

ここで扱うのは、文章を読み上げるCommon VoiceのScripted Speechです。2020年の原論文が説明した仕組みを起点に、現在の公式ガイドと2026年の公開資料で、何を共通にし、何を言語ごと・話者ごとに変えたまま残すのかを見ます。

録音前に、言語ごとの文章を用意する

参加者が同じ画面操作で読めても、全言語に同じ文章を翻訳して配るわけではありません。原論文では、新しい言語を加えるときに画面を翻訳し、読み上げ用の文章は言語ごとに集めると説明しています。当時は言語別の規則によるWikipediaからの抽出と、コミュニティによる文章追加を併用していました。文章の候補をその言語で集めることと、録音画面の操作を共通にすることを分けた設計です。

現在の文章投稿の公式説明では、参加者は自分の言語の文を追加でき、ほかの人の文を審査できます。通常の文章投稿では、人による賛成票が少なくとも二つ付くと有効な文章になります。大量の文章を一括提供する場合は別の提出・品質確認工程があり、すべての文章が同一経路で審査されるわけではありません。

文章には公開用の権利条件も必要です。公式の一括提出ガイドは、パブリックドメインまたはCC0で提供できる文、出典と権利を説明する情報を求めています。投稿ガイドでは読みやすい短文を基本とし、一般的な目安として15語未満を示します。数字は読み方が分かれるため避ける方向ですが、文字体系や表記、固有名詞の判断を全言語で同一の細則にしたわけではありません。言語別の審査基準を設けられます。

読む人と聞いて確かめる人の作業を分ける

読み上げる参加者には、画面上にその言語の短い文章が提示されます。参加者は表示された文章を自分の声で読み、一つの短い音声クリップとして投稿します。原論文が説明する収録はウェブサイトなどを通じたもので、話者全員を同じスタジオに集め、指定マイクを渡す方法ではありません。文章とクリップの対応を最初から持たせるため、後で音声を聞く人には何と読み上げたはずかが見えます。

検証画面では、参加者が録音と表示文の組を聞き、合っているかどうかを投票します。録音の検証ガイドは、語の欠落・追加・言い換え、途中で切れた音声、聞き取れないほどの雑音などを判断材料に挙げる一方、聞き慣れないアクセントだけを不採用の理由にしないよう求めています。背景音が少しあることと、文章を聞き取れないことは別です。同じ人が録音と検証の両方の作業に参加できても、個々のクリップを収録者自身が検証したか、常に別人だったかまでは、この作業の説明だけからは決められません。

2020年の論文では、一つの録音に最大三人が投票し、先に賛成二票なら有効、反対二票なら無効と説明していました。一方、現行のScripted SpeechのREADMEは、二件以上の検証があり賛成票が反対票より多いものをvalidated、反対が多いもの、または三件以上で同数となったものをinvalidatedと定義します。本文では当時の投票手順を現在の全リリースへそのまま当てはめず、公開ファイルの区分は現行READMEに従います。

録音環境をそろえず、採否の問いをそろえる

異なる端末や部屋から集まる以上、マイクの特性、声との距離、背景音、一人が投稿する量は一定になりません。地域や年齢、アクセントの構成も募集だけで均等になるものではありません。Common Voiceはそれらを均一な収録条件へ直すのではなく、表示された文を読み、その録音と文の対応を聞いて判断する作業を共通にしています。

その判断は「このクリップを聞いて表示文と対応すると認めるか」です。投票で有効とされたことは、あらゆる用途に対する完璧な文字起こしや、録音環境の同等性を保証しません。読み方に幅のある語を文章に入れた場合、後段の検証者だけでは揺れを解消しにくいため、文章の選定と録音の採否を別々に設計する意味があります。

公開時に、採否と学習用の分割を分ける

現在のScripted Speechでは、音声はclips/に置かれ、各TSVの一行が一つのクリップを指します。validated.tsvは検証結果が有効となった録音、invalidated.tsvは無効となった録音、other.tsvは採否を決めるだけの検証がまだ足りない録音の一覧です。したがって、公開アーカイブに承認済みの音声しか入っていないわけではありません。

train.tsv、dev.tsv、test.tsvは、承認済みクリップから機械学習用に作る別の一覧です。公式の分割ツールは話者を単位にクリップを振り分け、標準設定では同じ文章を学習・開発・評価の一覧全体で一度だけ使用します。開発用と評価用の件数も学習用の規模から計算するため、三つの件数を足してもvalidated.tsvの全件数とは一致しません。クリップの採否と、学習・評価に使うクリップの選択は別の工程です。

各行のpathは音声ファイルへの相対パス、sentenceは読まれる文章、client_idは利用者のUUIDをハッシュ化した識別子です。賛否の票数も列として残ります。年齢層、ジェンダー、アクセントは提供された場合に限る任意の情報で、言語やリリースによって選択肢や記入率が違います。client_idがあっても、異なるIDが現実の別人を必ず表すとは断定できません。

録音時間と話者の広がりを別々に見る

例えば日本語のScripted Speech v27.0の公式データシートは、2026年9月11日をデータ締切日とし、58万5,330クリップ、録音726.23時間、うち検証済み372.6時間、データシート上の話者7,852を示します。さらに、検証済み30万315クリップに対して、train・dev・testの合計は3万7,736クリップです。録音した総時間、検証済み時間、学習用の件数を一つの「データ量」にまとめてしまうと、工程ごとの違いが消えます。

同じデータシートでは、ジェンダーを自己申告した話者は2,880、年齢を自己申告した話者は3,888と集計されています。属性別のクリップ数だけを見ると、少人数が大量に録音した区分を多数の話者が参加した区分と取り違えます。時間に加えて話者の識別子単位の数と、属性ごとの未回答数を見る必要があります。ただし、自己申告の集計は本人確認によって一人一人を同定した人数を意味しません。

大人数で集める前に、四つの作業を設計する

参加型の読み上げ音声収集で先に決めたいのは、誰にどの文章を提供してもらい、どう審査するかです。次に、録音画面では一文と一クリップの対応を保ち、検証者には文と声の一致を判断してもらいます。最後に、採否が決まった録音、未確定の録音、学習用に選ばれた録音を版ごとに区別します。共通にするのはこの作業と記録の単位であり、言語の文章や話者の声、端末、部屋は違いを残したまま集まります。

Common Voiceには現在、自然な発話を集めるSpontaneous Speechなど別の種類もあります。ここで追った読み上げ文と録音の対応、文章審査、公開区分はScripted Speechの設計です。類似の収集でも、最初に欲しいのが読み上げ音声なのかを決め、言語別の文章基準と音声の採否基準を作ると、参加者が増えても同じ工程で処理できます。

RESEARCH DATA SUPPORT

読み上げ音声の参加者募集・収録・検品をご相談いただけます

株式会社イングクラウドでは、研究目的に応じた参加者募集、読み上げ音声の収録、文章と音声の対応確認、複数人による検品を支援しています。収録条件と採否の判断基準を作業指示に落とし込む段階からご相談いただけます。

学術研究・実証実験支援について相談する