100人が同じ文章を読めば、発話内容を固定したまま、声の高さ、話速、声質、抑揚といった話者間の違いを比較できます。一方、共通文だけでは、文章が変わっても話者の特徴を捉えられるかを評価できません。

JVSコーパスは、この二つの条件を分けるため、100人の日本語話者から、全員に共通する文章と、話者ごとに異なる文章を収録した多話者音声コーパスです。通常の読み上げだけでなく、ささやき声と裏声も含まれます。

「100人が同じ文を読んだ」といえるのは、コーパス全体ではなく、通常声の共通100文と、特殊発声のうち共通文を使った部分です。話者ごとに異なる通常声30文も含まれるため、100人、共通100文、一人当たり原則150発話を区別して見る必要があります。

日本語母語のプロ話者100人を収録した

JVSコーパスの原論文によると、参加者は日本語を母語とするプロ話者100人です。男性49人、女性51人で、論文は声優などの専門話者、公式プロジェクトページは「声優・俳優など」と説明しています。一般の日本語話者を無作為に募集したデータではありません。

各話者の収録は一日以内に行われ、録音スタジオでプロの音響ディレクターが収録を管理しました。ただし、原論文と配布データのREADMEには、参加者の年齢、出身地、居住歴、方言、読み上げ経験年数、選考方法は記載されていません。使用したマイク、オーディオインターフェース、マイクとの距離、収録ブースの仕様も公表されていません。

一人150発話を四つのセットに分けた

JVSコーパスは、発話内容と発声方法の異なる四つのサブコーパスで設計されています。

サブコーパス 一人当たり 発声 文章の関係
parallel100 100発話 通常声 100人に共通
nonpara30 30発話 通常声 話者ごとにすべて異なる
whisper10 10発話 ささやき声 共通文5文+話者別5文
falset10 10発話 裏声 共通文5文+話者別5文

設計上は一人150発話、100人で15,000発話です。論文では全体約30.4時間とされ、内訳はparallel100が約22時間、nonpara30が約4.4時間、ささやき声と裏声が各約2時間です。

一人当たりの平均時間は、parallel100が13.11分、nonpara30が2.62分、ささやき声が1.24分、裏声が1.18分でした。同じ100文でも、最も遅い話者は最も速い話者の約1.8倍の時間をかけています。文章と発話数をそろえても、収録時間まで同じにはなりません。

共通100文と話者別30文では選び方が違う

parallel100には、単一話者の日本語音声データであるJSUTコーパス内の「voiceactress100」から、音素バランスを考慮した100文を使用しました。この100文を全話者が通常声で読みます。

nonpara30は、voiceactress100を除くJSUTコーパスから文章を無作為に選び、話者ごとに異なる30文を割り当てています。この30文はparallel100と異なり、音素バランスを保証したセットではありません。

共通文は同じ言語内容に対する話者差の比較に使えます。話者別の文は、文章が一致しない条件でも話者表現や音声合成を扱えるかを検討するための部分です。JVSコーパスは、すべてを共通文にするのではなく、比較しやすい部分と文章の異なる部分を意図的に分けています。

ささやき声と裏声も通常声へ対応付けた

whisper10の最初の5文はparallel100の最初の5文と同じで、100人に共通します。残り5文は、その話者のnonpara30に含まれる文章です。したがって、各話者のささやき声10発話には、文章が同じ通常声が存在します。

裏声も、最初の5文はparallel100と同じ共通文です。残り5文はその話者のnonpara30から選びますが、ささやき声の後半5文とは異なる文章です。そのため、通常声と裏声では10文、ささやき声と裏声では共通の5文を比較できます。

論文と公式ページではこのセットを「falsetto10」と表記していますが、現在配布されているZIP内のディレクトリ名とREADMEでは「falset10」です。データ処理時には論文上の名称ではなく、実ファイルのディレクトリ名を確認する必要があります。

48kHzで収録し、公開版は24kHz・16bitに変換した

音声はスタジオで48kHz収録され、SPTKを使って24kHzへダウンサンプリングされました。通常配布版は24kHz、16bitのRIFF WAV形式です。書き起こしはUTF-8で保存されています。

公式ページは、商用利用者向けに48kHz・24bitの高品質版も用意していると案内しています。したがって、論文に記載された収録時の48kHz、無償配布版の24kHz・16bit、商用利用向けの48kHz・24bitは別の仕様です。

論文の収録時間には無音部分も含まれています。一方、個々の音声をどの基準で切り出したか、先頭・末尾の無音を何秒残したか、音量の正規化を行ったか、読み間違いをどの基準で録り直したかは、原論文とREADMEには記載されていません。プロの音響ディレクターが管理したことは確認できますが、具体的な検品表や合否基準までは公開されていません。

話者IDの下に音声・書き起こし・ラベルを配置する

話者IDはjvs001からjvs100です。各話者の下にparallel100、nonpara30、whisper10、falset10のディレクトリがあり、その中へ音声と書き起こしを配置しています。

parallel100とnonpara30には、音声ファイル、transcripts_utf8.txt、音素ラベルが含まれます。フルコンテキストラベルとモノフォンラベルはOpen JTalkで自動生成し、音素アライメントにはJuliusを使用しました。ささやき声と裏声には音声と書き起こしがありますが、同じ音素ラベル構成はありません。

ルートには、話者の性別と通常声のF0範囲をまとめたgender_f0range.txt、発話時間をまとめたduration_info.txt、男女別の話者類似度CSVがあります。通常声のF0範囲は人手で設定し、F0抽出にはWORLDを使用しました。

話者類似度は、同性の全話者ペアについて、Lancersで集めた評価者が−3の「まったく異なる」から+3の「非常に似ている」までで採点しました。一つの話者ペアを10人が評価し、合計1,000人が参加しています。これは音声ファイルの検品ではなく、話者間の知覚的な近さを示す付加情報です。

設計上15,000発話でも配布ZIPは14,997ファイル

原論文とREADMEは、一人150発話、合計15,000発話という設計を示しています。一方、2026年9月20日に公式配布版jvs_ver1のファイル一覧を確認したところ、WAVファイルは14,997件でした。

  • parallel100:9,997件
  • nonpara30:3,000件
  • whisper10:1,000件
  • falset10:1,000件

不足しているのは、jvs030のVOICEACTRESS100_045、jvs074のVOICEACTRESS100_094、jvs089のVOICEACTRESS100_019の3件です。READMEには、この欠番の理由は記載されていません。

また、通常声12,997件に対し、モノフォンラベルとフルコンテキストラベルはそれぞれ12,734件でした。論文が説明する設計上の発話数と、実際に利用できる音声・ラベル数を分けて確認する必要があります。

音声、テキスト、タグで利用条件が異なる

公式ページの配布先はGoogle Driveで、公式GitHubリポジトリは案内されていません。GitHub上には第三者が作成したローダーや変換版がありますが、公式配布物とは分けて確認する必要があります。

音声は、学術機関での研究、企業を含む非商用研究、ブログなどの個人利用に使用できます。再配布は認められていませんが、ウェブサイトやブログで約10音声を公開することは認められています。商用利用には公式ページ記載の連絡先への相談が必要です。

テキストは出典であるJSUTコーパスのライセンスに従い、性別、F0範囲、話者類似度などのタグはCC BY-SA 4.0です。「JVSコーパス全体がCC BY-SA 4.0」と一括して扱うことはできません。

類似する音声データを制作するときの確認点

ここからはJVSコーパスで実施された事実の説明ではなく、株式会社イングクラウドによる実務上の考察です。

第一に、人数、文章、発声様式を別々の比較軸として設計する必要があります。JVSコーパスでは、全員に共通する100文、話者ごとに異なる30文、通常声と文章を対応させた特殊発声を分けています。「100人を集める」だけでは、話者差と文章差を分離して評価できません。

第二に、設計上の発話数と納品ファイル数を分けて管理することです。話者ごとの予定数に加えて、採用音声、欠番、再収録、書き起こし、音素ラベルの有無を照合すれば、15,000発話の設計に対して何が実際に利用できるかを明示できます。

第三に、収録音声と派生データの品質管理を分けることです。録音環境や読み誤りの検品だけでなく、自動生成した音素ラベル、F0、アライメントについても、生成の成否と人手確認の範囲を記録する必要があります。

JVSコーパスは、全員に同じ文章を大量に読ませるだけではなく、話者比較、異なる文章への対応、発声様式の変換という用途ごとに発話セットを組み立てた事例です。多話者音声の規模は、話者数だけでなく、各条件で比較可能な発話が何件あるかまで見て判断する必要があります。

RESEARCH DATA SUPPORT

多話者日本語音声の参加者募集・収録・データ整備をご相談いただけます

株式会社イングクラウドでは、研究目的に応じた日本語話者の募集、共通文と話者別発話文の設計、通常声・特殊発声の収録運営、書き起こしとの照合、ファイル構成の整備、欠番や音質の検品を支援しています。比較したい話者属性や発声条件を、募集条件と収録仕様へ落とし込む段階からご相談いただけます。

学術研究・実証実験支援について相談する