株式会社イングクラウドは、日本語の手書きデータ収集・データセット制作の取り組みをご紹介するため、Hugging Faceに手書き画像データセットのサンプルを公開しました。

今回公開した「Japanese Handwriting — Office Memo」は、日本語ネイティブ55名が同じ短い業務メモを書き写した、55枚の手書き画像を収録しています。同じ文章でも、筆跡、文字の大きさ、改行位置、配置などに違いが見られます。

公開データの概要

  • 日本語ネイティブ55名による手書き画像:55枚
  • 共通の短い業務メモを、黒のボールペンで記入
  • 字をきれいに整えず、普段の字で書くよう依頼
  • 用紙を600dpi・カラーでスキャンし、手書き部分を余白付きで切り出し
  • JPG形式で公開

公開画像には印刷された見本文や説明文を含めず、筆跡や手書きの行の傾きはそのまま残しています。共通の記入文章と収集方法は、データセットのREADMEに掲載しています。

データセットを見る

本データセットは、当社が対応可能な日本語手書きデータの収集・画像作成のサンプルです。大規模な学習用データセットや、汎用的な文字認識性能を測るベンチマークとして設計したものではありません。CC BY-NC 4.0ライセンスで公開しています。

株式会社イングクラウドでは、研究・開発の目的や仕様に合わせて、記入する文章や帳票、参加者の条件などを指定した手書きデータの収集・制作についてご相談を承っています。

大学・研究機関における学術研究や、企業におけるAI・機械学習モデルの研究開発など、用途に応じたデータ制作についてお気軽にご相談ください。

公開済みの音声・対話データセット

当社では、日本語の音声・対話データセットもサンプルとして公開しています。いずれも、2話者のミックス音声、話者別音声、人手で作成したELAN形式の時間情報付き書き起こしを収録しています。

IngCrowd公式Hugging Faceアカウント