合成データSynthetic Data

本物の代わりに作り出した練習用の資料

ポイント
  • 合成データは実際に起きたことではなく、必要があって作り出した資料です。
  • 作る理由は三つです。本物が足りないから、集めにくいから、個人情報だからです。
  • 好きなだけ増やせて正解もすでにわかっているので、ラベルを付ける手間がかかりません。
  • 代わりに本物とずれる部分が残ります。作るときに入れなかった性質はそもそも存在しません。
  • 作った資料をまた元に作り直すと、**本物からだんだん遠ざかります。**だから本物の資料を一定の割合で混ぜておきます。
目次

1たとえで理解する

運動場に芝生を敷く方法には二つあります。一つは本物の芝を植えることです。根付くのを待たなければならず、雨が降れば削れ、たくさん踏むと傷みます。手間がかかる分、代わりのきかない感触があります。

もう一つは人工芝を敷くことです。欲しい分だけ注文して一日で敷けて、雨が降っても使えて、いくら踏んでもそのままです。合成データがこの人工芝です。

人工芝にもずれる部分があります。ボールが転がる速さが違い、滑るときの感触が違います。人工芝でしか練習していないチームが本物の芝の競技場に立つと、足が引っかかります。そして人工芝の質感は結局のところ本物の芝を真似て作ったものです。手本になる本物がなければ、何を真似ればよいかすらわかりません。

2くわしく

なぜ作って使うのか

いちばんよくある理由は本物が足りないからです。稀にしか起きないことほど集めるのが難しいです。機械が故障する瞬間や、とても危険な状況はそう頻繁には経験できませんが、まさにそういう状況をうまく扱うモデルが必要です。

二つ目の理由は資料の中に人の情報が入っているからです。本物の記録をそのまま使えない分野では、統計的な性質だけを似せた資料を新しく作って使うこともあります。個人をたどれないようにすることがこのときの核心です。

三つ目の理由は正解を付ける手間です。人が手で正解を付ける作業には時間と費用が大きくかかります。作り出した資料は何を作ったかすでにわかっているので、正解が自然と付いてきます。

どうやって作るのか

いちばん単純な方法は規則で組み立てることです。ある値がある範囲の中でどう出るかを規則として書いておき、そのまま取り出します。何を作ったかがはっきりわかるので扱いやすいですが、規則に書かなかった性質は資料に現れません。

もう一つの方法は本物の資料を真似て作ることです。実際の資料を学習したモデルが、それと似たものを新しく作り出します。写真や文章はこの方法をよく使います。本物に近い資料が得られる代わりに、手本になった資料の性質がそのまま移ってしまうことを知っておく必要があります。

持っている資料を少しずつねじって増やすこととは区別します。写真を反転させたり明るさを変えたりする作業は元の資料がそのまま残る手直しで、合成データはなかったものを新しく作り出すほうです。

ずれる部分を知ることが要

作り出した資料は作った人が考えた世界だけを含みます。規則に入れなかった例外、本物の資料でまれに出てくる奇妙な値、人が実際にしでかす見当違いの入力はたいてい抜けています。こうした資料だけで学んだモデルは、整った状況ではうまくいっても現場に出るとよくつまずきます。

均一さも落とし穴です。人工芝はどこを踏んでも感触が同じですが、本物の芝は場所によって違います。作り出した資料は互いに似すぎていて、個数だけ増えて学ぶことは増えないことがよくあります。だから個数よりもどれだけ互いに違うかを先に確認します。

だから採点は必ず本物の資料でします。作った資料で学び、作った資料で採点すると良くできているように見えますが、その点数は作った人の想像の中でしか通用しません。

作ったものをまた真似ると

いちばん気をつけるべきは巻き戻しです。作り出した資料で学習したモデルがまた資料を作り、その資料でまた学習することが繰り返されると、本物から少しずつ遠ざかります。人工芝の写真を見て次の人工芝を作り、それをまた真似てさらに作るようなものです。

遠ざかる過程にも順序があります。まず稀なものが消えます。よくある形だけが残り、隅にあったものが消されます。その次には残ったもの同士もだんだん似てきます。だから実際に使うときは本物の資料を一定の割合でずっと混ぜ、作り出した資料が全体のどれくらいを占めるかを記録しておきます。

3もう少し正確に

合成データが個人情報の問題を完全に消してくれるわけではありません。作るモデルが本物の資料の特定の記録を過度に覚えてしまうと、作り出した資料の中にその記録がほぼそのまま出てくることがあります。だから作った資料が元の資料とどれくらい重なるかを別に確認する手順を設けます。

たとえがずれる点もあります。人工芝は目で見ても本物と区別が付きますが、よくできた合成データは人の目では区別しにくいです。ずれが目に見えないため、資料の値の分布を本物と並べて描いてみたり、本物の資料だけで採点してみたりする形で間接的に確かめます。

使いどころの重心も知っておく価値があります。合成データは本物の資料の代わりにしようとするより、足りない部分を埋めたり稀な状況を補ったりする補助として使うときにいちばんうまく働きます。本物がまったくない場所に作り出した資料をまるごと敷き詰めると、何を真似たのか確かめる方法がなくなり、ずれの大きさを測ることもできなくなります。だから作った資料をどれくらい使ったか、何を手本に作ったかを資料の説明に書いておくことが、事実上の決まりとして定着しつつあります。

4やってみる

5よくある誤解

  • 合成データはたくさん作るほど良いと思われがちですが、実際には互いに似すぎていると個数だけ増えてモデルが学ぶことは増えません。

  • 作り出した資料には偏りがないと思われがちですが、実際には手本になった資料と作った人が定めた規則の偏りがそのまま移ってしまいます。

  • 合成データを使えば個人情報の心配が消えると思われがちですが、実際には原本を覚えてしまった断片がそのまま出てくることがあるので、重なりを別に確認する必要があります。

7ひとこと要約

つまり合成データは本物の代わりに作り出した練習用の資料で、足りない部分を埋めるにはよいですが、採点は必ず本物の資料でしなければなりません。

誤りや、もっと良いたとえがありますか? 修正を提案する · 最終更新2026-09-02