データ拡張 (Data Augmentation)
読み: でーたかくちょう
最終更新: 2026-07-27・AI PICKS編集部
定義
データ拡張とは、手持ちの学習データに回転・反転・ノイズ付加などの変換を加えて水増しし、モデルの汎化性能を高める機械学習の前処理手法のこと。
データ拡張 (Data Augmentation)とは — 詳しく解説
データ拡張は、画像の回転・反転・クロップやテキストの言い換え、音声のピッチ変換などにより学習データのバリエーションを人工的に増やし、モデルの過学習を抑えて汎化性能を高める手法として、深層学習の分野で標準的な前処理技術に位置づけられる。2026年時点の実運用では、拡張の種類やパラメータを誤ると実データと乖離した非現実的なサンプルが生成され、かえって精度が低下する落とし穴が知られている。特に医療画像や金融データのように分布が繊細な領域では、拡張のかけすぎがノイズとして学習され、本番環境での予測性能を損なうケースが指摘される。コスト面では、生成AIを使った合成データ拡張はGPU利用料がかさみやすく、単純な幾何変換に比べて相場感が数倍から数十倍に跳ね上がることもある。現場での選び方としては、まず軽量な幾何変換・色調変換から試し、データ量やタスクの複雑さに応じて生成モデルベースの高度な拡張を段階的に導入する方針が広く採用されている。
データ拡張 (Data Augmentation)の使用例
- 画像分類では「学習画像を回転・反転させてデータ拡張し、水増ししたデータで再学習する」のように使う。
- テキスト分類では「類義語置換でデータ拡張したデータセットを使い、少数派クラスの精度を改善する」という使い方をする。
データ拡張 (Data Augmentation)に関連するAIツール
関連用語
「インフラ・学習」の他の用語
既存の AI モデルを 自社データで追加学習させて 専門特化させる方法。
データから法則を自動学習させる AI 技術の総称。 ディープラーニングや LLM もここに含まれる。
ニューラルネットワークを多層化した機械学習手法。 LLM / 画像認識 / 音声認識 の基盤技術。
Self-Attention 機構を中核とするニューラルネット構造。 LLM / 画像 / 音声 すべての基盤。
入力系列のどこに注目すべきかを 動的に重み付けする仕組み。 Transformer の中核。
LoRAとは、大規模モデルの重みを凍結したまま低ランク行列ペアを追加挿入することで、全パラメータの1%以下の計算コストで特定ドメインへの適応を実現するファインチューニング手法のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1063語以上を体系的に整理しています
辞典トップへ