モデルドリフト (性能劣化)
読み: もでるどりふと(せいのうれっか)
最終更新: 2026-07-31・AI PICKS編集部
定義
モデルドリフトとは、本番稼働中のAIモデルの予測精度や出力品質が、学習時点と現在の入力データやユーザー行動の変化によって時間とともに低下していく現象のこと。
モデルドリフト (性能劣化)とは — 詳しく解説
モデルドリフトは、機械学習モデルの予測性能が本番投入後の時間経過とともに劣化していく現象を指す業界標準の用語で、学習データと実運用環境の入力分布がずれる「データドリフト」と、入力と正解ラベルの関係性自体が変化する「コンセプトドリフト」の2種類に大別されるとされる。2026年時点の実運用の現場では、生成AI・LLMを組み込んだプロダクトほど検知が難しいとされる。ユーザーの質問傾向や競合サービスの登場、社会情勢の変化などで入力分布が想定外に動くため、定期的な再学習やモニタリング体制が前提になる。監視には予測精度だけでなく、入力データの統計的な変化を追う仕組みが必要とされ、放置するとサイレントに品質が落ちる点が落とし穴とされる。コスト面では、再学習やデータ収集・評価パイプラインの継続運用が発生するため、モデル選定の段階から再学習頻度とその運用コストを含めた相場感を見積もっておくことが、現場での選び方の基準になるとされる。
モデルドリフト (性能劣化)の使用例
- 「本番運用中の分類モデルの予測精度低下を早期検知するモニタリング項目を設計して」
- 「学習データと現在の入力データの分布差を可視化する手順を教えて」
モデルドリフト (性能劣化)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・1263語以上を体系的に整理しています
辞典トップへ