定義
丸暗記とは、大規模言語モデルが学習データの文章や数値パターンを汎化せずそのまま記憶し、同じ形で出力してしまう現象のこと。
丸暗記 (Memorization)とは(詳しく解説)
丸暗記(メモリゼーション)とは、機械学習モデルが訓練データの内容を汎化可能なパターンとしてではなく、個別の事例としてそのまま記憶してしまう状態を指す。ディープラーニングの分野では過学習の一種として古くから知られ、大規模言語モデルでは学習データ中の文章やコード、個人情報がほぼそのまま出力される事象として問題視されるとされる。2026年時点の実運用では、社内文書やソースコードでファインチューニングを行う際に、機密情報や著作権保護コンテンツが丸暗記され、プロンプト次第でそのまま漏洩するリスクが指摘されている。現場でモデルを選定・運用する際は、評価データと訓練データの重複いわゆるデータ汚染の有無を確認し、丸暗記の兆候が出た場合は温度パラメータ調整やRAG併用など記憶よりも検索に頼る設計へ切り替える判断が求められる。監査や重複検査にかけるコストの相場感は案件ごとに幅があり、一律の基準はまだ定まっていないとされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「丸暗記 (Memorization)とは」 https://aipicks.jp/glossary/memorization
丸暗記 (Memorization)の使用例
- ファインチューニング後、学習に使ったソースコードの一部がそのまま出力される例。
- 特定の質問を続けると、学習データ中の個人情報らしき文字列が再現される例。