丸暗記 (Memorization)
読み: まるあんき
最終更新: 2026-07-26・AI PICKS編集部
定義
丸暗記とは、大規模言語モデルが学習データの文章や数値パターンを汎化せずそのまま記憶し、同じ形で出力してしまう現象のこと。
丸暗記 (Memorization)とは — 詳しく解説
丸暗記(メモリゼーション)とは、機械学習モデルが訓練データの内容を汎化可能なパターンとしてではなく、個別の事例としてそのまま記憶してしまう状態を指す。ディープラーニングの分野では過学習の一種として古くから知られ、大規模言語モデルでは学習データ中の文章やコード、個人情報がほぼそのまま出力される事象として問題視されるとされる。2026年時点の実運用では、社内文書やソースコードでファインチューニングを行う際に、機密情報や著作権保護コンテンツが丸暗記され、プロンプト次第でそのまま漏洩するリスクが指摘されている。現場でモデルを選定・運用する際は、評価データと訓練データの重複いわゆるデータ汚染の有無を確認し、丸暗記の兆候が出た場合は温度パラメータ調整やRAG併用など記憶よりも検索に頼る設計へ切り替える判断が求められる。監査や重複検査にかけるコストの相場感は案件ごとに幅があり、一律の基準はまだ定まっていないとされる。
丸暗記 (Memorization)の使用例
- ファインチューニング後、学習に使ったソースコードの一部がそのまま出力される例。
- 特定の質問を続けると、学習データ中の個人情報らしき文字列が再現される例。
丸暗記 (Memorization)に関連するAIツール
関連用語
「LLM / 言語モデル」の他の用語
Artificial Intelligence の略。人間の知能をコンピュータで再現する技術全般を指す。
Large Language Model の略。 膨大なテキストで学習した文章生成 AI。 ChatGPT / Claude / Gemini が代表例。
AI がそれっぽい嘘をつく現象。 学習データに無い情報を推測で生成してしまう。
AI が一度に扱える文章の長さ。 トークン数で表現される (例: Claude Opus 4.7 は 1M トークン)。
AI が扱う文字のかたまり。 日本語は 1 文字 ≒ 1 トークン、 英語は単語 ≒ 1 トークン。 料金計算の単位でもある。
文章・画像・音声・動画 を新規に作り出す AI 技術。 ChatGPT 以降の AI ブームの主役。
AI用語辞典をすべて見てみませんか
12カテゴリ・1013語以上を体系的に整理しています
辞典トップへ