AI PICKS
AI用語辞典RAG・検索拡張

重複排除 (Deduplication)

読み: じゅうふくはいじょ

最終更新: 2026-07-28・AI PICKS編集部

定義

重複排除とは、RAGやデータ基盤において同一または類似する文書・チャンクを検出して取り除く処理のこと。

重複排除 (Deduplication)とは — 詳しく解説

重複排除(デデュープ)とは、意味的に同一または類似したドキュメント・チャンクを検出し、インデックスや学習データから除去する処理のこと。一般には、ハッシュ値による完全一致検出と、埋め込みベクトルのコサイン類似度によるあいまい一致検出を組み合わせる手法が広く採用されているとされる。2026年時点の実運用では、類似度の閾値設定が最大の落とし穴とされ、閾値を高くしすぎると意味の異なる文書まで誤統合し、低くしすぎると重複が残ってベクトルDBのストレージや検索コストが膨らみ、回答精度も落ちると言われる。特にFAQやカスタマーサポート系データは表現違いの類似質問が大量に発生しやすく、重複排除の設計次第で検索コストと回答品質が大きく変わるとされる。現場での選び方としては、まず完全一致除去でノイズを減らし、そのうえで埋め込みベースの近似重複検出を段階的に追加する構成が定番とされる。相場感としては、主要なベクトルDBやRAG基盤ツールに標準機能として組み込まれ追加費用なしで使えることが多い一方、大規模データでは類似度計算のバッチ処理にかかる計算コストが無視できないとされる。

重複排除 (Deduplication)の使用例

  • 同じ内容のFAQが表現違いで複数登録され検索結果に重複表示される問題を、埋め込み類似度ベースの重複排除で解消する設計例。
  • 学習データに同一記事の転載が多数含まれる場合、ハッシュ照合による重複排除で事前にノイズを削減してから前処理する例。

重複排除 (Deduplication)に関連するAIツール

関連用語

RAG・検索拡張」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1113語以上を体系的に整理しています

辞典トップへ