表記ゆれ正規化 (Orthographic Normalization)
読み: ひょうきゆれせいきか
最終更新: 2026-08-12・AI PICKS編集部
定義
表記ゆれ正規化とは、全角・半角、ひらがな・カタカナ、送り仮名などの表記差異を統一しRAGの検索漏れを防ぐ前処理のことである。
表記ゆれ正規化 (Orthographic Normalization)とは — 詳しく解説
表記ゆれ正規化(Orthographic Normalization)は、同じ意味を持つ語句が全角/半角、ひらがな/カタカナ、送り仮名、大文字/小文字などで異なる形式で存在する状態を統一し、検索やRAGの検索漏れ・重複ヒットを防ぐ前処理を指す。業界標準では形態素解析による正規化辞書やNFKC正規化などの手法が広く採用されているとされる。2026年時点の実運用では、日本語特有の表記ゆれ(半角カナ・旧字体・略称など)への対応が不十分なため、埋め込みベースの検索でも意味的には近いのに表記差でヒットしない事例が現場でしばしば報告される。正規化ルールを厳しくしすぎると別語を同一視してしまう副作用もあり、ドメイン辞書のメンテナンスコストが継続的に発生する点も選定時の考慮点となる。ツール選びでは、正規化処理を検索基盤に標準搭載しているかどうかで導入の相場感が変わるため、既存の検索/RAG基盤との統合コストを事前に見積もることが重要とされる。
表記ゆれ正規化 (Orthographic Normalization)の使用例
- RAGの検索ヒット率が低いとき「半角カナ」「旧字体」「略称」を正規化辞書に追加し表記差異を吸収する。
- 「AI」と「AI」を同一トークンとして扱うようNFKC正規化をインデックス前処理に組み込む。
表記ゆれ正規化 (Orthographic Normalization)に関連するAIツール
関連用語
「RAG・検索拡張」の他の用語
Retrieval-Augmented Generation。 社内資料や外部 DB を検索してから AI に答えさせる仕組み。
文章や画像を 数値ベクトルに変換する技術。 類似度検索や RAG の基礎。
出典付きで回答する AI 検索エンジン。 リサーチ業務で従来検索を置き換える。
Google 検索の上位に AI が回答を提示する 「AI Overviews」 や Perplexity 等の新世代検索。
Embedding (数値ベクトル) を高速に類似度検索するための専用 DB。 Pinecone / Qdrant / Weaviate が代表。
NotebookLMとはGoogleが提供するRAGベースのAIリサーチアシスタントのこと。ユーザーがアップロードした文書のみを情報源として回答を生成するため、ハルシネーションを大幅に抑制できる。
用語がわかったら、次はツール選び
12カテゴリ・1418語以上を体系的に整理しています