定義
Web本文抽出とは、Webページのナビゲーションや広告、フッターなどのノイズを除いて本文のみを抽出し、Markdown等の構造化テキストに変換する処理のこと。
Web本文抽出 (HTML→Markdown変換)とは(詳しく解説)
HTML→Markdown変換とは、Webページのnavや広告、フッターなど本文以外のノイズを除去し、見出しやリスト構造を保ったまま軽量なMarkdown等のプレーンテキストへ変換する前処理で、RAGパイプラインやLLMへのコンテキスト投入前の定番ステップとされる。readabilityアルゴリズムやheuristicベースの抽出ライブラリ、あるいはLLM自体に抽出させる手法が広く使われている。2026年時点の実運用では、JavaScriptで本文を動的レンダリングするSPAサイトや、Cookie同意モーダルが本文と誤認識され抽出精度が落ちる落とし穴が現場でよく報告される。表組みや画像キャプションの情報が欠落しやすく、複雑なページほど後工程のembedding品質に影響する。自前でheadlessブラウザを運用するかSaaS型抽出APIを使うかでコスト感が変わり、対象サイトの更新頻度やJS依存度を踏まえて選ぶのが現場の基本になる。
Web本文抽出 (HTML→Markdown変換)の使用例
- readabilityやheuristicで本文以外を除去し、Markdown化してembedding生成に渡す使い方が一般的。
- 社内ドキュメントをHTMLからMarkdownへ変換し、RAGのチャンク分割前処理として使うケースが多い。