Unstructuredは、PDF、Word、PowerPoint、Excel、メール、画像などの非構造化文書を、LLMやAIエージェントが扱いやすい構造化データに変換するためのデータ処理プラットフォームです。RAG(検索拡張生成)の前処理を、取り込みから保存先への書き込みまで一続きのパイプラインとして組めます。

主な機能

ファイルの種類に応じて処理方法を自動で選び、表の行や列、見出し、読み順を保ったまま要素に分けます。OCRで手書きやスキャン文書の文字も拾えます。分割戦略はAuto、Fast、High-Res、VLMから選べ、タイトル単位やページ単位、類似度によるチャンク分割、画像や表の説明文生成、表のHTML化、固有表現の抽出、埋め込みベクトルの生成まで扱えます。データの取得元と保存先には、S3、Google Drive、SharePoint、Box、Confluence、Slack、Salesforceなどのコネクタがあり、変更を検知して差分だけ処理し直せます。

使い方の選択肢

オープンソースのPythonライブラリ「unstructured」を自分の環境で使う方法と、クラウドのプラットフォームを使う方法があります。AIエージェントから呼び出せるMCPサーバーも用意されています。

料金

クラウド版は最初の10,000ページまで無料で、カード登録も不要です。その後は1ページ$0.015の従量課金です。専用インスタンスや自社VPCへの導入、複数ユーザー管理が必要な場合はBusinessプランで個別見積もりになります。

注意点

画面や資料は英語です。日本語文書の精度は自社の文書で試して確かめてください。