Perplexityの発表内容

米Perplexityは、新しい埋め込みモデル(検索用の数値データへ変換する技術)「pplx-embed-v2-late」を公開しました。文書を単一の数値に圧縮せず、単語ごとに細かく照合する仕組みを採用しています。

今回のモデルは文章だけでなく画像にも対応します。PDFのページを画像のまま直接検索できるため、文字を読み取るOCR処理やテキスト抽出の手間を省けます。

共通の数値空間を使う設計のため、大きなモデルで作った索引に対して小さなモデルで高速に検索をかける運用が可能です。いずれもAI開発プラットフォームのHugging Faceで公開されています。

つまり、どういうこと?

ざっくり言うと、PDFのページを画像ごとそのまま見つけ出せる検索エンジン用の部品です。これまでは文字をわざわざ読み取ってから探す必要がありましたが、書類の見た目のまま探せるようになります。

編集部の見方

文字起こしを挟まずにPDFを画像ごと探せる仕組みは、かなり重宝しそうです。業務で扱う書類は図や表が散らばったPDFが大半で、文字だけの変換ではレイアウトの情報が消えてしまうからです。

索引作りは賢い大型モデルに任せ、日々の検索処理は軽い小型モデルで安く回す。この割り切りが賢いです。

自社の検索基盤を組む担当者なら、まずはHugging Faceに上がった0.6Bモデルを手元の検証環境で動かして手応えを確かめたいところです。

誰に関係するか

PDFや図表が混ざった社内文書を検索するシステムを組んでいる人は、事前の文字起こし処理を挟まずに精度の高い検索窓を作れるようになります。