Galileoは、LLMアプリケーションやAIエージェントの評価と監視のためのAI観測・評価プラットフォームです。開発中に作った評価(Evals)を、そのまま本番環境のガードレールとして使う「評価からガードレールへ」という流れを中心に設計されています。なお、同名のUIデザイン生成ツールとは別の製品です。

主な機能

RAG、エージェント、安全性、セキュリティ向けに20種類以上の既成の評価が用意されており、自社の業務知識を反映したカスタム評価器も作れます。LLMに判定させる評価(LLM-as-judge)はコストと遅延が大きくなりがちですが、Galileoはこれを小型のLunaモデルに蒸留し、低遅延・低コストで動かせる点を特徴にしています。

データセットは、合成データ、開発中のデータ、本番のデータから作れ、各分野の専門家による注釈も取り込めます。インサイト機能はエージェントの挙動を分析して失敗パターンを見つけ、「ハルシネーションでツールへの入力が誤った。正しい入力例をfew-shotで追加する」といった修正案まで示します。評価スコアに応じてエージェントの行動やツール利用を制御し、有害な応答をブロックするポリシーも設定できます。

料金

無料プランは月5,000トレースまで、ユーザー数とカスタム評価は無制限です。Proは年払いで月$100からで、月50,000トレース、権限管理、高度な分析、Slackでのサポートが付き、料金はトレース数に応じて増えます。Enterpriseはトレース無制限で、SaaSのほかVPCやオンプレミスへの導入、SSO、リアルタイムのガードレールに対応します。

注意点

リアルタイムのガードレールは料金ページ上ではEnterpriseプランの項目です。画面や資料は英語のみです。