Confident AIは、LLMアプリとAIエージェントの評価、観測、レッドチーミングを1つにまとめたAI品質管理プラットフォームです。オープンソースのLLM評価フレームワーク「DeepEval」を開発する会社のクラウド製品で、DeepEvalで書いた評価の結果を比較、共有、監視する場として使えます。
DeepEvalとは
DeepEvalは、Pytestに似た書き方でLLMアプリの単体テストができるオープンソースのフレームワークです。G-Eval、タスク完了、回答の関連性、ハルシネーションなどの指標を、LLMを評価者にする方法などで手元のマシン上で計算します。アプリ全体だけでなく、エージェントの一連の判断や、LLM呼び出し、ツール利用、検索といった個々のステップも評価できます。
Confident AIの主な機能
開発中やCI/CDでの評価、回帰テスト、チャットのシミュレーション、プロンプトのバージョン管理に加え、本番のトレース監視とリアルタイムのアラートを備えます。本番のトレースから評価用データセットを自動で作り、失敗例を分類する機能もあります。コードを書かずにAPI経由で評価を回せるため、PMや業務の専門家も品質確認に加われます。レッドチーミングでは、ジェイルブレイクやプロンプトインジェクション、多言語を使った攻撃などで脆弱性を調べます。
料金
Freeプランは無料で、2ユーザー、1プロジェクト、週5回のテスト実行まで使えます。Starterは月$200、Teamは月$2,000で、Enterpriseは日本などのデータ所在地の指定やオンプレミス導入に対応します。
注意点
画面と資料は英語です。評価指標の多くはLLMを使うため、評価の実行にはモデルの利用料もかかります。


