Ragasは、VibrantLabsが開発する、LLMアプリケーションを評価・改善するためのオープンソースのPythonライブラリです。RAG(検索拡張生成)やAIエージェントの出力を、LLMによる採点と従来型の指標の両方で数値化し、主観に頼りがちな品質確認をデータに基づく評価に置き換えます。

主な機能

評価指標は用途別にそろっています。RAG向けにはContext Precision、Context Recall、Faithfulness、Response Relevancy、エージェント向けにはTool Call Accuracy、Agent Goal Accuracy、Topic Adherenceがあります。BLEUやROUGE、Exact Matchといった非LLMの指標、SQLクエリの等価性を見る指標もあります。Aspect CriticやRubrics Based Scoringを使えば、「要約が正確か」のような独自の観点をLLMに判定させられます。

もう1つの柱がテストデータの生成です。手元に評価用データセットが無くても、RAG用やエージェント用のテストセットを自動で作れます。ナレッジグラフの構築やペルソナ生成、英語以外の言語でのテストセット生成、指標の言語適応についてもドキュメントにガイドがあります。

使い方と料金

pip install ragas で導入し、ragas quickstart rag_eval でRAG評価のひな形プロジェクトを作れます。LangChainなどの主要フレームワークや観測ツールと連携できます。ライブラリ自体はApache-2.0ライセンスで無料ですが、LLMで採点する指標はOpenAIなどのAPIを呼び出すため、その利用料は別にかかります。

注意点

画面で操作するSaaSではなく、Pythonコードから使う開発者向けのライブラリです。匿名の利用データを収集する仕組みがあり、環境変数 RAGAS_DO_NOT_TRACK を true にすると停止できます。