AI PICKS
AI用語辞典評価指標

統計的有意性 (評価の信頼区間)

読み: とうけいてきゆういせい

最終更新: 2026-07-29・AI PICKS編集部

定義

統計的有意性とは、AIモデルやA/Bテストの評価結果の差が偶然のばらつきではないと言えるかどうかを示す統計的な基準のことで、信頼区間の幅などで判定される。

統計的有意性 (評価の信頼区間)とは — 詳しく解説

統計的有意性は、比較対象間に観測された差が偶然によるものである確率(p値)がある基準(一般にp<0.05)を下回るかどうかで判定される、統計学における標準的な概念である。AIモデルの評価やA/Bテストでは、精度やCTRなどの指標差が有意かどうかを、信頼区間(多くは95%信頼区間)の幅で確認する運用が広く採用されている。2026年時点の実運用では、サンプル数が少ないままp値だけを見て「効果あり」と判断し、後で再現しないという落とし穴が指摘されている。特にLLM評価はコストが高く、十分なサンプル数を確保する前に打ち切られるケースが多いとされる。現場での選び方としては、p値単体ではなく信頼区間の幅と効果量を併記し、ビジネス上意味のある差(実務的有意性)かどうかも合わせて判断することが推奨される。評価基盤の構築・運用コストを考慮し、継続的な少数サンプル評価より、一定期間ごとにまとまったサンプルで有意性を検証する設計が現場では選ばれやすい。

統計的有意性 (評価の信頼区間)の使用例

  • A/Bテストで導入前後のCTR差を比較し、p値が0.05を下回れば統計的有意性ありと判断する。
  • プロンプト例:「この結果の差はp<0.05で統計的に有意か、信頼区間を含めて評価して」

統計的有意性 (評価の信頼区間)に関連するAIツール

関連用語

評価指標」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1163語以上を体系的に整理しています

辞典トップへ