pass^k (一貫性評価指標)
読み: ぱすはっとけー
最終更新: 2026-08-06・AI PICKS編集部
定義
pass^kとは、生成AIモデルに同一タスクをk回実行させ、k回すべてが正解・成功した割合で信頼性を測る一貫性評価指標のこと。
pass^k (一貫性評価指標)とは — 詳しく解説
業界標準のpass@kが「k回中1回でも成功すれば合格」とするのに対し、pass^k(consistency@kとも呼ばれる)は「k回全て成功して初めて合格」とする、より厳しい一貫性評価指標とされる。単発のデモでは高精度に見えても、実運用でのリトライ前提の使い方では通用しないケースを可視化するために使われる指標で、コード生成やエージェントタスクの信頼性検証で広く採用されているとされる。2026年時点の現場でのコスト感として、pass^kの算出にはk倍の推論コストがかかるため、k=5やk=10のような大きなkを本番検証で回すとAPI費用が積み上がりやすい落とし穴がある。またkが大きくなるほど確率的にスコアが急落する性質があり、異なるkで測ったモデル同士を比較すると誤った優劣判断につながりやすい。現場での選び方としては、まずpass@kで潜在能力を確認したうえで、本番投入前の信頼性チェックとして小さいkから段階的にpass^kを導入するのが現実的とされる。
pass^k (一貫性評価指標)の使用例
- コード生成AIの本番導入前に、同一プロンプトをk=5回実行しpass^5を計測して安定性を確認する。
- pass@1が90%でもpass^5が40%なら、単発では良く見えて実運用では不安定なモデルと判断できる。
pass^k (一貫性評価指標)に関連するAIツール
pass^k (一貫性評価指標)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1363語以上を体系的に整理しています