タスク時間地平 (METR Time Horizon)
読み: たすくじかんちへい
最終更新: 2026-07-31・AI PICKS編集部
定義
タスク時間地平とは、AIエージェントが50%の確率で完遂できるタスクの長さを、人間換算の作業時間で表した能力指標のことである。
タスク時間地平 (METR Time Horizon)とは — 詳しく解説
タスク時間地平(Time Horizon)は、AI評価機関METRが提唱した指標で、AIエージェントが50%の確率で完遂できるタスクの難易度を、熟練した人間がそのタスクに要する作業時間の長さに換算して示したものとされる。フロンティアモデルではこの時間地平が数ヶ月ごとに倍増しているとされ、AGIへの進捗を測る目安として業界で参照されることが多い。ただし2026年時点の実運用では注意が必要とされる。ベンチマークの対象タスクはソフトウェア開発など特定領域に偏っており、業務全般への一般化には限界があるとされる。また50%成功率という基準は、現場で求められる高い信頼性(90%以上の成功率)とは水準が異なり、時間地平の数値だけを見て導入を決めると期待外れになりやすい。ツール選定の際は、公開されている時間地平の長さだけでなく、自社の業務に近いタスクでの検証結果やコスト対効果を合わせて確認する姿勢が現場では重視されるとされる。相場感としても、時間地平が長いモデルほど利用コストが高くなる傾向があるため、費用対効果の見極めが欠かせないとされる。
タスク時間地平 (METR Time Horizon)の使用例
- 「このAIエージェントの時間地平はどのくらいですか」と尋ね、導入検討中の業務に近いタスクでの検証結果を確認する。
- 社内ツール選定時、公開ベンチマークの時間地平だけでなく実運用に近いタスクでの再現性を確認する運用フローを組む。
タスク時間地平 (METR Time Horizon)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・1263語以上を体系的に整理しています
辞典トップへ