ツール選択精度 (Tool Selection Accuracy)
読み: つーるせんたくせいど
最終更新: 2026-08-06・AI PICKS編集部
定義
ツール選択精度とは、AIエージェントが与えられたタスクに対して複数の外部ツールやAPIの中から正しいものを選び、適切な引数で呼び出せる割合を示す評価指標のこと。
ツール選択精度 (Tool Selection Accuracy)とは — 詳しく解説
ツール選択精度(Tool Selection Accuracy)は、AIエージェントが与えられた指示に対し、用意された複数のツール・API・関数の中から目的に合うものを正しく選び、適切な引数で呼び出せた割合を測る評価指標として、エージェント開発の分野で広く使われている。単純な応答精度とは異なり、「どのツールを使うか」の判断そのものを評価する点が特徴で、ツール数が増えるほど類似機能の混同や引数の型ミスが起きやすく、精度が低下する傾向があるとされる。2026年時点の実運用では、社内に導入しているSaaSやAPIが数十〜数百に及ぶ企業も珍しくなく、ツール定義の説明文(description)が曖昧なまま追加を重ねると誤選択が増え、現場での修正コストがかさむ落とし穴になりやすい。相場感としては、エージェント基盤やLLM APIの利用コストに加え、ツール定義の設計・保守にも継続的な工数がかかるため、導入前にツール数を絞り込み、説明文を明確化してから段階的に拡張する選び方が現場では推奨されている。
ツール選択精度 (Tool Selection Accuracy)の使用例
- このエージェントのテストログ50件から、正しいツールを選べた割合(ツール選択精度)を算出して。
- 検索・計算・DB照会の3ツールを持つエージェントで、説明文(description)を改善してツール選択精度を上げる案を3つ出して。
ツール選択精度 (Tool Selection Accuracy)に関連するAIツール
ツール選択精度 (Tool Selection Accuracy)の関連記事
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
用語がわかったら、次はツール選び
12カテゴリ・1363語以上を体系的に整理しています