Amazon Bedrock、「AgentCore」でスキル評価機能を提供 手順の遵守度を5段階で判定
- Amazon Bedrockの評価機能に、AIエージェントのスキル利用を検証する機能が加わりました。
- AgentCoreのコマンド操作などを通じて利用できます。
- 業務手順をスキルとして組み込んだエージェントを開発する運用者が対象です。

Amazon BedrockのAgentCore Evaluationsに、業務スキルを備えたAIエージェントの動作を評価する機能が追加されました。文章の見た目だけでは分からない内部の処理手順を検証できます。
新機能では、エージェントが状況に合ったスキルを選んだかを二者択一で判定します。あわせて、指示された手順をどこまで実行したかを5段階で採点します。
スキルは再利用できる指示書として定義され、契約書の確認や申請手続きなどの手順をまとめます。実行ログを解析することで、判断の誤りや飛ばした手順を特定します。
業務規則を守る必要がある手続きでも、意図した通りの手順で動いているかを客観的な数値で確認できます。表面上は自然な回答でも規則が守られていない、という問題を防げます。
ざっくり言うと、AIがマニュアル通りに仕事を進めたかを採点するテスト機能です。
たとえるなら、新人社員がそれらしい報告書を出してきたときに、必要な確認作業を飛ばしていないかをチェックする仕組みに似ています。答えの文章がきれいでも、大事な社内ルールを飛ばしていたら困ります。この機能を使えば、選んだマニュアルが正しかったかや、作業をどこまで守ったかを5段階で確認できます。

出力から手順の検証へ。生成AIの評価は大きな転換点を迎えています。
これまでは出力された文章が自然かどうかに目が向きがちでした。ただ、今回の発表で筆者がかなり面白いと感じたのは、文章が流暢でもルールを無視していれば失格とみなす点です。社内手続きや法務チェックでは、どれだけ丁寧な回答でも規定の手順を飛ばされたら事故につながります。
エージェントに任せる業務が広がるほど、こうした振る舞いの監査機能が欠かせない存在になりそうです。社内ツールを自動化している人なら、早い段階でこの評価を取り入れて損はありません。年内のアップデートで各社の開発基盤が追随するかを見届けたいところです。
業務の自動化を進めている人は、エージェントが規定の手順を飛ばさず実行しているかを正確に検証できるようになります。

