AI PICKS
新機能AWS Machine Learning Blog (日本語)公式発表52分前

Amazon Bedrock、「AgentCore」でスキル評価機能を提供 手順の遵守度を5段階で判定

結論(先に3行)
  1. Amazon Bedrockの評価機能に、AIエージェントのスキル利用を検証する機能が加わりました。
  2. AgentCoreのコマンド操作などを通じて利用できます。
  3. 業務手順をスキルとして組み込んだエージェントを開発する運用者が対象です。
画像: AWS Machine Learning Blog (日本語)

Amazon BedrockのAgentCore Evaluationsに、業務スキルを備えたAIエージェントの動作を評価する機能が追加されました。文章の見た目だけでは分からない内部の処理手順を検証できます。

新機能では、エージェントが状況に合ったスキルを選んだかを二者択一で判定します。あわせて、指示された手順をどこまで実行したかを5段階で採点します。

スキルは再利用できる指示書として定義され、契約書の確認や申請手続きなどの手順をまとめます。実行ログを解析することで、判断の誤りや飛ばした手順を特定します。

業務規則を守る必要がある手続きでも、意図した通りの手順で動いているかを客観的な数値で確認できます。表面上は自然な回答でも規則が守られていない、という問題を防げます。

つまり、どういうこと?

ざっくり言うと、AIがマニュアル通りに仕事を進めたかを採点するテスト機能です。

たとえるなら、新人社員がそれらしい報告書を出してきたときに、必要な確認作業を飛ばしていないかをチェックする仕組みに似ています。答えの文章がきれいでも、大事な社内ルールを飛ばしていたら困ります。この機能を使えば、選んだマニュアルが正しかったかや、作業をどこまで守ったかを5段階で確認できます。

編集部の見方AI PICKS編集部

出力から手順の検証へ。生成AIの評価は大きな転換点を迎えています。

これまでは出力された文章が自然かどうかに目が向きがちでした。ただ、今回の発表で筆者がかなり面白いと感じたのは、文章が流暢でもルールを無視していれば失格とみなす点です。社内手続きや法務チェックでは、どれだけ丁寧な回答でも規定の手順を飛ばされたら事故につながります。

エージェントに任せる業務が広がるほど、こうした振る舞いの監査機能が欠かせない存在になりそうです。社内ツールを自動化している人なら、早い段階でこの評価を取り入れて損はありません。年内のアップデートで各社の開発基盤が追随するかを見届けたいところです。

誰に関係するか

業務の自動化を進めている人は、エージェントが規定の手順を飛ばさず実行しているかを正確に検証できるようになります。

出典: AWS Machine Learning Blog (日本語)

このニュースのツールAIコーディング
Amazon Bedrock icon
Amazon Bedrock3.66最低料金¥0〜AIエージェント自律AILLM
この発表の背景AI PICKS編集部

「Amazon Bedrock」とは、AWSが提供する生成AIアプリ・エージェント構築向けのフルマネージドサービス。Anthropic Claude、Meta Llama、Amazon Nova、Mistral AIなど数百の基盤モデルを単一APIで呼び出せる。料金はモデル・トークン数に応じた従量課金制。

AI PICKSの総合評価は3.66(5点満点)、AIコーディングカテゴリ97ツール中40位、最低料金は¥0〜です。

同じ用途の候補: Hugging FaceGitHub CopilotLangChain

関連ニュースニュース一覧 >

Amazon Bedrockで最上位モデル「Claude Opus 5.5」が利用できるようになりました。日本を含む各地域で本日から提供が始まり、タスクあたりの平均コストも抑えられています。長時間の調査業務やプログラム開発にAIを利用する企業や担当者が対象です。

Amazon Bedrock icon
Amazon Bedrock
Claude icon
Claude
AWS Machine Learning Blog (日本語)
法人の方へAmazon Bedrockの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。