Claude Codeの発表内容

Anthropicは2026年9月28日、開発支援ツール「Claude Code」向けに、アプリの評価作成と改善を支援する機能群を発表しました。公式の拡張機能を通じて、評価の設計から性能改善までを一連の流れで実行できます。

新設された評価作成機能では、対話形式で質問に答えるだけでコード内にテスト環境を構築します。採点方法には、プログラムによる自動判定や、判定役の別モデルによる評価が用意されています。

あわせて提供される改善機能は、作成したテストを基準にアプリの調整を1回ずつ進めます。一部の事例だけに過剰に適応する過学習 (特定のデータにだけ合致して汎用性が落ちること) を防ぐため、調整用とは別の検証データを用いて測定します。

テストケースの作成や採点基準の選定を画面上で確認しながら進められるため、AIアプリの挙動確認にかかる手作業の手間を省けます。自社システムへAIを組み込む開発作業において、変更による精度の変化を数値で追跡できるようになります。

つまり、どういうこと?

ざっくり言うと、AIを使った自社システムの「模擬試験」を自動で作り、点数を伸ばすための特訓まで請け負ってくれる仕組みです。

これまでは、AIの回答が本当に正しいかを人が毎回採点したり、問題集を手作業で作ったりする手間がかかっていました。今回の機能を使えば、実際の問い合わせ履歴などから自動で試験問題を作り、別の判定役AIと連携して合格点をめざせます。

編集部の見方

筆者も驚く丁寧さです。評価用の問題集を作る作業は、かなり地道で後回しにされがちな工程でした。

一方、判定役となるモデルを別に選ばせる仕様は、自己採点による甘さを避ける狙いが見えて納得感があります。自社業務の自動化を進めている組織なら、精度検証の標準手順として定着していきそうです。

次は2026年冬にかけて、競合する開発支援ツールが同様の自動評価フローを追従して組み込んでくるかに着目したいところです。

誰に関係するか

自社アプリのAI精度測定に悩んでいる人は、対話を通じて適切なテスト環境を作り、過学習を避けながら品質を高められるようになります。