SciCode (科学コード生成ベンチ)
読み: さいこーど
最終更新: 2026-07-22・AI PICKS編集部
定義
SciCodeとは、物理学・化学・生物学など科学研究分野の実践的なコード生成能力をLLMに問うベンチマークのこと。
SciCode (科学コード生成ベンチ)とは — 詳しく解説
SciCodeは、物理学・化学・生物学・材料科学など科学研究の現場で実際に必要となる数値計算コードをLLMがどれだけ正確に書けるかを測る評価ベンチマークとして、研究者コミュニティで参照されることが多い。既存のコード生成ベンチマーク(HumanEvalなど)が汎用的なアルゴリズム問題を中心に据えるのに対し、SciCodeは論文由来の科学計算タスクを細分化し、専門知識と数式実装の両方を要求する点が特徴とされる。2026年時点の実運用では、高いスコアを示すモデルでも、単位系の取り違えや境界条件の見落としなど、科学的な妥当性検証が抜けた出力を返すケースが依然として報告されており、スコアだけを鵜呑みにするとコスト面で手戻りが発生しやすい。現場でモデルを選ぶ際は、SciCodeのスコアを入口の目安としつつ、実際に扱う分野の検証コードを自前で用意し、生成結果を専門家がレビューする体制を組むのが安全とされる。相場感としては、この種の専門ベンチマークは汎用チャットモデルの評価には向かず、コード生成特化型モデルの比較に使うのが実務上の落としどころとなっている。
SciCode (科学コード生成ベンチ)の使用例
- 「SciCodeのスコアが高いモデルはどれ?」→ ベンチマーク結果を根拠に候補を絞り込むプロンプト例。
- 「この物理シミュレーションコードをレビューして」→ 生成コードの妥当性を専門家が検証する運用例。
SciCode (科学コード生成ベンチ)に関連するAIツール
関連用語
「評価指標」の他の用語
Massive Multitask Language Understanding。 57 分野・1.5 万問の LLM 知識評価ベンチマーク。
OpenAI 発の Python コーディング能力ベンチマーク。 164 問の関数実装タスク。
ユーザー投票による LLM の人間評価ランキング。 Elo レーティングで モデルを順位付け。
ベンチマークとは、AIモデルの性能を標準化されたテスト課題で数値化し、異なるモデル間を公平に比較するための評価基準セットのこと。MMLUやHumanEval等、用途別に数十種類が存在する。
SWE-benchとはGitHubの実際のIssueをAIが自動修正できるかを測る、コーディングAI評価の業界標準ベンチマークのこと。
GPQAとは、生物・物理・化学の大学院レベルの難問でAIの推論力を測る評価ベンチマークのこと。Googleで検索しても解けない設計が特徴。
AI用語辞典をすべて見てみませんか
12カテゴリ・863語以上を体系的に整理しています
辞典トップへ