JGLUEとは?日本語AIの実力を測る5タスクと読み方 (2026年版)

JGLUEとは?日本語AIの実力を測る5タスクと読み方 (2026年版)

この記事のポイント JGLUEは、AIが日本語をどれだけ正しく理解できるかを測る公開テスト集です。分類・類似度・含意・読解・常識推論の5タスクで構成されています。 スコアが高いモデルが自社業務で使えるとは限りません。ここを取り違えると、選定を丸ごとやり直すことになります。 この記事では5タスクの中身、数字の正しい読み方、そして自社版の簡易テストを作る手順まで通しで整理します。

社内で使うAIを選ぼうとして比較記事を開いたら、「JGLUEのスコアが国内最高水準」といった一文にぶつかった。そんな場面で読み飛ばすと、あとで判断を誤ります。

JGLUEとは、日本語を扱うAIモデルの理解力を測るために作られた、公開のテスト問題集です。英語圏で使われてきた評価方法を日本語向けに組み直したもので、GitHub上のyahoojapan/JGLUEリポジトリで誰でも中身を確認できます。

読み方さえ分かれば、モデル選びの時間は半分になります。逆に、数字だけを見て決めると高い授業料を払うことに。


JGLUEとは?日本語AIの「読解力テスト」

JGLUEとは?日本語AIの実力を測る5タスクと読み方 (2026年版) 図2

JGLUEとは、AIが日本語の文章をどれだけ正しく理解できるかを、複数の問題形式で採点する公開ベンチマークです。ベンチマークとは、条件をそろえて性能を測るための共通テストのこと。

学校の模試を思い浮かべると近いです。同じ問題を全モデルに解かせて、正解率を並べる。それだけの仕組みです。

大事なのは「理解」の中身を1種類で測っていない点。感情を読み取る問題、2つの文の関係を判断する問題、長文から答えを探す問題と、性質の違う課題が束になっています。だから総合点だけを見ても、そのモデルが何を得意としているかは分かりません。

問題文も正解データも公開されているため、誰でも手元で同じ採点を再現できます。ここが、ベンダーの自己申告資料との決定的な差。

なぜ英語のベンチマークだけでは足りないのか

JGLUEとは?日本語AIの実力を測る5タスクと読み方 (2026年版) 図3

海外製モデルの発表資料に並ぶスコアは、ほとんどが英語のテストで測った数字です。日本語での実力とは別物になります。

理由は3つあります。日本語には単語の区切りを示す空白がありません。敬語や省略が多く、主語が消えます。そして学習データに含まれる日本語の量が、英語に比べて圧倒的に少ない。

海外モデルは日本語の文字を細かく分割して処理するため、同じ内容でも扱う量が増えがちです。処理する文字のかたまり(トークン)が増えれば、その分だけ利用料もかさみます。

つまり英語のスコアが高くても、日本語の稟議書や問い合わせメールをきちんと読めるかは別問題。JGLUEはその差を可視化するために存在します。


JGLUEに含まれる5つのタスク

JGLUEとは?日本語AIの実力を測る5タスクと読み方 (2026年版) 図4

構成タスクの中身を知らないまま総合点を語るのは危険です。まずは何を測っているかを一覧で押さえてください。

タスク名何を測るか問題の形式業務での近い作業
MARC-ja文章の肯定・否定を見分ける力二択の分類問い合わせやレビューの仕分け
JSTS2つの文の意味がどれだけ近いか近さを数値で採点重複した申請・FAQの検出
JNLI2つの文の論理的な関係含意・矛盾・中立の三択契約条項と説明文の突き合わせ
JSQuAD長い文章から答えを探す読解本文中の該当箇所を抜き出す社内規程からの回答抽出
JCommonsenseQA日本の生活常識にもとづく推論選択肢から1つ選ぶ前提を補って察する応対

つまりJGLUEは「読める・比べられる・筋道を追える・探せる・察せる」の5方向から日本語力を測っている、と捉えれば十分です。

MARC-jaは通販サイトのレビューを素材にしており、星1〜2を否定、星4〜5を肯定として扱います。判断が割れやすい星3は問題から外されています。この設計、地味に賢い。人間でも迷う問題を混ぜると、採点自体が信用できなくなるからです。

JSQuADはWikipediaのような説明文から答えを抜き出す形式で、社内文書を読ませて回答させる仕組み(RAG)との相性が見やすいタスク。ここが弱いモデルは、社内規程botに使うと的外れな引用を返します。

なお、タスク構成は更新されることがあります。導入判断に使うなら、公式リポジトリ(https://github.com/yahoojapan/JGLUE)で現在の構成を確認してください。


スコアはどう読む?高得点=業務で使えるとは限らない

JGLUEとは?日本語AIの実力を測る5タスクと読み方 (2026年版) 図5

結論から書くと、JGLUEの点数は「足切り」には使えますが「本命の決定打」にはなりません。

模試の偏差値と同じです。偏差値70なら基礎学力は保証されますが、その人が営業に向いているかは別。JGLUEが測るのは基礎学力のほうです。

さらに注意したいのが、問題文がすでにインターネット上に公開されている点。学習データに答えが混ざっていれば、実力以上の点が出ます。これを汚染と呼びます。公開ベンチマークが宿命的に抱える弱点。

だから見るべきは順位ではなく、「極端に低いタスクがないか」です。

見方やりがちな失敗正しい使い方
総合点1位のモデルを即採用一定ラインを超えたモデルを候補に残す
タスク別見ずに総合点だけ確認自社業務に近いタスクの点だけ重視
比較対象発表時期の違うモデルを並べる同じ実行条件・同じ日付のものだけ比較
差の大きさ数ポイント差を有意と判断誤差の範囲は横並びとみなす

要するに、JGLUEは候補を絞る道具。最後は自社の文書で試すしかありません。

JGLUE以外の日本語評価指標との違い

日本語モデルの比較記事では、JGLUEと並んでELYZA-tasks-100という名前もよく出てきます。両者は測っているものが違います。

評価方法測る内容採点のしかた向いている判断
JGLUE文章理解の基礎力正解と自動照合基礎学力の足切り
ELYZA-tasks-100指示への回答の質人や別のAIが評価実際の使い勝手の推定
自社データでの検証業務文書への適合度自社の合否基準最終的な採用判断

3つは競合ではなく役割分担です。基礎力で絞り、回答品質で並べ替え、自社データで決める。この順番を守るだけで、選定の手戻りはほぼ消えます。

ちなみに画像生成AIの世界には、この種の統一テストが定着していません。だから体感評価に頼ることになります。作風の比較で迷ったらAIイラストツールの比較記事を先に見ておくと、テキスト系とは評価軸がまるで違うことが分かります。


社内でLLMを選ぶとき、JGLUEをどこで使うか

使いどころは選定の入口だけ。ここを守れば、時間の浪費を防げます。

具体的な流れはこうです。

  • 候補を10前後に広げ、公開されているJGLUE系の情報で明らかに弱いモデルを外す
  • 残った候補を、自社の実文書30〜50件で試す
  • 上位2つに絞り、料金とセキュリティ条件で決める
  • 半年後に再評価する日をカレンダーに入れる

最後の項目を飛ばす会社が本当に多いです。モデルは数か月で入れ替わります。一度決めた構成が1年後も最適である保証はどこにもありません。

社内システムへの組み込みや統制の観点まで踏み込むなら、社内監査・内部統制向けAIツールの整理が参考になります。評価指標だけでなく、証跡の残し方まで含めて考える必要があるからです。

ここまでの整理: JGLUEは5タスクで日本語の基礎理解力を測る公開テスト。総合点は足切りに使い、タスク別の凹みを見て、最後は自社文書で判断する。この3段構えが失敗しない型です。

ローカルLLM・国産LLMの比較にJGLUEが出てくる理由

自社サーバーの中だけでAIを動かす構成、いわゆるローカル運用を検討する場面で、JGLUEの名前は必ず登場します。

外部のAPI(他のソフトからAIを呼び出す窓口)を使わない構成では、機密文書を外に出さずに済みます。医療・金融・法務では強い要件になります。

ところが手元で動かせるサイズのモデルは、多くが英語中心の学習データで作られています。日本語の指示にどこまで応えられるか、動かす前に見当をつけたい。そこで共通のものさしとしてJGLUEが引かれます。

国産モデルの発表でも、日本語ベンチマークの評価値が公開済みモデルの中で最高水準だ、といった表現が使われます。ただしこの手の記述は発表時点のもの。半年後には順位が入れ替わっている前提で読んでください。

日本語での検索・要約に強い実装を具体的に見たい人には、Feloの使い方まとめが近い題材です。日本語圏の情報を扱う設計がどう違うのか、実物で確かめられます。


JGLUEの数字に振り回されないための3つのチェック

比較表の数字を見たとき、確認するのは次の3点だけで足ります。

測定日はいつか。 モデルは更新されます。半年前の数字は参考記録。

誰が測ったか。 ベンダー自身の測定値と、第三者の測定値では重みが違います。

条件は揃っているか。 同じ問題でも、AIへの指示文(プロンプト)の書き方ひとつで数字は動きます。指示文の条件が書かれていない比較表は、そもそも比較になっていません。

この3つを満たさない数字は、営業資料の飾りだと思って構いません。

自社データで「ミニJGLUE」を作る手順

JGLUEの本当の価値は、考え方を真似できる点にあります。自社版の簡易テストは、半日あれば作れます。

手順は5つ。

  1. 自社の実文書から、AIに任せたい作業を30件抜き出す
  2. 各件について、人が作った正解を用意する
  3. 候補モデル全部に同じ指示文で解かせる
  4. 正解と照らして合否を数える
  5. 合格率とあわせて、外した理由を分類する

5番目が肝です。単純な誤読なのか、業界用語を知らないのか、指示文が悪いのか。原因が分かれば、モデルを替えずに解決できる場合もあります。

外した原因打ち手モデル変更の要否
業界用語を知らない用語集を渡す仕組みを追加不要
指示があいまい指示文を具体化不要
長文で答えを見失う文書を分割して渡す不要
日本語の係り受けを誤る別モデルへ切り替え必要

表の下3行は工夫で消えます。モデル変更が本当に必要なのは、最下段のような基礎力の問題が出たときだけです。


JGLUEが向かない用途は?

測れないものを測ろうとして失敗する例が後を絶ちません。JGLUEの守備範囲外を明示しておきます。

対象外なのは、文章の面白さ、ブランドの声色に合っているか、コードが動くか、画像の出来、音声の自然さ、そして長時間の作業を自力で進める力です。

たとえば画像生成の品質は、数値ではまったく捉えられません。同じ指示から出てくる絵の傾向は、ツールごとに大きく違います。ComfyUIとStable Diffusionの比較を見ると、評価が使い手の目に委ねられている領域だと分かります。

また、SNSやチャットに埋め込まれたAIのように、使う場面そのものが体験を左右する製品もあります。Meta AIの使い方ガイドはその典型で、基礎スコアの話とは別の軸で選ばれます。

要は、テストで測れるのは基礎学力だけ。実務の適性は現場で見るしかありません。

導入前に確認したい契約・セキュリティ面

ベンチマークの点数で盛り上がったあと、契約段階でつまずくパターンが多いです。

確認するのは4点。入力したデータが学習に使われないか。保存先の国はどこか。監査に出せるログが残るか。そして商用利用の範囲に制限がないか。

JGLUEのデータセット自体も、利用条件は公式リポジトリのライセンス表記に従います。社内評価に使う程度なら問題になりにくいものの、評価結果を対外資料に載せるなら一度目を通しておくのが安全です。

主要サービスの条件はLLMカテゴリの一覧から個別に確認できます。無料プランと有料プランでデータの扱いが変わる製品もあるので、プラン単位で見てください。


AI PICKS編集部の判定

JGLUEは、モデル選定の入口として重宝します。無料で、誰でも同じ条件で再現でき、日本語に特化している。この3拍子がそろった公開ベンチマークは貴重です。基礎的な日本語理解が怪しいモデルを早い段階で候補から外せるだけでも、検証にかかる時間は目に見えて減ります。

ただし、これを採用の決定打に使うのは正直イマイチ。問題文がすでに公開されている以上、学習データに答えが混ざったモデルが不自然に高い点を出す可能性を消せません。数ポイントの差を根拠に順位を語る比較表は、鵜呑みにしないでください。

現時点での最適解は、JGLUEで足切りをして、自社の実文書30件で最終判断をする二段構え。この形が一番外しません。ベンダー資料のスコアだけで決めた案件は、運用開始から2か月で作り直しになりがちです。

数字は候補を減らすために使う。決めるのは自社のデータ。この原則さえ守れば、ベンチマークは強い味方になります。


よくある質問(FAQ)

Q. JGLUEは無料で使えますか?

データセットはGitHubで公開されており、入手にお金はかかりません。ただし利用条件は公式リポジトリのライセンス表記に従います。評価結果を社外向け資料に載せる場合は、事前に条件を確認してください。

Q. プログラミングができなくても評価できますか?

JGLUEそのものの実行にはプログラムの知識が必要です。ただし考え方は誰でも真似できます。自社文書30件で正解を用意し、候補モデルに同じ指示を出して合格率を数える。この方法なら表計算ソフトだけで完結します。

Q. スコアが高いモデルを選べば失敗しませんか?

しません。JGLUEが測るのは文章理解の基礎力だけです。回答の書きぶり、指示への従順さ、料金、セキュリティ条件はまったく評価されていません。総合点は候補を絞る道具として使ってください。

Q. 海外製と国産、どちらが日本語に強いですか?

一概には決められません。海外の大規模モデルが日本語ベンチマークで上位に入る場面もあれば、日本語に特化した設計のモデルが特定タスクで上回る場面もあります。自社が扱う文書の種類で結果が変わるため、実文書での比較が必須です。

Q. どのくらいの頻度で見直すべきですか?

半年ごとが現実的な目安です。モデルの更新が速いため、1年放置すると選定条件が古くなります。再評価の日をあらかじめカレンダーに入れておくと、判断の先延ばしを防げます。

Q. 社内文書を使った評価で、情報漏れの心配はありませんか?

外部のクラウドサービスに文書を送る形で評価するなら、データの扱い条件を先に確認してください。手元のサーバーで完結するローカル運用なら、この懸念は小さくなります。評価段階から本番と同じ経路で試すのが安全です。

Q. ベンチマークの数字が公表されていないモデルはどう判断しますか?

自社データでの検証に直行してください。公開スコアがないことは、必ずしも性能が低いことを意味しません。むしろ足切りを飛ばして本番評価に入れるぶん、判断が早くなる場合もあります。


関連する比較・代替を見る

日本語での実力差を具体的に見たいなら、主要モデルの比較ページが手っ取り早いです。

個別の日本語対応状況はChatGPTClaudeGeminiPerplexityの各ページで確認できます。日本語の検索用途ならFelo、社内文書との連携ならNotion AIも候補に入ります。

次に読むならこれ。 評価が済んだあとに待っているのは、社内での運用ルール作りです。証跡の残し方や統制の設計まで一気に押さえたい人は、社内監査・内部統制向けAIツールの整理へ進んでください。選定と運用は地続きです。

各ツールの公式サイト(一次情報)

料金・機能・対応範囲は各社公式が一次情報です。本記事は公開時点の検証に基づきますが、最新かつ正確な条件は必ず各公式ページで確認してください。