英語学習の現在地

Research Brief

英語学習の現在地
日本・世界・エビデンス

日本の英語力は「毎年少しずつ上がっているが目標には届かない」状態が続いている。 一方、世界では生成AIを使った学習の効果検証が出そろい始め、 「何が効くか」がようやく効果量の言葉で語れるようになった。その両方を並べる。

調査日 2026-08-27 対象 日本/世界 一次資料 文科省・EF・World Bank・メタ分析

01

日本の現状 — 上昇はしている、届いていない

文部科学省「英語教育実施状況調査」令和7年度(2025年度)/2026年6月公表

中3 · CEFR A1以上
(英検3級相当)

54.6%

前年度比 +2.2pt

政府目標 60%

高3 · CEFR A2以上
(英検準2級相当)

52.4%

前年度比 +0.8pt

政府目標 60%

高3 · CEFR B1以上
(英検2級相当)

23.9%

前年度比 +2.7pt

政府目標 30%

EF EPI 2025
日本の世界順位

96/123

11年連続の低下

区分「非常に低い」

全指標が過去最高を更新しながら、第4期教育振興基本計画(2023–27年度)の目標には全て未達。 伸び幅は年 +1〜3pt 台で、このペースでは2027年度の目標到達は難しい。

目立つのは地域差のほうだ。中3のA1以上はさいたま市 88.9%、福井県 84.6%に対し全国平均は 54.6%。 高3のB1以上で目標30%を超えたのは東京都(35.8%)と福井県(31.7%)の2都県のみ。 全国平均は、達成している自治体と大きく遅れている自治体の合成値にすぎない。

教員側は先に目標を抜けた。中学教員のCEFR B2(英検準1級)以上は 58.6%(前年度 46.2% から +12.4pt)、高校教員は 84.9%、うちC1以上が 25.8%。 指導者の英語力はもはやボトルネックではない、というのが今回の調査のいちばん大きな変化点だ。

文科省ワーキンググループが挙げる構造的課題

領域指摘されている状態含意
技能の偏り 「書くこと」「話すこと」の正答率が低下傾向。中学では経年でスコア低下、特に社会的話題と文法の正確性 受信は伸び、発信が落ちている
校種間接続 中学校教師の約50%が小学校の言語材料・活動を理解していない 小5から中1で学習が一度切れる
語彙負担 教科書語彙数が増加する一方、受容語彙と発信語彙が区別されていない 全語を同じ強度で覚えさせている
学習意欲 小学校での「英語が好き」が平成25年比で7pt低下、学年進行でさらに減少 入口の段階で嫌いにさせている
評価 高校「論理・表現」でのパフォーマンステスト実施率が55%未満 発信を教えても測っていない

市場側 — 横ばいの総額、動いている中身

語学ビジネス市場は2024年度 7,906億円(前年度比 +0.2%)、2025年度予測 7,901億円 でほぼ横ばい。 総額は動かないが内訳は入れ替わっており、成人向けとプリスクールが伸びる一方で幼児・子供英会話教室はマイナス、通訳・翻訳ビジネスは下降。 代わりに英語コーチングとAI英会話アプリが台頭している(ただし収益性には課題)。

需要のシフトは試験統計にもっとはっきり出る。TOEIC L&R は2025年度 196.4万人 と微増にとどまるのに対し、 TOEIC Speaking & Writing は 約5.1万人(前年度比 +30%)、採用団体 約460 で2007年の開始以来の過去最多。 規模は小さいが伸び率が違う。企業が測りたいものが「読める」から「話せる・書ける」に移っている。

入試も同じ方向を向いている。2026年度共通テストのリーディングは総語数 5,546語、 試験時間短縮と合わせて1分あたり処理語数は1989年度の 27.3語 から 69.3語 へ約2.5倍。 発音・アクセント・文法の単独問題は廃止され、メールやレポートを読む総合読解に置き換わった。

EF EPI の読み方に注意。 EF EPI は無料オンラインテストの自己選択サンプル(2024年に世界220万人)に基づく指標で、 受験者層が国ごとに異なる。日本の96位を「学力の国際比較」として文科省調査と同列に扱うのは無理がある。 ただし11年連続で順位が下がり続けているという時系列の方向性は、 他国が英語学習に投じている量が日本より速く増えていることの傍証にはなる。
02

世界の現状 — 若年層が落ちている

EF EPI 2025(123カ国・地域/220万人)、主要プレイヤーの事業指標

EF EPI 2025 で最も注目すべきなのは日本の順位ではなく、25歳未満のスコアが年上の世代より低い国が多数あり、 コロナ後の回復が見られないという指摘だ。「若い世代ほど英語ができる」という長年の前提が崩れかけている。 併せて、測定した国の半数以上でスピーキングが最弱技能と出た。 2025年版から初めてスピーキングとライティングの採点にAIが使われ、4技能の内訳が見えるようになったことでこれが可視化された。

産業側では、規模の追求が優先されている。Duolingo は2026年第2四半期で DAU 5,870万(+23%)、有料会員 1,270万(+17%)に対し、 予約売上は 2.89億ドル(+8%)と伸びが鈍い。 利用者は増えているが、1人あたりの単価は伸びていない。 決算説明会では、オープンソースモデルの採用によりAIビデオ通話の単価を 1回0.30ドルから0.01ドル未満 まで下げたと説明されている(この数字は説明会での発言で、株主レターには記載がない)。

つまりAI会話練習のコストはほぼゼロに向かっている。 「AIと英語で話せる」こと自体はもう差別化要因ではなく、無料側に落ちていく機能だと考えたほうがいい。

03

最先端 — 効果量で並べると何が効くか

RCT・メタ分析による検証結果。d / g はいずれも標準化効果量(0.2 小 / 0.5 中 / 0.8 大)

介入効果量規模・条件
ASR発音訓練(成人)
1.20
メタ分析15研究/38効果量。全体は 0.69
ASR発音訓練(5–8週間)
1.01
1–4週では 0.07、9週以上で 0.72
ペアでのASR練習
0.89
単独練習は 0.44
明示的な訂正フィードバック
0.86
正誤のみの間接FBは 0.50
分節音(個々の音)の指導
0.82
超分節(強勢・イントネーション)は 0.37
教室での小テスト+FB
0.54
222研究/48,478人。FBなしは 0.37
多読(extensive reading)
0.38
2025年メタ分析73研究/82介入
生成AIチューター(英語)
0.23
World Bank ナイジェリアRCT。総合では 0.31

個別に見るべき3件

World Bank / ナイジェリア RCT(2025) ── 中等学校1年生を対象に、 Microsoft Copilot(GPT-4)を放課後の仮想チューターとして6週間使わせたランダム化比較試験。 英語で +0.23SD、総合で +0.31SD。これは通常の学校教育 1.5〜2年分 に相当し、 低リソース環境の教育介入としては極めて費用対効果が高い。ただし効果は女子生徒ともともと成績上位の生徒で大きかった。 AIチューターは格差を縮めるとは限らない。

SAMRモデルによる系統的レビュー(281研究) ── AIを使った言語学習研究のうち 63% が 「Augmentation(既存タスクの機能改善)」止まりで、本当に学習設計を作り変えた「Redefinition」は 約4% にすぎない。 生成AIは2022年以降、技術的障壁を下げた触媒ではあるが、導入すれば設計が変わるわけではないと結論している。 技能別では語彙が最も変容率が高く、受容技能(読む・聞く)の研究は全体の12%と手薄。

多読メタ分析(2025) ── 全体 d = 0.38 と控えめだが、効果を押し上げる条件が2つ特定されている。 ひとつはレベルで選択肢を絞ること(完全自由選択より効果が大きい)、 もうひとつは読書記録・クイズ・レポートなどの説明責任を組み込むこと。 「好きな本を自由に読ませる」が最善ではない、という点が実務的に重要。

日本国内の実証 — 文科省が300校で動かしている

「AIの活用による英語教育強化事業」(令和6年度補正 6億円)。 全国 約300校 をモデル校に指定し、約1,200名 の「AI英語活用リーダー」を配置。 ELSA for Schools、ECC Study Assist、教科書AIワカル、WorldClassroom などが実際に使われ、 2026年2月に最終成果報告会が開かれている。 現場からは「AIとの1対1練習は発話量の増加と心理的安全性に効果的」という報告が上がっている。

文科省の課題認識は率直で、資料では「生徒の英語力は向上傾向にあるが、社会の期待とは依然大きな乖離」とし、 根本原因を英語を実際に使う機会の不足と学習動機の欠如に置いている。 AIに期待しているのは賢さではなく、練習量と動機付けだ。

04

設計原則 — エビデンスから逆算する

教材・学習ツールを作る側から見た、上記データの含意

  1. 「AIと話せる」は差別化にならない Duolingo がAI会話の単価を1回1セント未満まで落とした。会話練習の提供自体は無料側に落ちる。差が出るのは、その会話に何を記録し、何を訂正するかの設計のほう。
  2. 訂正は「明示的」に 正誤だけ返すと効果量 0.50、何がどう違うかを明示すると 0.86。小テストでも同じ傾向(FBあり 0.54 / なし 0.37)。フィードバックの粒度が最大の設計変数。
  3. 5週間より短い設計は効果がほぼ出ない ASR発音訓練は1–4週で 0.07、5–8週で 1.01。単発の教材ではなく、5週以上の継続を前提にした構造(記録・再訪・間隔)が必要。
  4. 自由より「制約+記録」 多読はレベルで選択肢を絞り、記録やクイズを課したときに効果が伸びる。学習者に全裁量を渡すのは親切に見えて効果を下げる。
  5. テスト形式の反復が費用対効果で最強 教室クイズ g≈0.5(222研究・48,478人)。分散学習は集中学習に勝るが、等間隔と拡張間隔の差は統計的に有意でない。間隔の設計に凝るより、まず反復させること。
  6. 機械が弱い領域を人間に残す ASRは分節音に強く(0.82)超分節に弱い(0.37)。イントネーション・強勢・談話レベルの自然さは、まだAI単独では扱えない。
  7. 日本市場の空白は「発信 × 即時訂正 × 記録」 TOEIC S&W が前年比+30%で需要は動いている。一方で高校「論理・表現」のパフォーマンステスト実施率は55%未満、文科省WGも書く・話すの低下を指摘。測られていない技能に需要が集まっているのが現在のねじれ。
  8. AIチューターは上位層に効く可能性を織り込む ナイジェリアRCTでは効果が上位層と女子生徒に偏った。「誰でも伸びる」ではなく「自走できる層がさらに伸びる」道具として設計するほうが実態に合う。

SOURCES