算数の実験ノート

実験ノート・2026年8月

算数の実験ノート スライダーで動かして確かめる、世界の「計算」の最前線

実験 4本
試験問題 4セット・36問
調査時点 2026-08-24
ブラウザの制限で、最初に一度ボタンを押すまで音は出ません

実験1 ── 掛け算は、どこまで速くなったか

小学校で習う筆算は n² 回の九九で済みます。人類はこれを n log n まで削りましたが、その最速アルゴリズムは実際には一度も使われたことがありません。桁数スライダーを動かして、理論と実用の断絶を見てください。

Controls

左のドット1つが「九九1回」。桁数を倍にすると面積は4倍になります。

30 → 8ビット、480 → 1024ビット。対数目盛です。

GMPが実際にアルゴリズムを切り替える桁のあたり。理論の交差点とはズレます。

九九の回数(筆算)
64
Karatsubaなら
27
削減率
−58%
筆算 n² Karatsuba Toom-3 Schönhage–Strassen Harvey–van der Hoeven
現在の桁数
308 桁
筆算に対する比 (Karatsuba)
1/8.4
同 (n log n)
1/103
ここが本題です。 グラフ上では紫(n log n)が常に最下段にいます。ところが Harvey–van der Hoeven のアルゴリズムが実際に他を追い越すのは、掛ける数のビット数が 2^(1729¹²) を超えてからです。観測可能な宇宙の粒子数がおよそ 2²⁷⁰ ですから、この数は「大きい」という言葉が意味を失う領域にあります。数学的には最適に到達し、実務では一度も走らない ── これを 銀河アルゴリズム と呼びます。
2025年の進展。 Harvey と van der Hoeven 自身が3月に「整数の掛け算は、行列の転置と少なくとも同じくらい難しい」という条件付き下界を証明しました。n log n が本当に限界かどうかは、いま「n×n の二値行列をひっくり返すのに Ω(n² log n) ステップ要るか」という、はるかに素朴に見える問いに預けられています。

実験2 ── AIは何桁から掛け算を間違えるか

2026年7月、AIは国際数学オリンピックで史上初の満点42/42を取りました。同じAIが、道具なしでは5桁×5桁でほぼ全滅します。2026年の実測研究は、崩壊の位置が「総桁数 × 非ゼロ桁数」という一つの量で決まることを示しました。

Controls

0が多い数ほど「非ゼロ桁数」が減り、AIには易しくなります。0が並ぶ数を掛けるのが簡単なのは、人間と同じです。

算術負荷 C
64
予測正答率
93%
実測(この画面)
— /0回
問題
1234 × 5678
正解
7006652
モデルの答え 未実行
—
予測正答率 p(C) いまの設定 C=100(5桁×5桁)
この崩壊の正体。 Anthropicの解釈可能性研究(2025年)が Claude の内部を追跡したところ、36+59 を解くとき筆算はしていませんでした。片方の経路が「だいたい92くらい」と粗く近似し、もう片方が「_6+_9 なら末尾は5」というルックアップで下一桁だけ精密に決め、合流して95を出す。しかも「どう解いた?」と聞くと「1を繰り上げて…」と答えます。説明は人間の模倣、計算は独自戦略という乖離です。近似と末尾照合の合成は、桁が増えるほど中間桁の逃げ場がなくなります。
足し算は解決、掛け算は未解決。 2024年の Abacus embeddings は20桁までの学習から100桁の足し算を99%正解させました。一方4桁×4桁の掛け算は、通常のfine-tuningでは正解率1%未満。2025年の研究が「途中の累計を予測させる補助損失」を足して99%に到達させましたが、汎用解ではありません。さらに2026年2月、Transformerの長さ一般化に計算可能な上界は存在しないことが定理として証明されました。「何桁まで大丈夫か」を事前に保証する方法は、原理的にありません。

※ このシミュレーションは実際のモデルを呼んでいません。arXiv:2604.18203 の実測(Gemini / Qwen / OpenAI / xAI 各系列、C≈74で50%、C>100でほぼゼロ)に合わせたロジスティック曲線からサイコロを振り、失敗時は中間桁を壊すという、実際のモデルによく見られる誤り方を再現しています。

実験3 ── 4ビットで数を表す

いまのAIは1つの数を4ビット、つまり16通りでしか表していません。OpenAIのgpt-ossは117Bのモデルを重み4.25ビット/個に圧縮してGPU1枚に載せました。音を出して聞いてください ── スライダーの音程そのものが量子化されます。

Controls

音を有効にすると、この値が音の高さになります。

E=指数ビット、M=仮数ビット。1+E+M がその形式の総ビット数です。

OCP標準のMXFP4は共有スケールが2のべき乗のみ。NVIDIA独自のNVFP4は小数を持つFP8スケール+半分のブロック長です。

ブロック内に1つだけ大きな値を混ぜます。共有スケールが引きずられ、他の値が潰れます。

元の値
3.14159
量子化後
3.25
相対誤差
3.45%
表せる値の総数
256
S 符号 E 指数 M 仮数

数直線 ── その形式が表せる値だけ

目盛りの1本1本がその形式で表現できる値です。0の近くでは細かく、外側では急激に粗くなる ── これが浮動小数点の本質で、ニューラルネットの重みが0付近に集まるからこそ4ビットが成立します。

ブロック共有スケール ── MXFP4 と NVFP4

MXFP4 の RMS誤差
—
NVFP4 の RMS誤差
—
NVFP4 の優位
—
形式だけでは学習できません。 NVIDIAは12Bのモデルを10兆トークン、NVFP4で事前学習してFP8とほぼ同じ損失曲線を出しました。しかし Meta/UMass の実証では、素のMXFP4は損失差が0.5まで開いて発散し続けます。差を埋めているのはランダム・アダマール変換、確率的丸め、2次元量子化といった周辺技術です。4ビットが動くのは形式の力ではなく、その周りに積み上げた工夫の力です。
標準と実装が割れています。 OCPのMX仕様はAMD・Arm・Intel・Meta・Microsoft・NVIDIA・Qualcommの7社で作られ、2023年のv1.0から更新されていません。そのNVIDIAが主力に据えたのはMX非準拠のNVFP4です。IEEEは別立てのP3109で2029年頃を目指していますが、産業界のほうが3〜4年速く走っています。なお Gustafson の Posit は、P3109にもOCPにも採用されず、主要AIチップでの対応製品はゼロです。

実験4 ── 学力は「平均」では落ちていない

TIMSS 2023で米国の小4算数は2019年比−18点でした。ところが内訳を見ると上位10%はほぼ横ばい、下位10%が−37点。落ちたのは平均ではなく分布の左側です。休校期間と支援の配り方を動かして、同じ「−18点」がどう作られるか見てください。

Controls

100%にすると下位層の損失が消えます。ただし米国の実際の回復は「U字型」で、最低所得層と最高所得層が回復し、中間層が取り残されました。

米国の慢性的欠席率はコロナ前15% → 2024-25年は23%。これが回復を年0.03〜0.05学年分遅らせたと推計されています。

2019年(基準) いまの設定 下位ベンチマーク 400点
下位10%
−37
下位25%
−29
中央値
−18
上位10%
−2
平均点
517
400点未満の割合
—
上位と下位の開き
—
回復は二極化しています。 TIMSS 2023で小4算数が2019年より改善した国は10か国を超えましたが、中2数学で改善したのはわずか3か国です。72か国・300万人のPISAデータの分析でも、休校が長かった国では最低学力層で最大33点低下、上位層は8〜9点にとどまりました。同じ平均点の低下でも、中身はまったく違います。
日本の位置。 TIMSS 2023 小4算数は591点で5位、PISA 2022数学はOECD1位です。国際的地位は保っています。一方、令和8年度の全国学力調査で小6算数の平均正答率は56.6%。文科省のワーキンググループ資料は課題として「練習量の不足による未定着」と、「分散学習・検索学習という認知心理学の知見の活用が不十分」を挙げました。次期学習指導要領では小学校の教科名「算数」は維持されますが、英語表記は Arithmetic から Mathematics に変わります。

※ 分布は平均535・標準偏差80の正規分布を基準に、分位点ごとの損失関数 f(p) = −0.058 + 2.391·(1−p)^1.18 を当てはめたモデルです。休校12か月・支援0%で米国の実測(−37 / −29 / −18 / −2)に一致するよう較正しています。実測値そのものではなく、実測値を再現するモデルです。

付録 ── 最新の試験問題と解答

同じ「算数・数学」を、小学6年生・世界の10歳・国際数学オリンピック代表・そしてAIが、それぞれどう問われているか。正答率つきで並べました。問題は要旨に整理してあります(原典リンクは末尾)。