Statistics × NEITHER Education v0.2 Stage 1

「有意でない」 と 「差がない」 は 違う。 NEITHER = 判断できない を 手で 体験する 教材。
v0.2 追加: 予測記入 zone (POE = Predict-Observe-Explain, White & Gunstone 1992)。 押す前に 予測を 書くと、 外れた瞬間に 学びに 変わります。

この教材の 使い方 (v0.2, 60 秒): (1) n と d を 決める → (2) 「予測 zone」 に 押す前の 予想を 書く → (3) 「1 回 実験」 or 「100 回 反復」 を 押す → (4) 予測 vs 実測 の 差を 見る。 外れた時が 学びの 瞬間 (chat-Claude turn 引用: 「動くものを 見ると 分かった気に なりますが、 それは 理解ではなく 納得です。 学習に 変わるのは 一手加えた時だけ」)。 予測 field は 空でも 実行可能 (但し 予測 → 実測 の 差分表示は 記入時のみ)。

1. 実験装置 (上層 = 体験)

押す前に 予想を 書いてから 実行してください (空欄可、 記入時のみ 予測 vs 実測 差分を 表示)。

従来の 二値 判定 (α=0.05)

実験を 実行してください

D-FUMT₈ 8 値 判定

実験を 実行してください

反復実験の p 値 分布

x 軸 = p 値 (0.0 - 1.0)、 y 軸 = 度数。 赤い縦線 = α=0.05 閾値。

2. 判定表 (中層 = 決定 rule)

D-FUMT₈ 判定は、 STEP 1350 d8_verdict_from_measurement の decision rule を 統計 domain に 適用したもの。 統計 power と 測定 SNR は 1:1 mapping (信号 = effect size、 雑音 = 標準誤差、 α/β trade-off = 感度/特異度 trade-off)。

条件D-FUMT₈ 判定意味
SNR < 3 (検定力不足)NEITHER判断できない、 二値に 潰さない
SNR ≥ 3 かつ p < 0.05TRUE効果あり (安全に 帰無仮説棄却)
SNR ≥ 3 かつ p ≥ 0.05FALSE効果なし (十分な力で 検出できず = null 安全)
反復 100 回で 判定 割れるBOTH研究間で 結果が 割れている (meta-analysis heterogeneity)

SNR 定義: SNR = |d| × √(n/2) (two-sample t-test の noncentrality parameter)。 SNR=3 閾値は STEP 1350 継承 = Cohen 1988 の 「安全帯」 heuristic (n=72 for d=0.5、 n=450 for d=0.2 = Cohen's rule of thumb と 整合)。

3. 失敗パターン (体験の 核)

Try this: 予測を 書いてから 押して、 外れの 学びを 得る (v0.2 POE 版)

  1. n=20, d=0.5 に 設定。 予測 zone に 「p 値 予測 = 0.03、 二値予測 = significant」 を 書いてから 「1 回 実験」 を 押す。 多くの人が 外す — d=0.5 は 「中程度の効果」 の 直観から significant を 期待するが、 n=20 では 実測 p は 0.01 - 0.7 まで 揺れる。
  2. 次に 「100 回 反復 で 有意になる 回数 = 60」 と 予測して 押す。 実測は 30-45 程度 (SNR=1.58、 power ≈ 0.3-0.4)。 予測 60 → 実測 40 の 20 差が 「検定力不足」 の 定量。
  3. D-FUMT₈ 予測を NEITHER にして 「100 回 反復」。 予測的中 = SNR < 3 rule 適用。 二値は 「約 40% 有意」 と グラデーションで 見せず 二極化して 誤導するが、 NEITHER は 「判断できない」 を 明示。
  4. n=200 に 上げて、 予測を 「有意回数 = 100、 D-FUMT₈ = TRUE」 に。 実測は 99-100/100 で 予測 的中、 分布は 0 付近に 収束。 これが 「安全帯」 の 姿
  5. d=0.2 (小効果) に 下げて n=20 で 予測 「NEITHER」。 実測 SNR = 0.63 < 3 で NEITHER 的中。 この 「NEITHER に なるだろう」 の 予測が できる ようになれば、 教材は 目標 到達

教訓 (v0.2 更新): 「significant → not significant」 の 反転は 効果の 不安定 ではなく 方法の 不安定。 予測を 書かず 押すだけだと、 反転を 見ても 「そんなもの」 と 素通り する。 予測を 書いてから 押す と、 外れが 記憶に 残る (Mazur 1997 peer instruction / White & Gunstone 1992 POE の pedagogy evidence)。

4. 形式的 裏付け (下層 = 理論)

Rei stack primitive

Rei stack papers (下層 reference)

統計教育 側 prior art (この教材が 独立実装 でない 理由)

SNR ↔ 統計 power mapping (STEP 1350 primitive 拡張)

SNR = |d| × √(n / 2)     (two-sample t-test noncentrality)

STEP 1350 threshold: SNR < 3 → NEITHER
  ↔ 統計 power < ~0.8 (Cohen's threshold)

d=0.5 (medium effect) で:
  n=20  → SNR = 1.58 → NEITHER
  n=72  → SNR = 3.00 → 境界
  n=200 → SNR = 5.00 → TRUE/FALSE 安全帯

d=0.2 (small effect) で:
  n=100 → SNR = 1.41 → NEITHER
  n=450 → SNR = 3.00 → 境界

5. Honest Scope

  1. 本教材は v0.1 spike、 教員 pilot 未実施、 学生 内面化 evidence は Kahneman-Tversky 1971 empirical (統計 domain general) + Cumming 2014 pedagogy に依存、 Rei 独自 user testing は 未実施 (v0.2 candidate)。
  2. 「D-FUMT₈ 統計応用で 世界初」 主張 なし。 統計教育側は Cohen 1988 + ASA 2016 + Amrhein 2019 + Cumming 2014 の 先行 pedagogy 多数。 Rei 独自の novelty は 「D-FUMT₈ NEITHER を 第一級値として 表示する Rei stack 内 初 教材 arc」 に 限定。
  3. SNR 閾値 3 は STEP 1350 primitive 継承 = Cohen 1988 の 「安全帯」 heuristic の Rei stack 内 数値化、 統計理論上の hard threshold ではなく 教育目的の 保守的 line。 実 pre-registration では domain 依存 threshold 使用。
  4. 本教材 は 二群 独立 t-test の 単純 case のみ、 複雑 design (混合効果 / 因子計画 / 縦断) は scope 外。 v0.2 で power の 概念だけ拡張、 具体 rule は 元 methodology (G*Power / R pwr パッケージ) に 委ねる。
  5. NEITHER 判定 = 「判断できない」 は 「効果がない」 ではない。 頻繁に 誤読される。 教材 UI 上で 明示 (「NEITHER ≠ FALSE」 の 強調)。
  6. 本教材 は 帰無仮説有意性検定 (NHST) framework 内の 教材、 Bayesian framework (Bayes factor / posterior 判定) との 対応は scope 外。 D-FUMT₈ の Bayesian 拡張は 別 arc candidate。
  7. login 不要 / install 不要 / 外部 API 呼び出しなし = 完全 self-contained HTML。 教員が 授業で URL 1 行で 使える (CBETA 系 login required 教材と 対照的、 教材市場の 到達性優先)。
  8. v0.2 予測記入 field の scope 限界: 予測は optional (空欄でも 実行可)、 記入時のみ 比較 pane 表示。 予測 vs 実測 の 「学びに 変わった」 evidence は 教員 pilot 未実施のため 未計測 = v0.3 で 予測記入率 + 予測外れ 時の 継続 engagement 実測 candidate。 POE / peer instruction の pedagogy evidence (White & Gunstone 1992, Mazur 1997) は 統計 domain general で、 「Rei stack で 適用しても 同 効果」 は 統計理論上の 断定ではなく 合理的仮定。 chat-Claude turn 起点 (「動くものを 見ると 分かった気に なるが、 それは 理解ではなく 納得」) を Rei stack 内で operational 化した 位置に留まる。