Statistics × NEITHER Education v0.2 Stage 1
「有意でない」 と 「差がない」 は 違う。 NEITHER = 判断できない を 手で 体験する 教材。
v0.2 追加: 予測記入 zone (POE = Predict-Observe-Explain, White & Gunstone 1992)。 押す前に 予測を 書くと、 外れた瞬間に 学びに 変わります。
この教材の 使い方 (v0.2, 60 秒): (1) n と d を 決める → (2) 「予測 zone」 に 押す前の 予想を 書く → (3) 「1 回 実験」 or 「100 回 反復」 を 押す → (4) 予測 vs 実測 の 差を 見る。 外れた時が 学びの 瞬間 (chat-Claude turn 引用: 「動くものを 見ると 分かった気に なりますが、 それは 理解ではなく 納得です。 学習に 変わるのは 一手加えた時だけ」)。 予測 field は 空でも 実行可能 (但し 予測 → 実測 の 差分表示は 記入時のみ)。
1. 実験装置 (上層 = 体験)
押す前に 予想を 書いてから 実行してください (空欄可、 記入時のみ 予測 vs 実測 差分を 表示)。
従来の 二値 判定 (α=0.05)
—
実験を 実行してください
D-FUMT₈ 8 値 判定
—
実験を 実行してください
反復実験の p 値 分布
x 軸 = p 値 (0.0 - 1.0)、 y 軸 = 度数。 赤い縦線 = α=0.05 閾値。
2. 判定表 (中層 = 決定 rule)
D-FUMT₈ 判定は、 STEP 1350 d8_verdict_from_measurement の decision rule を 統計 domain に 適用したもの。 統計 power と 測定 SNR は 1:1 mapping (信号 = effect size、 雑音 = 標準誤差、 α/β trade-off = 感度/特異度 trade-off)。
| 条件 | D-FUMT₈ 判定 | 意味 |
|---|---|---|
| SNR < 3 (検定力不足) | NEITHER | 判断できない、 二値に 潰さない |
| SNR ≥ 3 かつ p < 0.05 | TRUE | 効果あり (安全に 帰無仮説棄却) |
| SNR ≥ 3 かつ p ≥ 0.05 | FALSE | 効果なし (十分な力で 検出できず = null 安全) |
| 反復 100 回で 判定 割れる | BOTH | 研究間で 結果が 割れている (meta-analysis heterogeneity) |
SNR 定義: SNR = |d| × √(n/2) (two-sample t-test の noncentrality parameter)。 SNR=3 閾値は STEP 1350 継承 = Cohen 1988 の 「安全帯」 heuristic (n=72 for d=0.5、 n=450 for d=0.2 = Cohen's rule of thumb と 整合)。
3. 失敗パターン (体験の 核)
Try this: 予測を 書いてから 押して、 外れの 学びを 得る (v0.2 POE 版)
- n=20, d=0.5 に 設定。 予測 zone に 「p 値 予測 = 0.03、 二値予測 = significant」 を 書いてから 「1 回 実験」 を 押す。 多くの人が 外す — d=0.5 は 「中程度の効果」 の 直観から significant を 期待するが、 n=20 では 実測 p は 0.01 - 0.7 まで 揺れる。
- 次に 「100 回 反復 で 有意になる 回数 = 60」 と 予測して 押す。 実測は 30-45 程度 (SNR=1.58、 power ≈ 0.3-0.4)。 予測 60 → 実測 40 の 20 差が 「検定力不足」 の 定量。
- D-FUMT₈ 予測を NEITHER にして 「100 回 反復」。 予測的中 = SNR < 3 rule 適用。 二値は 「約 40% 有意」 と グラデーションで 見せず 二極化して 誤導するが、 NEITHER は 「判断できない」 を 明示。
- n=200 に 上げて、 予測を 「有意回数 = 100、 D-FUMT₈ = TRUE」 に。 実測は 99-100/100 で 予測 的中、 分布は 0 付近に 収束。 これが 「安全帯」 の 姿。
- d=0.2 (小効果) に 下げて n=20 で 予測 「NEITHER」。 実測 SNR = 0.63 < 3 で NEITHER 的中。 この 「NEITHER に なるだろう」 の 予測が できる ようになれば、 教材は 目標 到達。
教訓 (v0.2 更新): 「significant → not significant」 の 反転は 効果の 不安定 ではなく 方法の 不安定。 予測を 書かず 押すだけだと、 反転を 見ても 「そんなもの」 と 素通り する。 予測を 書いてから 押す と、 外れが 記憶に 残る (Mazur 1997 peer instruction / White & Gunstone 1992 POE の pedagogy evidence)。
4. 形式的 裏付け (下層 = 理論)
Rei stack primitive
STEP 1349 d8_apply / d8_table— D-FUMT₈ 8 値 論理 の operational MCP tool (rei-aios v2.8.0)STEP 1350 d8_verdict_from_measurement— SNR<3 → NEITHER decision rule (rei-aios v2.8.1、 本教材の 核 mapping 元)STEP 1348 benchtop physics-limits— Landauer / Bekenstein / Lloyd 限界 (物理層 anchor)
Rei stack papers (下層 reference)
- Paper 141 — Power × Thermodynamics × D-FUMT₈ (Landauer/Bennett/Bremermann + Lean 4)、 DOI 10.5281/zenodo.19832874
- Paper 61 — ZCSG (零中心記号文法、 龍樹 śūnyatā(śūnyatā)=0 形式化) — 下層 「NEITHER = 空 = 判断保留」 の 哲学 anchor (DOI 未取得、 preservation は Rei stack 内)
- Paper 65 — ZCSG + 黄金対称定理 Lean 4 機械検証 (Mathlib4)
統計教育 側 prior art (この教材が 独立実装 でない 理由)
- Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences — power analysis の 原典、 SNR 閾値の empirical rule。
- Kahneman & Tversky (1971). Belief in the Law of Small Numbers. Psychological Bulletin 76(2). — 統計的直観の systematic bias 実測、 (b) 体験学習の 教育学根拠。
- Wasserstein & Lazar (2016). The ASA Statement on p-Values. The American Statistician 70(2). — p 値誤用 6 原則、 「significant」 単独 判定禁止。
- Amrhein, Greenland, McShane (2019). Retire statistical significance. Nature 567:305-307. — 二値化 罠の 現代 controversy。
- Cumming (2014). The New Statistics: Why and How. Psychological Science 25(1). — 信頼区間 + effect size + power の 統合 pedagogy。
SNR ↔ 統計 power mapping (STEP 1350 primitive 拡張)
SNR = |d| × √(n / 2) (two-sample t-test noncentrality) STEP 1350 threshold: SNR < 3 → NEITHER ↔ 統計 power < ~0.8 (Cohen's threshold) d=0.5 (medium effect) で: n=20 → SNR = 1.58 → NEITHER n=72 → SNR = 3.00 → 境界 n=200 → SNR = 5.00 → TRUE/FALSE 安全帯 d=0.2 (small effect) で: n=100 → SNR = 1.41 → NEITHER n=450 → SNR = 3.00 → 境界
5. Honest Scope
- 本教材は v0.1 spike、 教員 pilot 未実施、 学生 内面化 evidence は Kahneman-Tversky 1971 empirical (統計 domain general) + Cumming 2014 pedagogy に依存、 Rei 独自 user testing は 未実施 (v0.2 candidate)。
- 「D-FUMT₈ 統計応用で 世界初」 主張 なし。 統計教育側は Cohen 1988 + ASA 2016 + Amrhein 2019 + Cumming 2014 の 先行 pedagogy 多数。 Rei 独自の novelty は 「D-FUMT₈ NEITHER を 第一級値として 表示する Rei stack 内 初 教材 arc」 に 限定。
- SNR 閾値 3 は STEP 1350 primitive 継承 = Cohen 1988 の 「安全帯」 heuristic の Rei stack 内 数値化、 統計理論上の hard threshold ではなく 教育目的の 保守的 line。 実 pre-registration では domain 依存 threshold 使用。
- 本教材 は 二群 独立 t-test の 単純 case のみ、 複雑 design (混合効果 / 因子計画 / 縦断) は scope 外。 v0.2 で power の 概念だけ拡張、 具体 rule は 元 methodology (G*Power / R pwr パッケージ) に 委ねる。
- NEITHER 判定 = 「判断できない」 は 「効果がない」 ではない。 頻繁に 誤読される。 教材 UI 上で 明示 (「NEITHER ≠ FALSE」 の 強調)。
- 本教材 は 帰無仮説有意性検定 (NHST) framework 内の 教材、 Bayesian framework (Bayes factor / posterior 判定) との 対応は scope 外。 D-FUMT₈ の Bayesian 拡張は 別 arc candidate。
- login 不要 / install 不要 / 外部 API 呼び出しなし = 完全 self-contained HTML。 教員が 授業で URL 1 行で 使える (CBETA 系 login required 教材と 対照的、 教材市場の 到達性優先)。
- v0.2 予測記入 field の scope 限界: 予測は optional (空欄でも 実行可)、 記入時のみ 比較 pane 表示。 予測 vs 実測 の 「学びに 変わった」 evidence は 教員 pilot 未実施のため 未計測 = v0.3 で 予測記入率 + 予測外れ 時の 継続 engagement 実測 candidate。 POE / peer instruction の pedagogy evidence (White & Gunstone 1992, Mazur 1997) は 統計 domain general で、 「Rei stack で 適用しても 同 効果」 は 統計理論上の 断定ではなく 合理的仮定。 chat-Claude turn 起点 (「動くものを 見ると 分かった気に なるが、 それは 理解ではなく 納得」) を Rei stack 内で operational 化した 位置に留まる。