D-FUMT₈ ヴォイニッチ検定

Rei-AIOS · STEP 497 · multi-sensor fusion

そのグリッドは、
ヴォイニッチ手稿ではなかった

6センサー融合ページの D-FUMT₈ 点字グリッドが、ヴォイニッチ手稿と同じ統計的性質を持つのかを条件付きエントロピーで検定した。答えは ノー。しかも、外れ方が面白い。

ヴォイニッチ手稿の指紋は「h₂ / h₁ = 0.61」——直前の文字が次の文字を強く予言する、自然言語より遥かに強い記憶。

D-FUMT₈ グリッドは 0.95 – 1.03。記憶ゼロ、つまり完全な独立試行。並べ替え検定でも配列構造は一切検出されなかった(10検定すべて p > 0.12)。見た目の既視感は、系列構造ではなく「小さな未知の字母」+「極端に偏った出現頻度」+「硬い格子」という別の要因から来ている。

the artefact

問題の一枚

★合意異常シナリオの engine raw Unicode art(24 × 8)。12種のグリフ形が現れる、このページで最も「写本らしい」出力。

∙ · ⊙ · • ○ • ⟳ ∿ ∞ ⊙ ⟳ · · ∞ · ⊙ • ⌀ • · ⊙ · ⊙
⊙ ≋ ∙ • ∙ • ⟲ • ⌀ • • ∙ ⌀ ⊙ ~ ∙ ∙ ∙ · ∙ ∿ · ~ ·
∙ ⊙ ⟳ · ○ · ∙ · ⟲ ○ ○ ○ ⊙ ⊙ ∙ • · ⌀ · ∙ • • ⊙ ∙
~ • ∙ · · ≋ ⌀ ∙ ⊙ ⌀ ⊙ ○ ○ · ∙ · · · • • • • • ∙
∿ ∙ ∿ · · ∙ ○ · ⌀ ⌀ ⌀ ⊙ ⌀ ⌀ ⟲ ≋ ⊙ ○ ≋ ∙ ∙ ⟲ ∙ ⌀
· ∙ ⌀ · • ∙ ≋ ⊙ ⊙ ⌀ ⌀ ○ ⌀ ⌀ ∙ ∙ • ⌀ · ∙ ⌀ ≋ • •
⊙ ○ ⟳ ○ ⊙ ∙ ⊙ • ○ ○ ⌀ ⌀ ○ • ~ ∿ • · · • ~ ⊙ ⌀ ·
· • ∙ • · ∙ ≋ ∞ ⊙ ○ ⊙ ⌀ ⌀ ∙ ⊙ · ∙ ~ ⌀ ∙ ∞ ∙ ~ ∙
seed 269421 / snapshot は静的(12回の再読込で完全一致を確認)

what was measured

ふたつのエントロピー

h₁(1次エントロピー)は、グリフの出現頻度だけを見たときの1文字あたりの情報量。h₂(条件付きエントロピー)は、直前のグリフを知ったうえで次を当てるときの情報量。文字列に「並びの癖」があれば h₂ は h₁ より下がる。

だから重要なのは絶対値ではなく比 h₂ / h₁ だ。字母のサイズに依存しないので、8値のグリッドと20字超のヴォイニッチ字母を同じ土俵で比べられる。比が 1.00 なら記憶なし(独立試行)、小さいほど並びが予測可能。

ヴォイニッチ手稿

h₁ = 3.66 / h₂ = 2.22 bits(Bennett 1976)。比 0.607。「自然言語より秩序が強すぎる」という、この写本の最も再現性の高い異常。

ヨーロッパ諸語

h₁ = 3.91–4.14 / h₂ = 3.01–3.37 bits。比 0.770 – 0.814。綴りの規則が次の文字をある程度縛る、ふつうの言語の水準。

the five scenarios

5つのシナリオ、192グリフずつ

dot grid(24 × 8)を D-FUMT₈ の八値でそのまま色に写した。実際に現れたのは 8値のうち 4値だけ。静穏では ● TRUE がほぼ全面を占め、★合意異常でようやく 4値が混ざる。

● TRUE ⌀ NEITHER ~ FLOWING ⟲ SELF FALSE · BOTH · INFINITY · ZERO は全シナリオで出現数 0

抽出の妥当性確認:★合意異常の実測構成比は ● 0.500 / ⌀ 0.339 / ~ 0.099 / ⟲ 0.062 で、サイトが自ら表示している Grid axis distribution(0.5 / 0.339 / 0.099 / 0.063)と一致した。

the decisive figure

比 h₂ / h₁ ——ヴォイニッチとの距離

条件付きエントロピー比(1.00 = 直前のグリフが次を何も予言しない)

帯は5シナリオの範囲・破線は 1.00

グリッドは 1.00 の線にぴったり張り付いている。engine raw art はわずかに下(0.87–0.97)だが、これは字母が12種に増えて標本 192 に対する推定バイアスが効いた分で、後述の並べ替え検定で有意にならない。ヴォイニッチの 0.607 との間には、自然言語がまるごと入る隙間がある。

the numbers

全10検定

h₂ は行内バイグラム(24文字 × 8行 = 184組)から算出。p 値は構成比を保ったまま順序だけ 20,000 回ランダム化し、観測 h₂ 以下が出る割合(下側検定)。小さいほど「並びに癖がある」。
シナリオ層字母 kh₁h₂h₂/h₁同一連続率p(並べ替え)

so why the resemblance

では、なぜ写本に見えたのか

統計が否定したのは「並びの記憶」だけで、既視感そのものは本物だ。原因は三つに分解できる。

1. 字母が小さく、見慣れない

⊙ ⌀ ∿ ≋ ⟳ ——読めないが規則的に反復する記号が 12種。人間は「解読できない文字体系」を見たとき、まずヴォイニッチを想起する。

2. 頻度が極端に偏る

1文字が全体の半分以上を占め、残りが散発的に混じる。Bennett はヴォイニッチの h₁ が自然言語より低く「数表に近い」と述べた。この偏りこそ共通点で、実は数表の性質のほう。

3. 硬い格子に流し込まれている

24 × 8 の等幅行。手稿のページ組と同じ「均質なテクスチャ」が生まれ、意味ありげな塊に見える。

つまり見えていたのはヴォイニッチではなく「数表」だった。そしてヴォイニッチ手稿の不気味さは、まさにこの二つの中間——h₁ は数表のように低いのに、h₂ / h₁ は言語のように構造を持つ——という点にある。engine の出力は前半だけを満たしている。

if you want the real thing

本当にヴォイニッチ的にするには

現在の生成器は各セルを独立に引いている(並べ替え検定がそれを裏付けた)。h₂ / h₁ を 0.6 台まで落とすには、順序に依存性を入れるしかない。D-FUMT₈ の枠内なら自然な手が二つある。

どちらでも、比較の枠組み(h₁ / h₂ / 並べ替え検定)はそのまま使い回せる。改造前の値がこのページに残っているので、前後比較ができる。