STEP 1841 · 2026-09-06 · Rei-AIOS Weaver Level B arc continuation

STS-B external gold standard evaluation — SBERT 0.828 vs NCD 0.498 vs D-FUMT₈ Hellinger 0.097 (Pearson r on 1379 pairs)

← STEP 1839 (Weaver Level B full arc) · 無限次元ドット理論 · notepad index

STEP 1839 arc の 継続 (藤本さん 「A、 その後 B」 明示)。 real gold standard STS-B (Cer et al. 2017、 1379 test pair、 gold similarity 0-5) で SBERT (all-MiniLM-L6-v2 cosine) と NCD (zstd -19) と D-FUMT₈ Hellinger を 系統的比較。 D-FUMT₈ が 英単言語 sentence 類似 で 明確に負けた honest 負の evidence 取得 = STEP 1839 Step 4 の 「D-FUMT₈ は cross-lingual + word-level で 勝つ、 within-language sentence 類似 で 負ける」 予測 の 独立検証。

★ 結論先出し: D-FUMT₈ Hellinger は STS-B で 0.097 Pearson = 弱 ★ これは 予測通り の 負け、 D-FUMT₈ 設計 の refutation では なく domain-specific tool の 正当な boundary 確認。 STS-B は English monolingual sentence similarity で、 D-FUMT₈ の 勝ち domain (cross-lingual + word-level 翻訳検索 = STEP 1839 Task B で NCD の 2× 上) とは 異なる領域。 訓練 embedding (SBERT) が dominate する 期待通り の 領域で、 untrained + language-agnostic + char-stat-based の D-FUMT₈ が 及ばない こと自体は 誠実な boundary。

実験設定

環境 (0 install cost、 既存 discovery)

Dataset (STS-B English test set)

3 metric

metric実装実行時間
SBERT cosine (all-MiniLM-L6-v2)Python subprocess (_sbert_embed.py)、 batch encoding、 HF Hub から model 初回 download (90 MB)34.6s
NCD (zstd -19)TypeScript subprocess、 各 pair の cross-compressed size 実測~90s
D-FUMT₈ HellingerTypeScript pure (src/aios/weaver-level-b/)、 vector cache で 高速~5s

結果 (n=1379 pair)

metricPearson rSpearman ρ×100 (STS-B official)判定
SBERT cosine (MiniLM-L6-v2)0.82800.821482.80強 baseline (期待通り Reimers-Gurevych 2019 帯)
NCD (zstd -19、 negated)0.49830.501449.83中 (意外に健闘)
D-FUMT₈ Hellinger (negated)0.09670.09869.67弱 (訓練 embedding gap 明確)

Interpretation (honest 3 層)

1. SBERT が dominant (0.828)
訓練済み sentence embedding は STS-B で 期待通り strong (Reimers-Gurevych 2019 の 0.75-0.85 帯)。 all-MiniLM-L6-v2 は 22M param の 小型 SBERT、 fair baseline として 適正 (mpnet-base 等 大型 model で 更に 高い可能性)。
2. NCD が意外に健闘 (0.498)
Kolmogorov complexity 系 の byte-level 距離 が sentence 類似 に 中程度 signal を carry。 STS-B の 同義 pair が 語彙 overlap 大 = zstd で 効率的圧縮 = NCD が 小、 non-similar pair は 語彙 overlap 少 = zstd 効率下 = NCD 大、 の 相関を 捕まえた。 単に 「NCD は Level A、 D-FUMT₈ は Level B」 と 単純化できない証拠。
3. D-FUMT₈ Hellinger は 弱 (0.097)
provisional projection は 英単言語 sentence 類似 の operational task では ほぼ 情報 carrying なし。 但し これは 設計 refutation では ない、 D-FUMT₈ の 設計 focus (Unicode-aware script + 8 言語 negation + character-level pattern) が benefit する domain と STS-B の domain の mismatch。

STEP 1839 Step 4 の 予測 との consistency

STEP 1839 で 判明 の task-domain breakdown:
domainD-FUMT₈NCD本 STEP との consistency
Word-level translation retrieval (Task B、 25 concept 189 candidate)MRR=0.117 (勝ち)MRR=0.081STS-B とは 別 domain (word-level cross-lingual)
Contradiction detection (Task A、 F1)0.440 (勝ち)0.126負ention 検出 は BOTH axis 直接、 STS-B とは 別
Cross-topic detection (Task A、 F1)0.085 (負け)0.796STS-B monolingual sentence と 同型 pattern
English monolingual sentence similarity (STS-B)0.097 Pearson (負け)0.498★ 本 STEP、 STEP 1839 Step 4 予測 直接 confirm
★ 内部 self-consistency + external gold standard 両方で consistent: D-FUMT₈ は 「word-level + cross-encoding」 で 勝ち、 「within-language + sentence-level」 で 負ける、 の boundary が 確立。 これは domain-specific tool として の 正当な positioning、 「universally superior」 主張 は 明確に refute。

Honest scope (7 層 preserve)

  1. SBERT ≠ 完全 BERTScore: SBERT は whole-sentence cosine similarity、 完全 BERTScore (Zhang et al 2020) は per-token BERT contextual embedding + soft F1 alignment。 STS-B での 差 は 通常 数 point (両者 0.81-0.85 帯)
  2. STS-B は English monolingual sentence: D-FUMT₈ の 設計 focus (multi-lingual + notation-variant) と mismatch domain、 「負けた」 の 意義 は task-domain-specific
  3. all-MiniLM-L6-v2 は 小型 SBERT: 22M param、 mpnet-base (110M) 等 大型 model だと 更に 高い可能性、 fair baseline として 適正
  4. D-FUMT₈ untrained + language-agnostic + char-stat-based: 訓練 gap が 明確、 「trained embedding より 劣る」 は 訓練データ + 教師信号 の 不在 の 直接反映
  5. STS-B での 敗退 は refutation では ない: 「domain-specific tool」 としての 正当な boundary 確認、 STEP 1839 Task B translation retrieval の win は 独立の evidence
  6. Single dataset (STS-B): n=1 dataset で general claim は 不可能、 SICK / SNLI / Tatoeba 等 で 系統的評価 が general boundary claim の 前提
  7. Model auto-download from HF Hub: network dependence あり、 offline reproducibility は 事前 cache 要

Failure mode dataset (未来 Claude 予防)

  1. What could go wrong: 「D-FUMT₈ Pearson 0.097 = 完全に useless」 と generalize (誤 = STS-B の 特定 domain 負け のみ、 translation retrieval domain では NCD の 2× 上); 「SBERT が universally superior = D-FUMT₈ 開発中止」 (誤 = SBERT は sentence-level English、 D-FUMT₈ は multi-encoding word-level、 domain 分割); 「NCD 0.498 = Kolmogorov complexity が semantic 捕捉」 と over-claim (誤 = STS-B 特定分布 での 語彙 overlap 効果); 「SBERT 0.828 = Weaver Level B metric 確立」 と 誤解 (誤 = SBERT は 訓練 embedding、 axiomatic metric ではない); n=1 dataset (STS-B) の 結果を general claim に 拡張
  2. Prevention: task-domain 明示 default; 訓練 embedding と axiomatic metric の 別 layer 明示; 複数 dataset (SICK/SNLI/Tatoeba) で 系統的 evaluation が general claim の 前提; 「dominant on X, weak on Y」 の 相補的 pattern を preserve、 win/loss cherry-pick 予防
  3. Recovery: 誤主張 catch 時、 本 STEP + STEP 1839 の task-domain breakdown 表を 引用、 「D-FUMT₈ は cross-lingual/word-level で 勝つ、 within-language sentence で 負ける」 の boundary を hand-off

成果物

Next STEP candidate

参照