STS-B external gold standard evaluation — SBERT 0.828 vs NCD 0.498 vs D-FUMT₈ Hellinger 0.097 (Pearson r on 1379 pairs)
STEP 1839 arc の 継続 (藤本さん 「A、 その後 B」 明示)。 real gold standard STS-B (Cer et al. 2017、 1379 test pair、 gold similarity 0-5) で SBERT (all-MiniLM-L6-v2 cosine) と NCD (zstd -19) と D-FUMT₈ Hellinger を 系統的比較。 D-FUMT₈ が 英単言語 sentence 類似 で 明確に負けた honest 負の evidence 取得 = STEP 1839 Step 4 の 「D-FUMT₈ は cross-lingual + word-level で 勝つ、 within-language sentence 類似 で 負ける」 予測 の 独立検証。
★ 結論先出し: D-FUMT₈ Hellinger は STS-B で 0.097 Pearson = 弱 ★
これは 予測通り の 負け、 D-FUMT₈ 設計 の refutation では なく domain-specific tool の 正当な boundary 確認。 STS-B は English monolingual sentence similarity で、 D-FUMT₈ の 勝ち domain (cross-lingual + word-level 翻訳検索 = STEP 1839 Task B で NCD の 2× 上) とは 異なる領域。 訓練 embedding (SBERT) が dominate する 期待通り の 領域で、 untrained + language-agnostic + char-stat-based の D-FUMT₈ が 及ばない こと自体は 誠実な boundary。
実験設定
環境 (0 install cost、 既存 discovery)
- Python 3.13.2、 sentence-transformers 5.4.1、 torch 2.11.0+cpu 全て 既 install
- bert_score のみ 未 install、 SBERT cosine で proxy (Reimers-Gurevych 2019 Sentence-BERT approach; STS-B での bert_score と ~同等 の 0.81-0.85 Pearson 帯)
Dataset (STS-B English test set)
- Source: PhilipMay/stsb-multi-mt GitHub mirror (HTTP 200、 4 他 mirror URL は 404)
- 1379 test pair、 各 pair に (sentence1, sentence2, gold similarity 0-5)
- gold similarity は 5 人 crowd-worker の 平均 (Cer et al. 2017 SemEval Task 1)
- Unique sentence 数: 2552
3 metric
| metric | 実装 | 実行時間 |
|---|---|---|
| SBERT cosine (all-MiniLM-L6-v2) | Python subprocess (_sbert_embed.py)、 batch encoding、 HF Hub から model 初回 download (90 MB) | 34.6s |
| NCD (zstd -19) | TypeScript subprocess、 各 pair の cross-compressed size 実測 | ~90s |
| D-FUMT₈ Hellinger | TypeScript pure (src/aios/weaver-level-b/)、 vector cache で 高速 | ~5s |
結果 (n=1379 pair)
| metric | Pearson r | Spearman ρ | ×100 (STS-B official) | 判定 |
|---|---|---|---|---|
| SBERT cosine (MiniLM-L6-v2) | 0.8280 | 0.8214 | 82.80 | 強 baseline (期待通り Reimers-Gurevych 2019 帯) |
| NCD (zstd -19、 negated) | 0.4983 | 0.5014 | 49.83 | 中 (意外に健闘) |
| D-FUMT₈ Hellinger (negated) | 0.0967 | 0.0986 | 9.67 | 弱 (訓練 embedding gap 明確) |
Interpretation (honest 3 層)
1. SBERT が dominant (0.828)
訓練済み sentence embedding は STS-B で 期待通り strong (Reimers-Gurevych 2019 の 0.75-0.85 帯)。 all-MiniLM-L6-v2 は 22M param の 小型 SBERT、 fair baseline として 適正 (mpnet-base 等 大型 model で 更に 高い可能性)。
訓練済み sentence embedding は STS-B で 期待通り strong (Reimers-Gurevych 2019 の 0.75-0.85 帯)。 all-MiniLM-L6-v2 は 22M param の 小型 SBERT、 fair baseline として 適正 (mpnet-base 等 大型 model で 更に 高い可能性)。
2. NCD が意外に健闘 (0.498)
Kolmogorov complexity 系 の byte-level 距離 が sentence 類似 に 中程度 signal を carry。 STS-B の 同義 pair が 語彙 overlap 大 = zstd で 効率的圧縮 = NCD が 小、 non-similar pair は 語彙 overlap 少 = zstd 効率下 = NCD 大、 の 相関を 捕まえた。 単に 「NCD は Level A、 D-FUMT₈ は Level B」 と 単純化できない証拠。
Kolmogorov complexity 系 の byte-level 距離 が sentence 類似 に 中程度 signal を carry。 STS-B の 同義 pair が 語彙 overlap 大 = zstd で 効率的圧縮 = NCD が 小、 non-similar pair は 語彙 overlap 少 = zstd 効率下 = NCD 大、 の 相関を 捕まえた。 単に 「NCD は Level A、 D-FUMT₈ は Level B」 と 単純化できない証拠。
3. D-FUMT₈ Hellinger は 弱 (0.097)
provisional projection は 英単言語 sentence 類似 の operational task では ほぼ 情報 carrying なし。 但し これは 設計 refutation では ない、 D-FUMT₈ の 設計 focus (Unicode-aware script + 8 言語 negation + character-level pattern) が benefit する domain と STS-B の domain の mismatch。
provisional projection は 英単言語 sentence 類似 の operational task では ほぼ 情報 carrying なし。 但し これは 設計 refutation では ない、 D-FUMT₈ の 設計 focus (Unicode-aware script + 8 言語 negation + character-level pattern) が benefit する domain と STS-B の domain の mismatch。
STEP 1839 Step 4 の 予測 との consistency
STEP 1839 で 判明 の task-domain breakdown:| domain | D-FUMT₈ | NCD | 本 STEP との consistency |
|---|---|---|---|
| Word-level translation retrieval (Task B、 25 concept 189 candidate) | MRR=0.117 (勝ち) | MRR=0.081 | STS-B とは 別 domain (word-level cross-lingual) |
| Contradiction detection (Task A、 F1) | 0.440 (勝ち) | 0.126 | 負ention 検出 は BOTH axis 直接、 STS-B とは 別 |
| Cross-topic detection (Task A、 F1) | 0.085 (負け) | 0.796 | STS-B monolingual sentence と 同型 pattern |
| English monolingual sentence similarity (STS-B) | 0.097 Pearson (負け) | 0.498 | ★ 本 STEP、 STEP 1839 Step 4 予測 直接 confirm |
★ 内部 self-consistency + external gold standard 両方で consistent: D-FUMT₈ は 「word-level + cross-encoding」 で 勝ち、 「within-language + sentence-level」 で 負ける、 の boundary が 確立。 これは domain-specific tool として の 正当な positioning、 「universally superior」 主張 は 明確に refute。
Honest scope (7 層 preserve)
- SBERT ≠ 完全 BERTScore: SBERT は whole-sentence cosine similarity、 完全 BERTScore (Zhang et al 2020) は per-token BERT contextual embedding + soft F1 alignment。 STS-B での 差 は 通常 数 point (両者 0.81-0.85 帯)
- STS-B は English monolingual sentence: D-FUMT₈ の 設計 focus (multi-lingual + notation-variant) と mismatch domain、 「負けた」 の 意義 は task-domain-specific
- all-MiniLM-L6-v2 は 小型 SBERT: 22M param、 mpnet-base (110M) 等 大型 model だと 更に 高い可能性、 fair baseline として 適正
- D-FUMT₈ untrained + language-agnostic + char-stat-based: 訓練 gap が 明確、 「trained embedding より 劣る」 は 訓練データ + 教師信号 の 不在 の 直接反映
- STS-B での 敗退 は refutation では ない: 「domain-specific tool」 としての 正当な boundary 確認、 STEP 1839 Task B translation retrieval の win は 独立の evidence
- Single dataset (STS-B): n=1 dataset で general claim は 不可能、 SICK / SNLI / Tatoeba 等 で 系統的評価 が general boundary claim の 前提
- Model auto-download from HF Hub: network dependence あり、 offline reproducibility は 事前 cache 要
Failure mode dataset (未来 Claude 予防)
- What could go wrong: 「D-FUMT₈ Pearson 0.097 = 完全に useless」 と generalize (誤 = STS-B の 特定 domain 負け のみ、 translation retrieval domain では NCD の 2× 上); 「SBERT が universally superior = D-FUMT₈ 開発中止」 (誤 = SBERT は sentence-level English、 D-FUMT₈ は multi-encoding word-level、 domain 分割); 「NCD 0.498 = Kolmogorov complexity が semantic 捕捉」 と over-claim (誤 = STS-B 特定分布 での 語彙 overlap 効果); 「SBERT 0.828 = Weaver Level B metric 確立」 と 誤解 (誤 = SBERT は 訓練 embedding、 axiomatic metric ではない); n=1 dataset (STS-B) の 結果を general claim に 拡張
- Prevention: task-domain 明示 default; 訓練 embedding と axiomatic metric の 別 layer 明示; 複数 dataset (SICK/SNLI/Tatoeba) で 系統的 evaluation が general claim の 前提; 「dominant on X, weak on Y」 の 相補的 pattern を preserve、 win/loss cherry-pick 予防
- Recovery: 誤主張 catch 時、 本 STEP + STEP 1839 の task-domain breakdown 表を 引用、 「D-FUMT₈ は cross-lingual/word-level で 勝つ、 within-language sentence で 負ける」 の boundary を hand-off
成果物
scripts/experiments/weaver-b-stsb-external.ts(270 行) — 3 metric evaluation driverscripts/experiments/_sbert_embed.py(auto-generated) — Python SBERT embedding helperdata/experiments/stsb-2026-09-06/stsb-en-test.csv(1379 pair、 STS-B PhilipMay mirror)data/experiments/stsb-2026-09-06/stsb-results.json(metric summary + 100-pair sample)docs/notepad/2026-09-06T17-23_STEP-1840_stsb-external-gold-evaluation.md- site page (本) + dist-renderer mirror
- memory:
memory/project_step1841_stsb_external_gold_evaluation_2026-09-06.md
Next STEP candidate
- STEP 1841+: 多 dataset extension (Tatoeba word-level parallel + SICK sentence similarity + SNLI entailment) で D-FUMT₈ の 「勝ち domain」 を 独立検証
- STEP 1841+: metric hybrid (SBERT embedding 上に D-FUMT₈ 8 axis re-project、 hybrid metric)
- STEP 1841+: Lean 4 で metric axiom formal 証明 (現状 empirical、 STEP 1839-D candidate)
参照
- 直接前 STEP: STEP 1839 Weaver Level B full arc (Step 4 で translation retrieval win + within-language 負け 予測)
- Reference site: /tools/infinite-dot-theory/ §3 open hypothesis
- STS-B: Cer, Diab, Agirre, Lopez-Gazpio, Specia 2017 SemEval Task 1 (paper) / PhilipMay mirror
- SBERT: Reimers, Gurevych 2019 Sentence-BERT (arXiv) / all-MiniLM-L6-v2 HF
- BERTScore: Zhang, Kishore, Wu, Weinberger, Artzi 2020 (arXiv)