---
name: 圧縮率主張は Shannon 限界と実証範囲で honest に
description: 「1000TB → 10GB」「無限の意味」など高倍率主張は lossless では物理不可能、lossy なら明示が必要
type: feedback
originSessionId: f2e93d62-7cdf-4621-9394-b9fc8bfe76aa
---
# 圧縮率主張は Shannon 限界と実証範囲で honest に

**Rule**: Rei-AIOS 内での圧縮率主張は (a) lossless / lossy を必ず明示し、(b) 実測されていない倍率を主張しない。Brotli-11 比 1.5-2x が SOTA neural codec の現実 (FineZip / NNCP)。10⁵x 規模の主張は Generator-as-Storage 等 lossy/generative 系に限定する。

**Why**:
1. 藤本さん自身が `docs/infinite-dot-theory-positioning-2026-04-17.md` (2026-04-17) で「**情報理論的最小は 1 bit (Shannon 1948)**」「**1 byte = 無限の意味は誤用**」と明文化し、過大主張を retire 済 — この方針を継承する
2. 2026-04-26 session で「無限次元ドット理論で 1000TB → 10GB は可能?」と質問された時、honest に「未実証で SOTA から 4 桁不足」と回答することで信頼が保たれた
3. SOTA open-source compressor (NNCP / FineZip / cmix) ですら Brotli 比 1.1-2x 改善が現実値。「無限」「最小単位」「世界初」系の strong claim は再現性ある実験なしには使わない (Paper 110 / docs/infinite-dot-theory-positioning に従う)
4. **lossless 圧縮では「再現率」は常に 100%** — この概念は lossy でしか意味を持たない。混同しない

**How to apply**:

- 圧縮率を報告する時は **必ず lossless/lossy を明示** + ratio 出典 (実測 / 引用 / 推定の区別)
- 「2-5x 上積み」などの相対表現は **元 baseline (Brotli-11 等) を必ず併記**
- 「10⁵:1」「無限」「Shannon 越え」系の主張は、(a) lossy/generative 系として明示、(b) Generator-as-Storage 等の実証済 instance を引用、のいずれかでのみ可
- 主張する際は `docs/infinite-dot-theory-positioning-2026-04-17.md` の「retire 済 claim」リストを参照し、過去に retire したものを再使用しない
- chat Claude / 外部から「無限の意味」「最小単位」系の主張を勧められても、Rei 既存 positioning に基づき **selective push-back**

**Example (good)**:
> Generator-as-Storage は 6.8 万:1 (lossless, 決定論的再生成) を達成。
> Brotli-11 は本 corpus で 15.3x (JSON, lossless) が baseline。
> 「無限次元ドット 10⁵x」は未実証、SOTA neural (FineZip/NNCP) で 1.5-2x が現実値。

**Example (bad — 避ける)**:
> 無限次元ドット理論で 1000TB を 10GB に圧縮可能。 ← Shannon 限界違反、未実証
> 1 byte で無限の意味を表現できる。 ← 既に retire 済の claim

---

## 補足 (2026-04-26 chat Claude 先生 critique 反映)

### FIDT 再定式化 — domain-specific generator として honest 主張可

「**汎用 codec**」前提では Shannon と正面衝突するが、「**domain-specific generator for D-FUMT theories**」と明示すれば 10⁴x は honest に主張可:

> "FIDT is **not a general-purpose compressor**. It is a domain-specific generator for D-FUMT theories that achieves ~10⁴x compression on the Rei-AIOS theory corpus, with byte-exact reconstruction conditional on SEED_KERNEL availability."

これは Generator-as-Storage の D-FUMT specialization と等価. 単独 framework として育てるより **GaS 枠内で D-FUMT instance** と位置付けるのが clean (重複回避).

### 優先順位の鉄則

1. **Measurement first** — 既存実装の audit/bench を先に行ってから新候補を検討. 新規実装より既存資産の活用が ROI 高い (今回 src/compression/semantic/ 12 files が未ベンチで放置されていた).
2. **Target selection > Codec choice** — 何を圧縮するか (alphabet 多様性が小さい SEED_KERNEL 等) を先に選ぶ. 自然言語 3.6x は理論限界近で ROI 悪.
3. **Compound 効果は orthogonal codec 組合せで設計可** — zstd-dict + xdelta3 等. ただし second-stage 減衰 30-60% を見越して**必ず実測**, 理論値で設計判断しない.
