文脈混合圧縮器 mix5 を、そのままブラウザで走らせています。
左のつまみを回すと予測器の構成が変わり、混合器の重みが揺れ、1バイトあたりのビット数がその場で動きます。
| 圧縮器 | bytes | bpb | 比 |
|---|---|---|---|
| mix5 | 282,793 | 2.1957 | 3.64 |
| mix | 293,052 | 2.2753 | 3.52 |
| bzip2 -9 | 322,156 | 2.5013 | 3.20 |
| xz -9e | 345,336 | 2.6813 | 2.98 |
| zstd -19 | 349,302 | 2.7121 | 2.95 |
| gzip -9 | 417,740 | 3.2434 | 2.47 |
| sse(混合器なし) | — | 3.4203 | 2.34 |
上の表は 1 MiB のコーパスを実際に符号化して測った値で、符号化器と復号器を別プロセスで走らせ、SHA-256 でラウンドトリップを確認したものです。
一方このページが表示している bpb は、数 KB のテキストを縮小したモデルで走らせた値なので、表の数値とは一致しません。 表は上限も下限も与えません。ここで比較できるのは設定を変えたときの動きだけで、絶対値ではありません。gzip の線だけは同じテキストをその場で圧縮した実測なので、これは同じ土俵の比較です。
なお、この模型は D-FUMT₈ を使っていません。標準的な文脈混合・match model・APM だけで構成されており、新規性の主張は含みません。