混合器ベンチ

機械が文章を読む速度

文脈混合圧縮器 mix5 を、そのままブラウザで走らせています。 左のつまみを回すと予測器の構成が変わり、混合器の重みが揺れ、1バイトあたりのビット数がその場で動きます。

rei-aios / experiments / ransbench
order 1–8 · word · match · rANS
待機中
予測器の構成—
文脈の次数1 2 3 4 6
補助モデル
学習率 shift14
小さいほど大きく動く。実測では 1 MiB で 14、128 KiB で 11 が最良でした。
表サイズ216
再生速度120 B/フレーム
入力—
音off
音量40
効果音の高さは、そのバイトを予測器がどれだけ当てたかに対応します。外すと低く鈍い音になります。
現在の bpb
—
1 バイトあたりのビット数
圧縮後
—B
—
圧縮率
—×
原文 / 圧縮後
gzip 比
—
同じテキストの実測
読み取り中の文章0 / 0
1文字に費やしたビット数(右ほど予測外れ) 8 ビット超=完全な不意打ち
bpb の推移—
実線=いまの構成。破線=order-0 のみ(文脈なし)の対照。点線=同じテキストを gzip にかけた実測値。
混合器の重みどの予測器をどれだけ信じているか
いまの部分バイトに対応する重みセットの中身です。走らせるほど、その文章で当たる予測器の棒が伸びていきます。負の重みは「その予測器の言う逆を取る」ことを意味します。
実測されている値1 MiB コーパス · ラウンドトリップ検証済み
圧縮器bytesbpb比
mix5282,7932.19573.64
mix293,0522.27533.52
bzip2 -9322,1562.50133.20
xz -9e345,3362.68132.98
zstd -19349,3022.71212.95
gzip -9417,7403.24342.47
sse(混合器なし)—3.42032.34
1,030,365 バイトの英文コーパス。sse のみ 262,144 バイトのスライスでの値です。

このページの数値について

上の表は 1 MiB のコーパスを実際に符号化して測った値で、符号化器と復号器を別プロセスで走らせ、SHA-256 でラウンドトリップを確認したものです。

一方このページが表示している bpb は、数 KB のテキストを縮小したモデルで走らせた値なので、表の数値とは一致しません。 表は上限も下限も与えません。ここで比較できるのは設定を変えたときの動きだけで、絶対値ではありません。gzip の線だけは同じテキストをその場で圧縮した実測なので、これは同じ土俵の比較です。

なお、この模型は D-FUMT₈ を使っていません。標準的な文脈混合・match model・APM だけで構成されており、新規性の主張は含みません。