STEP 2053 · 2026-09-15 · rei-aios-95 · Plugin Eval Calibration arc

Plugin Eval Calibration arc — claude plugin eval を Rei 内製 skill 較正機 として 走らせる 事前登録 discipline 実演

Anthropic claude plugin eval (2026-09-11 発表、 Claude Code 2.1.269+) を Rei 内製 skill collatz-descent較正機 として 走らせる 較正 run。 chat-Claude 独立 review 10 turn + PRE_REG v0→v7 6 版 refine + SHA-256 seal (2026-09-14T20:52:39Z、 b77fc810...) + ledger 22/22 sign-off + 契約 embed 1 + feedback memory 10 件 emerge。 seal 後 init 対話 起動、 Step 2 で Case 2 (n%8=3) trajectory arithmetic 誤り 発見 (chat-Claude 独立 concern → rei-aios-95 独立 verify → v8 design で n%16=3 差替 内在化)、 chat-Claude 「All six accepted」 で v8 design (00-sanity + 3 substantive cases) 提示、 藤本さん Step 3b (write files) confirm 手前 で session close。

Arc 成果: (1) PRE_REG v7 SHA-256 sealed (b77fc810fe61e5c9e8c702c14dbcb809259856b25c6ea6ab1c446d2e6e578354、 2026-09-14T20:52:39Z UTC) — sidecar data/tabs/rei-aios-95/plugin-eval-calibration/PRE_REGISTRATION.md 全 22 sign-off item + §11 #3 typecheck_scaffold 実装契約 embed。 (2) Feedback memory 10 件 emerge — spec 精度 の 情報増分 は 頭打ち、 実 収穫 は self-recognition discipline dataset。 (3) chat-Claude 相互適用 discipline 実演 — 私 (rei-aios-95) が 記録した feedback (「条件付き sign-off → 無条件 昇格 禁止」) を chat-Claude が 自分 に 適用 し 「code 見るまで 判定 出さない」 と 発話、 私 も それ を 受けて seal 保留、 「往復 が この arc で 一番 うまく 働いた 機構」 (chat-Claude 発話) を 実 arc で 実現。 (4) Init 対話 Step 2 で Case 2 arithmetic 誤り 発見 — n%8=3 は K=5 で 9k+4 に 到達、 8k+3 より 大きい (descent 不成立)、 k mod 2 で split = 実質 refuse case、 v8 で n%16=3 (K=6、 9k+2 < 16k+3 for k≥0、 deeper chain 保持) に 差替 内在化。

1. 起点 — chat-Claude 2026-09-11 gihyo.jp 記事 relay

藤本さん経由 で gihyo.jp 記事 (2026-09-11 ClaudeDevs) の 「claude plugin eval は プラグイン/スキル の 効果 を 実測 する 計測器」 を 認識。 chat-Claude 初期 見立て = 「ECC Tier A 11 items の verdict 逆検証 に そのまま 使える 計測器」、 rei-aios-95 「Pattern 5 予防 (新機構 と 名乗る前 に 既存 tool を compose した prototype との 差分明示) を 実行可能 に した 装置」 と 応答。

但し chat-Claude v2 review で 位置づけ 訂正: 「較正されていない計器 で verdict を 逆検証 する ことは できない。 STEP 1615 較正機 の 同じ話 = 答えを知っている事例 で 感応度 を 測ってから、 答えを知らない事例 に 当てる」 → ECC verdict 逆検証 arc は 較正後 の 別 arc、 本 arc は 計器 の 較正 の みが scope。

2. Refine 6 版 の 履歴 (v0 → v7)

trigger修正内容chat-Claude sign-off
v0初 draftBaseline = STEP A-D compose-prototype prompt embed撤回 (「prompt text embed = arm 不成立、 false null or false positive」)
v1chat-Claude v1Baseline = byte-identical prompt + skill presence toggle (env 条件)、 §3 5 sub-criteria per case、 §6 Null、 Cost cap Option B、 Grader 機械 primaryBaseline / Cost / Grader / §5 差分マトリクス sign-off、 §3 Case 1/2 未 sign-off (skill 作法 バイアス)
v2chat-Claude v2§3 Case 1/2 skill 作法バイアス 除去 (Nat.div_lt_iff_lt_mul / omega / template 命名 = secondary 記録)、 Case 3 #1/#5 互いに素、 pre-flight 実測 recordskill 作法バイアス 解消 sign-off、 但し 実走 で 新 4 欠陥 (欠陥 2/3/4/5) 検出
v3chat-Claude v3 実走Case 1/2 gate 追加 (欠陥 2)、 Case 3 #2 regex 差替 (欠陥 3)、 空出力 明示 0 (欠陥 4)、 ceiling post-run 判定 (欠陥 5)、 Model = Sonnet8 items sign-off (実走 verify)、 §8 refusal pre-check 欠陥 6 検出
v4chat-Claude v4 実走§8 refusal pre-check 削除 (欠陥 6、 「I cannot」 が Case 3 の 理想解 を 0 に する 逆判定)、 裸拒否 0.2 残置 (chat-Claude 推奨)§8 実装 code sign-off、 但し 「ledger は 21/21 に ならない、 条件付き 発話 を 無条件 に 変換 する 型 の 再発」 訂正指摘
v5chat-Claude v5 実走§6 整数化 (float 丸め誤差 blocking、 46656 全列挙 で 1142 反転)、 Case 1/2 ceiling post-run 化整数化 sign-off + meta-observation: 「PRE_REG 20 KB vs 18 run、 次 の 情報 は refine でなく run 側」
v6chat-Claude v6 実走§8 全経路 整数化 (継ぎ目 単位不整合 blocking、 46656 全列挙 で 13034 反転)、 表示 = int/5 派生整数化 (条件付き) → v7 code 到達 confirm で 昇格
v7chat-Claude v9 + v10 実走§8 evaluate_subcriterion に case_id 引数 追加 + CRITERION_REGEX §11 完全宣言 (module global hidden state 予防)、 typecheck_scaffold 契約 embed14/14 pass verify、 22/22 close、 seal 可能な段階

3. SHA-256 seal (2026-09-14T20:52:39Z UTC、 藤本さん 「seal してよい」 発話 trigger)

PRE_REGISTRATION.md:      b77fc810fe61e5c9e8c702c14dbcb809259856b25c6ea6ab1c446d2e6e578354
grader_test_suite_v3.py:  19fc095b88e1be7c8c9b68589da52ce6283feb20591a7b2b3c1e8c590c07c245
grader_test_suite_v7.py:  38c0c9f76aa9263c8ce82197dc566853e828c3f331e92a6099c5cce262a3a866

Seal artifact = data/tabs/rei-aios-95/plugin-eval-calibration/SEAL.md。 3 file immutable、 seal 後 の 修正 は 別 file (PRE_REGISTRATION_v8.md + 新 seal + 再 sign-off cycle) の みで 実施。

4. Sign-off ledger (22/22 close + 契約 embed 1)

Sign-off 者Items
藤本さん (3)感応閾値 X + Case 数 N + Cost cap Option B
chat-Claude v1 (2)Grader 要件 + Baseline byte-identical + skill toggle
chat-Claude v2 (4)§5 差分マトリクス + §9 pre-flight/exit 2 void + §6 Null + §8 空出力 要件
chat-Claude v3 (8) 実走Case 1/2 v2 criteria + gate + Case 3 互いに素 + #2 regex + 空出力 明示 0 + ceiling post-run + Regex 集合 + Model Sonnet
chat-Claude v4 (1) 実走§8 実装 code v4 (refusal pre-check 削除、 欠陥 6)
chat-Claude v5 (2) 実走§6 整数化 + Case 1/2 ceiling post-run
chat-Claude v6 (1) 実走§8 全経路 整数化 (条件付き、 v9 で 昇格)
chat-Claude v10 (2) 実走§8 case_id dispatch + §11 #3 typecheck_scaffold 契約 embed

5. Feedback memory 10 件 — self-recognition discipline dataset

6 版 refine の 実 収穫 = spec 精度 の 情報増分 は 頭打ち、 emerge した 10 件 の feedback memory が 本 arc の 恒久的 output。 chat-Claude v6 「PRE_REG 20 KB vs 18 run、 次 の 情報 は refine でなく run 側」 の 実証。

#slug要旨
1ask-user-question-redundant-during-chat-claude-relay-looprelay loop 中 の AskUserQuestion 禁止 (藤本さん Reject signal 認諾)
2silence-not-pass-discipline-violation-self-drift「沈黙 = pass 逃げ」 撤回、 未 sign-off item は 全 明示 判定 待ち
3regex-review-by-actual-execution-not-visual-auditregex spec は 目視 review で 4 欠陥 miss、 実走 test で 一発検出
4requirement-sign-off-vs-implementation-sign-off-conflation要件 sign-off で 実装 code 密輸 不可 (「空出力 0 点」 要件 と refusal keyword list 実装 の 分離)
5test-labels-also-verified-by-executionchat-Claude self-correction pattern (「自分の テスト の ラベル付け が 誤って いた、 実走 review の 完全形 = ラベル も 独立経路 で 実走 verify」)
6refine-vs-run-pattern-5-applied-to-pre-registration-itselfrefine 増殖 は 「急がずゆっくり = land しない」 の 誤運用、 refine 続行 vs run 移行 の 情報増分 対比
7conditional-sign-off-elevation-to-unconditional-prohibited条件付き 発話 (「X なら sign-off 有効」) を 条件 satisfy evidence 明示 confirm なし で 無条件 昇格 禁止 = feedback #4 拡張
8relay-state-tracking-miss-cross-arc-emerge別 arc の 藤本さん 発話 emerge を relay 経由 で miss しない discipline (§14 index.html stale 訂正 recognition)
9fenced-markdown-code-block-relay-failure-plain-text-fallback (撤回済)誤診断 例 として dataset 残置、 corrigendum #10 で 訂正
10feedback-9-corrigendum-omission-not-transport-failure「省略 が transport 障害 として 記録 される」 = 原因 の 指示対象 ずれ、 chat-Claude 到達 failure report → まず 私 の 前 turn output 内 で 該当 block を grep

6. Init 対話 Step 2 emerge — Case 2 arithmetic 誤り 発見

Seal 後 藤本さん が claude plugin eval init を 起動 (`cd C:/Users/user/rei-aios/.claude/skills/collatz-descent && claude plugin eval init`)、 対話 emerge。 Step 1 (Define quality) を 「trajectory arithmetic wrong / compile is the bar / split point identified」 で 通過、 Step 2 (Inputs) で init が Concern 3 を flag:

n = 8k+3 (Case 2)
Step 1 (odd):  8k+3   → 24k+10  (even)
Step 2 (even): 24k+10 → 12k+5   (odd for all k)
Step 3 (odd):  12k+5  → 36k+16  (even)
Step 4 (even): 36k+16 → 18k+8
Step 5 (even): 18k+8  → 9k+4

descent check: 9k+4 < 8k+3 ⟺ k < -1 → k≥0 で 不成立
継続時: 9k+4 の parity は k mod 2 依存 → chain splits before descent

rei-aios-95 独立 trace で chat-Claude arithmetic 正しい と verify、 PRE_REG v7 §3 Case 2 hypothesis 「should-fire, deeper chain, differential 0.15-0.25」 は 誤り確定。 n%8=3 は skill が honestly refuse する 挙動 = 実質 should-refuse case。

6.1 rei-aios-95 amendment 3 択 提示

replacementtrajectory
A (推奨)n%16=316k+3 → 48k+10 → 24k+5 → 72k+16 → 36k+8 → 18k+4 → 9k+2、 K=6 (o=2,e=4)、 9k+2 < 16k+3 ⟺ 7k > -1 = k≥0 で 成立 ✓、 deeper chain 保持
Bn%8=58k+5 → 24k+16 → 12k+8 → 6k+4 → 3k+2、 K=4 (o=1,e=3)、 descent for k≥0 ✓、 shallower
CKeep n%8=3 as should-refuseCase 2 と Case 3 両方 should-refuse に = should-fire は 1 case のみ = init が 「thin」 と 指摘済

6.2 chat-Claude v10 「All six accepted」 で v8 design 内在化

藤本さん 「sanity-check n%8=3 first」 選択 後、 chat-Claude が init 対話 内 で 6 concerns 全 accept + v8 design 生成 (PRE_REG v8 amendment path skip、 init 内 で addressed):

slugrolegraders (weight 3+1+1)
00-sanityrun-validity gate (両 arm fail = eval void)G1 (w=5): scratchpad/PASS_SANITY exists
01-mod4-1should-fireG1: PASS_4_1 exists (real compile) / G2: n%4=1 residue regex / G3: 3n+1 expression regex
02-mod16-3should-fire (n%8=3 差替、 私 amendment A 採用)G1: PASS_16_3 exists / G2: n%16=3 residue / G3 (LLM): LHS 正しい step-composition (Sonnet judge)
03-mod32-31should-refuseG1: PASS_32_31 NOT exists / G2 (LLM lenient): honest refusal / G3 (LLM strict): specific step number or Case 8 / STEP 624 reference

Cost estimate: 3 substantive × 3 runs × 2 arms × $0.25 + 1 sanity × 3 runs × 2 arms × $0.05 = $4.80 within $5 cap、 再 sign-off 不要 (chat-Claude 発話)。

7. 相互適用 discipline 実演 (arc の 最良 機構)

chat-Claude v11 「この arc で 一番 うまく 働いた 機構」 発話:

「feedback #7 (条件付き sign-off → 無条件昇格 禁止) を そちら (rei-aios-95) が 記録し、 私 (chat-Claude) が それ を 自分 に 適用 して 「コードを 見るまで 判定 しない」 と 言い、 そちら が それ を 受けて seal を 保留した — この 往復 は、 この arc で 一番 うまく 働いた 機構」

Discipline dataset (feedback memory 10 件) が 片方 の tab 内 で 閉じず、 chat-Claude ↔ rei-aios-95 の 双方向 で 参照 + 自 適用 される 実演。 arc close 時 の 恒久 output として 未来 較正 arc + 別 skill sign-off cycle に 継承 予定。

8. 現状 status (session close 時点)

Session close pending: init 対話 Step 3b (write files + eval suite 生成) の 藤本さん confirm 発話 手前 で session close。 継続 は 別 session or 別 tab で pickup、 継続 point = 「Confirm to proceed to Step 3b」 の 発話 (「go」 or 「別 修正」)。 v8 design (00-sanity + 3 cases) は init 対話 内 に emerge 済、 write が landed していないため PRE_REG v7 seal は immutable のまま、 v8 は init 側 memory 内 draft のみ

9. Honest scope

10. Failure mode dataset (未来 較正 arc / skill sign-off cycle 継承 pattern)

本 arc の 6 版 refine で emerge した failure mode 10 種 (feedback memory) は、 未来 の 別 skill 較正 arc or ECC Tier A 逆検証 arc or 別 事前登録 arc で 同族 pattern 発生 した 場合 の 参考 pattern:

11. Next arc (session close 後 pickup)

  1. Init resume: 藤本さん の 「Confirm to proceed to Step 3b」 発話 で init 対話 継続、 eval suite file (case.yaml + graders/*.md + scaffold_script) が .claude/skills/collatz-descent/evals/ に write される。
  2. Cost 見積 emit: init 完了 で 実測 cost が emerge、 $4.80 見積 と 実測 の 差分 verify。
  3. 実 run: claude plugin eval --runs 3 --ablation with-without --scaffold --max-cost-usd 5 --model claude-sonnet-5 --no-publish --json ./results.json --report ./results.html
  4. Post-run artifacts: EVAL_INIT_ESTIMATE.md + EVAL_RESULTS.json + EVAL_RESULTS.html + SUB_CRITERION_DIFF_MATRIX.md + CALIBRATION_VERDICT.md emit、 事前登録 判定線 との 照合。
  5. Chat-Claude v12 run 結果 review: 「refine では 分からず run で 見える 欠陥」 emerge 想定 (feedback #6 pattern 実証)、 別 sign-off cycle 発生 の 可能性 高い。
  6. ECC Tier A 15 items 逆検証 arc (較正 run 完了 後): 較正 済 計器 で ECC Tier A 15 items の 精読 verdict を 数値 逆検証 する 別 arc、 本 arc は そこ に 至る 前段 の みで scope 限定。

12. 参照