# AKRM CPU State Mechanism v1 实验结果

## 1. 证据身份

- 实验 ID：`CPU-State-Mechanism-v1`
- 运行 ID：`cpu-state-mechanism-v1-20260722T004824Z-d01500bc`
- 证据等级：`E1` 内部合成机制证据
- GPU：未使用
- 付费 API：0 次
- 模型 token：0
- Project 26 冻结根哈希：`sha256:bab4dfe6a28430c7a8656f4e465c54d6f08fc5f96f7a9ccea762d1ba8cab2f1b`
- 内部锁定协议哈希：`sha256:4e86e3443de3d180858437598cf1d87c5e26cae9892fb708156d83de3f2b9b9c`
- 汇总文件哈希：`sha256:3a1c177aa03d98ef34ba0ae7686e58a2594f91d62f4b2b9b465961c5a4b25849`
- manifest 哈希：`sha256:c2141f59ecd48c1a0424c7f0f7f01f2bf21de495957e2815427c826132e32259`

协议在正式运行前锁定配置、runner 和 Project 26 三方哈希。正式结果包含 300 条规模条件记录，以及 1,750 个配对世界产生的 10,500 条消融记录。

## 2. StatePack 规模曲线

固定条件：

- 候选历史：1K、10K、100K、1M，对应 1x、10x、100x、1000x；
- 每个规模使用 5 个固定 seed；
- StatePack 上限：64 项、4,096 tokens；
- C2 额外取证上限：1,024 tokens，实际取证 token 计入总账；
- 条件：AKRM、dense similarity、recency、random、不可部署的 sufficient-state oracle。

| 规模 | C0 本地/取证后召回 | C2 本地召回 | C2 取证后召回 | C2 平均取证 tokens | C4 本地召回 | 共享全扫描均值 |
|---:|---:|---:|---:|---:|---:|---:|
| 1K | 1.000 / 1.000 | 0.7625 | 1.000 | 243.2 | 0.0625 | 约 8.3 ms |
| 10K | 1.000 / 1.000 | 0.7750 | 1.000 | 230.4 | 0.0125 | 约 86.1 ms |
| 100K | 1.000 / 1.000 | 0.8000 | 1.000 | 204.8 | 0.0000 | 约 997.9 ms |
| 1M | 1.000 / 1.000 | 0.8000 | 1.000 | 204.8 | 0.0000 | 约 9,683.7 ms |

C4 不存在可用取证源，正确行为是拒绝把 StatePack 宣称为充分，而不是追求召回。正式结果中 C4 no-free 检出率为 1.0，C4 对 C0 的真值盲检出 AUROC 为 1.0，错误充分声明为 0。

主要门结果：

| 门 | 观测值 | 阈值 | 结果 |
|---|---:|---:|---|
| C0 最大充分性差距 | 0.000 | <= 0.03 | 通过 |
| C2 取证后最大充分性差距 | 0.000 | <= 0.03 | 通过 |
| C4 no-free 检出率 | 1.000 | >= 0.90 | 通过 |
| no-free AUROC | 1.000 | >= 0.90 | 通过 |
| StatePack 项数弹性 | 0.000 | <= 0.05 | 通过 |
| 1000x 候选/StatePack 比 | 15,625 | >= 100 | 通过 |
| StatePack bounded-finalize p95 | 0.301 ms | <= 500 ms | 通过 |
| 端到端全扫描耗时弹性 | 1.026 | <= 0.05 | **失败** |

因此，本实验支持的是固定预算下的**表示规模有界**和 C0/C2 充分性机制；它明确否定当前 Python 全扫描实现具有端到端常数计算复杂度。要检验端到端近常数访问，需要另行实现并冻结索引检索协议，不能用 64 项固定输出替代该证据。

在 1M 条件下，dense similarity 对 C0 同样达到 1.0，本实验没有证明 AKRM 在 C0 排序上优于该基线。C2 中 dense similarity 本地召回为 0.8，但没有 no-free 取证闭环，闭合率为 0；这只能说明当前夹具中的检测和取证连接有效。

## 3. 四组件配对消融

1,750 个世界由 5 个 seed 和 7 个均衡挑战族组成，每个挑战族 250 个世界。每个世界同时运行完整 AKRM、四个单组件移除条件及 sham 阴性控制。

`no_proof` 的精确定义是同时放开 Proof level 和 ProofScope 授权边界，因此其结果不能解释为纯 Proof level 效应。

| 条件 | 决策准确率 | 假晋升率 | 假拒绝率 | 相对完整 AKRM 的准确率变化（95% bootstrap CI） |
|---|---:|---:|---:|---:|
| full AKRM | 1.0000 | 0.0000 | 0.0000 | 基准 |
| no Proof/ProofScope | 0.7143 | 0.2857 | 0.0000 | -0.2857 [-0.3069, -0.2646] |
| no Credit | 0.8571 | 0.1429 | 0.0000 | -0.1429 [-0.1594, -0.1269] |
| no ORR | 0.8571 | 0.1429 | 0.0000 | -0.1429 [-0.1600, -0.1269] |
| no StatePack | 0.8571 | 0.0000 | 0.1429 | -0.1429 [-0.1594, -0.1274] |
| sham | 1.0000 | 0.0000 | 0.0000 | 0.0000 [0.0000, 0.0000] |

失效定向性：

- no Proof/ProofScope 仅在 `insufficient_proof` 和 `wrong_scope` 族发生假晋升；
- no Credit 仅在 `zero_credit` 族发生假晋升；
- no ORR 仅在 `orr_regression` 族发生假晋升；
- no StatePack 仅在 `statepack_retrieval` 族发生假拒绝；
- compound 阴性族仍被剩余门阻断；
- sham 与完整 AKRM 在全部世界中一致。

完整条件的 target-credit 与密封因果标签 Spearman 为 1.0。由于标签和干预 evaluator 均为同一内部确定性机制的一部分，该值证明实现一致性，不是独立因果校准证据。

## 4. 可证结论

本轮可以据实陈述：

1. 冻结的 Project 26 组件在这些密封机制世界中按设计连接，四类单组件移除产生预注册方向的配对损失。
2. StatePack 输出项数在 1K 到 1M 候选间保持 64，C0 充分性不下降；C2 在显式记录额外取证成本后闭合。
3. C4 阴性控制没有被包装成“无限压缩成功”，系统选择拒绝充分性声明。
4. 当前全扫描检索耗时近似线性，尚无端到端常数复杂度证据。

本轮不能据此陈述：

- AKRM 已在真实代码、事故或 SWE-Marathon 上优于强基线；
- 合成 AUROC、Spearman 或完美准确率可外推到自然分布；
- C2 密封取证源等价于现实检索系统；
- 已获得 E2 独立复核、E3 公共基准、生产 ROI、AGI 或高等级科学验证。

## 5. 复现与产物

从项目根目录执行：

```powershell
python experiments/akrm_cpu_state_v1/run.py --self-test
python experiments/akrm_cpu_state_v1/run.py
```

正式证据目录：

`evidence/agvp_2026/runs/cpu-state-mechanism-v1-20260722T004824Z-d01500bc`

核心文件：

- `summary.json`：严格 Schema 汇总与所有判定门；
- `manifest.json`：环境、命令、哈希、seed 和偏差声明；
- `state_scale_trials.jsonl/.csv`：300 条规模条件记录；
- `component_ablation_trials.jsonl/.csv`：10,500 条配对消融记录；
- `state_scale_curve.png`、`component_ablation.png`：审计图。

已完成的复核：全部产物哈希重算一致；汇总、协议和 manifest Schema 通过；Project 26 根哈希未变化；AGVP court 测试 16/16 通过；锁定 runner 自检通过。
