# AKRM Cache-Aware v2 R5 成对 Canary 结果

日期：2026-07-22  
状态：预注册操作性 Canary 通过；科学效能结论未建立

## 1. 执行结论

R5 按冻结顺序完成 `zstd-decoder` × Qwen/DeepSeek × baseline/AKRM 共 4 个真实 API trial。4/4 trial 无执行异常，0 个 invalid job，配对公平性校验通过，2/2 treatment audit 通过，完整 provider usage trace 与哈希链校验无违规。

预注册的八项操作性门禁全部机械通过：两家 provider 的 treatment reward 均不低于 baseline、输入 Token 降幅均超过 50%、最大单次输入均低于 12,000、运行时重试硬上限未触发，且 DeepSeek 的输出、实报费用和全 cache-miss 保守费用均下降。

但是四个 trial 的 Harbor verifier reward 全部为 `0`。因此本轮只能证明受控上下文、完整计量和运行时安全机制在该固定任务上按设计工作，不能证明 AKRM 在保持解题能力的同时提高效率。`0 = 0` 是地板效应，不是能力非劣效证据。

## 2. 四格结果

| Provider | 条件 | Reward | 高层调用 | Provider 响应 | 长度重试 | 输入 Token | 缓存 Token | 输出 Token | 最大单次输入 | Provider 实报费用 USD |
|---|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|
| Qwen | baseline | 0 | 20 | 20 | 0 | 199,527 | 0 | 11,539 | 25,161 | unavailable |
| Qwen | AKRM | 0 | 20 | 20 | 0 | 56,242 | 0 | 2,612 | 3,596 | unavailable |
| DeepSeek | baseline | 0 | 20 | 23 | 3 | 363,827 | 331,008 | 41,486 | 32,676 | 0.051568989 |
| DeepSeek | AKRM | 0 | 20 | 20 | 0 | 65,880 | 50,432 | 12,198 | 4,477 | 0.017514956 |

所有 Token 与费用数字均来自 `provider_usage_trace.jsonl` 聚合，不以会遗漏截断响应的 Harbor trajectory 作为主计量源。Qwen API 未返回完整费用字段，因此 Qwen 只报告冻结价目下的保守估算，不声明供应商实际账单下降。

## 3. 配对变化

| Provider | 输入降幅 | 输出降幅 | 最大单次输入降幅 | 保守费用上界降幅 | 实报费用降幅 |
|---|---:|---:|---:|---:|---:|
| Qwen | 71.8123% | 77.3637% | 85.7080% | 72.8553% | 不可得 |
| DeepSeek | 81.8925% | 70.5973% | 86.2988% | 79.7949% | 66.0359% |

Qwen 的冻结标准价保守上界从 `0.140390286 USD` 降至 `0.038108571 USD`。DeepSeek 的全 cache-miss 保守上界从 `0.194357565 USD` 降至 `0.039270060 USD`；即使 baseline 已获得 331,008 个 cache Token，AKRM 的供应商实报费用仍由 `0.051568989 USD` 降至 `0.017514956 USD`。

四格合计账本成本采用“供应商实报优先、缺失时使用冻结标准价保守上界”的规则，为 `0.412126482 USD`，低于 `10 USD` campaign 上限；剩余上限 `9.587873518 USD`。顶层唯一告警为 Qwen 的 `provider_reported_cost_incomplete`，不是结构、预算或审计违规。

## 4. AKRM 机制审计

| 指标 | Qwen AKRM | DeepSeek AKRM | 冻结上限 |
|---|---:|---:|---:|
| 最大 StatePack Token | 980 | 1,015 | 1,024 |
| 最大工作 atom | 44 | 44 | 64 |
| 最大动态提示 Token | 1,031 | 1,066 | 1,152 |
| 最大 chat message | 9 | 9 | 11 |
| 管理式 epoch reset | 5 | 5 | 机制要求启用 |
| 强制异常 reset | 0 | 0 | 0 |
| 运行时重试硬上限 | 未触发 | 未触发 | 20/trial |

两组 treatment 均保持固定 system anchor、受限 chat history、受限 StatePack/working set、4-turn cache epoch、无 LLM 摘要调用，并在发出下一次 provider 请求前执行共享重试硬上限。DeepSeek baseline 的 3 次长度重试被完整计量；DeepSeek treatment 为 0 次。单次配对不能判断该差异来自机制还是随机波动。

## 5. 预注册门禁判定

| 门禁 | 结果 | 说明 |
|---|---|---|
| 4 个 clean trial、2 个 baseline audit、2 个 treatment audit | 通过 | 4 completed，0 invalid；审计链完整 |
| 两组共享 collector、transport、JSON、输出上限和 retry cap | 通过 | campaign 与审计 manifest 一致 |
| 每个 provider 的 treatment reward 不低于 baseline | 机械通过 | 两组均为 `0 = 0`，不构成效能非劣效 |
| 输入 Token 降幅至少 50% | 通过 | Qwen 71.8123%；DeepSeek 81.8925% |
| treatment 最大单次输入不超过 12,000 | 通过 | Qwen 3,596；DeepSeek 4,477 |
| 长度重试不超过 20 且硬上限未触发 | 通过 | 0、0、3、0；所有审计均 `cap_exceeded=false` |
| DeepSeek 输出、实报费用和保守费用不高于 baseline | 通过 | 三项分别下降 70.5973%、66.0359%、79.7949% |
| Qwen 无完整实报费用时不声明实际账单下降 | 通过 | 仅报告冻结价目估算 |

这里的“通过”只表示 R5 的预注册操作性 canary 条件满足，不等于产品效能、统计显著性或商业 Gate B 通过。

## 6. 这次结果能说明什么

1. **有界工作上下文机制真实生效。** treatment 的 StatePack、工作 atom、动态提示和 chat message 均在冻结上限内，且完整 provider 输入相对 baseline 大幅下降。
2. **节省不只是 Harbor 轨迹漏记。** R5 在 LiteLLM usage 提取点记录每个供应商响应，包含长度截断响应；trace、manifest、账本和 evidence 的计数及哈希链一致。
3. **成本方向在 DeepSeek 上成立。** 在一个固定任务的一次配对中，保守费用与供应商实报费用都下降；Qwen 只能支持估算成本方向。
4. **请求风暴风险被硬限制。** baseline 与 treatment 共用请求前重试 guard，达到 20 次后会在下一次付费请求发出前失败；真实四格未触发该上限，独立 smoke 已验证触发路径不产生 provider record。
5. **当前最主要问题不是 Token，而是任务闭环能力。** 四格均未解决任务。更短输出可能是有效压缩，也可能是更早失败；在出现正 reward 前无法区分。

## 7. 这次结果不能说明什么

- 不能证明能力保持、能力提升或统计非劣效；每个 provider 只有一个任务、一次配对，McNemar 双侧 `p=1.0`。
- 不能把 71.8% 至 81.9% 的输入降幅外推到其他仓库、任务长度、模型或客户事故。
- 不能证明端到端时间或计算复杂度为 `O(1)`；它只证明选定工作集和提示预算有界。
- 不能证明 Proof、Credit、ORR 或 StatePack 各自造成了本轮差异；baseline 与 treatment 是完整代理栈对比，现有消融仍是合成闭世界证据。
- 不能证明 AGI 路径、真实客户事故关闭率、MTTR、回归率、工程师工时、ROI、生产安全或商业 GA。
- 不能排除固定执行顺序、服务端时变、模型随机性、任务选择和 verifier 兼容性等混杂因素。

## 8. 下一阶段实验门槛

在扩大到完整 SWE-Marathon cohort 前，先建立非零能力锚点：冻结一个不依据本轮 treatment 结果挑选的分层小队列，要求 baseline 至少包含可解决任务；每个 provider/条件使用多个独立重复或随机化交错顺序；主终点同时包含 resolved、输入/输出 Token、峰值上下文、实报/保守费用和运行时间。只有当 paired resolved 不下降且置信区间满足预注册非劣界，才把 Token 降幅解释为“能力保持下的效率提升”。

真实商业 Gate B 仍必须使用客户的时间切分历史事故、权威闭环结果、污染控制和独立复核，不能由公开代码 benchmark 替代。

## 9. 冻结工件

| 工件 | 文件 SHA-256 |
|---|---|
| campaign | `08cef37d1c92ab51d9241d01a5d9dc427ce39fbbde0d83631164de1b13206266` |
| pricing | `4ce9727b09855430627fb39f6e74404be14093faa7b4933b5f6bca08d2da8dd1` |
| commands | `37914a8354fb3bcc135eb5bfd5b2800a6533ee18c8035abc9d98d91436c2fd96` |
| final preflight | `3271617d7b9744e347bb99604f8c2c919d39ca8ae4d0a1246925780a4f0909cb` |
| final spend ledger | `e8ae8ea4a9e37dd50d591723d1315c6fe167ab1df8559982d18eb7e2fc138e01` |
| paired evidence | `1719595ea1dc92bff248e9f0cf1081aead668401b95b6efb69fbedf99298362f` |

Campaign content hash 为 `sha256:2b10e08492f8da8ff20722a6f6c0e5864d13aebeebbeca50ac7e2fc104b7859a`；账本 content hash 为 `sha256:8b1230b7b58ce6a224b20fbf5e76fd0476856cae6e786f0a639334ae6066715b`；evidence content hash 为 `sha256:c02b6f8d70c9e06ee3529c4c24fc7e91443f89143c41a5058a17f9dc0b684fa6`。

## 10. 声明边界

R5 的证据等级仍是公开工程基准的操作性 canary。`gate_b_customer_evidence_authorized=false`、`production_or_roi_claim_authorized=false`、独立反作弊复核未完成、官方排行榜提交未验证。不得将本报告表述为 Nature 级确认性实验、AGI 证明、客户价值证明或商业 GA 证书。
