zizi dcb680e95f docs(agent-loop): batch-002b 补产满分收口——综合 accept 45%→95%, 剥 think 防御实战 7/7 全救
- batch-002b: 10/10=100%(零 kill/零 infra/fix 回炉 3/3/稳定性 100%/flash 抽检 0 分歧),
  金丝雀 9058-9067 全发布, feed=30 款
- 防御实战铁证: M2.7 泄漏当日仍 22.6% 再现(31 调用 7 泄漏), 归一化 7/7 全救——
  对照 batch-002 同病灶击杀 10 条 → 本批零击杀
- 执行器路径实战单: 图书馆排书架 13s succeeded(认领→LLM 12.2s→schema round1→受理)
- 综合口径: batch-002 20 条创意补产后 19/20=95.0%
- C7 作战清单收口; eval 回流 +55 行

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-10 06:53:44 +00:00

2.3 KiB
Raw Blame History

agent-loop v1 批报告 · batch-002b

自动生成§7.5),数据源=本批 JSONL 账本;同时即 prompt-eval.yml 闸②④数据源。

1. 结论速览

accept 率(统一口径) 100.0%accept ÷ (提交创意数 infra 类) = 10 ÷ (10 0)
提交创意数 10
infra 类(不计分母) 0占已处理 0.0%
批起止 2026-06-10T06:28:39.157710+00:00 → 2026-06-10T06:36:13.918602+00:00
模型与通道 MiniMax-M2.7 @ http://100.64.0.8:3000抽检模型deepseek-v4-flash
30 分钟强制收口 未触发

Prompt 版本:{"config.clicker-designer": "1.1.0", "quality.adversary-review": "1.1.1", "fix.design-revise": "1.0.0"}

2. 三层漏斗(对齐 C1 口径,分母=10

通过数 通过率
结构层schema 终态) 10 100.0%
可运行层(五条 AND 10 100.0%
可接受层accept 10 100.0%

归因:主要损耗在文本面(策划/填参kill 0 条)≥ 实玩面0 条):优先修 prompt/模板约束,走四道闸升版。红线:不得以降低裁决口径换达标。

3. kill 原因分布reasons 首项聚合)

(本批无 kill

4. fix 回炉

  • 回炉数3回炉后 accept3回炉成功率100.0%

5. infra_fail 明细(不计分母、可重放)

(本批无 infra_fail

6. 对抗评审稳定性披露Z4

  • 重测条数3一致条数3一致率100.0%

7. 换模型抽检20% 向上取整重裁)

  • 抽检条数2分歧条数0分歧率0.0%;发布冻结:否

8. 成本

  • LLM 调用总数31批总耗时454 秒

9. 金丝雀发布清单≤10/批)

designId(8) gameId versionId 已发布 feed 可见 跳过/失败
4749c61f 9058 93039
064fe1cc 9059 93040
aae37861 9060 93041
b6259c3c 9061 93042
ce83fb25 9062 93043
b0f880d8 9063 93044
8f5156a6 9064 93045
be4fec8c 9065 93046
fcb11f6d 9066 93047
c825e03c 9067 93048