折账批次1(A/B/C/D 四组并行)+ 批次2(注册表/_index/降留痕)+ 批次3(docs-gate 七检绿+旧口径 grep 清零)。 Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
29 KiB
date, topic, status, sot-impact, 上级, 关联, 图清单
| date | topic | status | sot-impact | 上级 | 关联 | 图清单 | |||
|---|---|---|---|---|---|---|---|---|---|
| 2026-07-02 | 游戏质量与爆火能力 | 已批准(创始人 2026-07-02 决策包⑦,档内草案值生效)→ 已折账收口(2026-07-02):生效内容折入 canonical《游戏质量与爆火能力》,本档降设计留痕 | 新建 topic「游戏质量与爆火能力」(收口后落 docs/architecture/架构/生成引擎/ 并登记注册表);修订触点 = 生成验收门(§2.4 消费口径历史化、D11 权重管辖移交)、「收窄 A–E」既有引用面(验收门 §2.4 本体及其失真蒸馏指针〔saa-graph-orchestration skill 2026-07-01 已重写、无该节〕、OpenGame对照 §3.5;_recall 判定录只读留痕不改)、数据飞轮(留存口径需求)、.agents/skills/sim-business-game-design.md(§10 可机检注记按本档 §3.3 第 5 条改口)、2026-06-29 设计 §7(品类 rubric 上位标准由本档给出);不改契约(contracts/)与九门 harness 代码 | docs/plans/2026-06-25-生成引擎统一执行计划-AgentScope三档-plan.md | cheap-worker/cheap_verify.py · cheap-worker/bake_off.py · tier2/gen-worker/worker/run.py · tier2/harness/play-phaser.cdp.cjs · game-runtime/games/_wg1-gen/_shared/play.cdp.cjs · contracts/README.md(双量纲红线)@ 1662eb0d |
|
游戏质量与爆火能力 · 设计(四层质量模型)
已折账(2026-07-02):本档为设计留痕(过程、评审史、拍点记录);生效口径以 canonical 游戏质量与爆火能力 为准(四层模型/裁定/rubric 规范/档位生效值)。
0 一图看懂
flowchart BT
L1["L1 机制可玩 — 能玩、玩得通<br/>机器真玩(九门 + 富游戏三门 + 首局门)· 布尔 · 质量分层内唯一拒发权"]
L2["L2 内容丰富 — 有料、耐玩<br/>LLM 按品类 rubric 评分 · 分组小计 · 非阻塞"]
L3["L3 留存结构 — 想再玩的结构前提<br/>设计侧 rubric 留存组 + 上线后完玩率/次留真数据"]
L4["L4 传播钩子 — 想让别人看的结构前提<br/>设计侧 rubric 传播组 + 上线后 share/remix 漏斗"]
L1 --> L2 --> L3 --> L4
L4 -.->|"玩家真数据回流:校准 rubric / D11 权重 / 档位线"| L2
核心思想:质量不是一个分,是四层递进的塔——机器门保「能玩」(L1,质量分层内唯一拒发权),LLM 评「有料」(L2),结构要求保「想再玩」(L3)与「想传出去」(L4)的前提;玩家真实数据是 L3/L4 的最终裁判,并回流校准 L2–L4 评分与 D11 权重。 边界:本档只立标准、判定归属与数值档位;不改九门判据本身,不建回流管道,不造任何自动「爆火门」。 怎么算成功:双评审通过、创始人拍定分层与档位数值(决策包⑦)后,W-GENRE 品类件能直接照 §3.3 产 rubric,tier2 F-1 能直接照 §3.7 补反馈,数据飞轮能照 §3.4 立留存口径。
1 意图与目标
命题来自创始人两条既有裁定:「轻量≠简单——便宜档是低成本生成相对不复杂、又不易同质化的高质小游戏,不是产没人会玩的简单玩具」(agentic运行时架构图说 §4.1);「便宜 = LLM 低参与度,不是游戏低质量,游戏底线 = 2D 丰富游戏(进货/解锁/成长/音乐/丰富玩法)」(2026-06-29 设计 §6 创始人纠正)。这不只是生成线的事:feed 分发的游戏若普遍单薄,推荐、广告、remix 同款这三条变现与增长线全部失去弹药——爆火能力是平台命题。
现状有三个缺口,都有实证:
第一,「过九门 ≠ 好玩」已被现网数据坐实。M1 达标 bake-off 三品类 15/15 全过九门,但丰富度评分(满分 8)均分只有 whack-mole 2.4、click-score 3.4、shop-serve 4.2——机器门保「能玩、玩得通」,对「有料、耐玩」不设防,也不该设防(判「有料」超出确定性信号的能力边界)。缺的不是把九门加严,是九门之上的分层标准。
第二,质量概念散落、无上位标准。D11 就绪评分的权重自标「占位值,待质量轨用真实数据校准」;丰富度 8 条清单已实装但只观测;GP12 王蓝莓黄金标尺、GP2 首局 30 秒、「完玩率 + 次日留存」散在产品域各处;W-GENRE 品类件的 rubric 明文等本档定稿,先批产会返工。
第三,平衡门判法悬而未裁(runbook F-4)。tier2 收敛环 conditional 的直接失败面是「赢的条件/经济平衡」,而判平衡这件事现在一静一动双写(静态数值可达检查 advisory,真玩经济门 enforced),该谁说了算、失败后反馈里该有什么,n=5 runbook 明文挂到本档一并裁定。
目标四条,均可验收:G1 四层定义 + 判定归属 + 量纲纪律收进一处 SoT;G2 丰富度预算档位表(数值草案)交创始人拍;G3 F-4 判法裁定直接可执行(F-1 反馈契约有判据、验收门口径漂移有裁决);G4 下游三线(W-GENRE 品类批产 / tier2 F-1 / 数据飞轮回流)从本档直接开工,不再各自发明标准。
2 边界
| 做 | 不做 |
|---|---|
| 四层质量模型的定义、判定归属、权力分配 | 重定义九门/富三门/首局门的具体判据(SoT = 验收门,本档只裁消费口径) |
| 丰富度预算档位表(数值草案待拍) | 建留存/传播数据的采集管道(归 telemetry 线与数据飞轮回流环设计) |
| 平衡门判法裁定(F-4)与反馈契约 | 替 agent 调平衡数值(工具层不代调,创始人 2026-06-29 裁定) |
| rubric 体系规范(W-GENRE ④ 的上位标准) | 写出每个品类的完整 rubric(归 W-GENRE 各品类件) |
| 分数量纲纪律与防 Goodhart 红线 | 造统一「质量总分/爆火分」或任何自动爆火门 |
| D11 就绪分权重的管辖权接管 | 改开闸六门(D12/GP9/9d/D11/D9/首局)的治理设计 |
3 方案
3.1 四层总览与权力分配
| 层 | 回答 | 判定者 | 量纲 | 权力 | 消费者 |
|---|---|---|---|---|---|
| L1 机制可玩 | 能玩、玩得通吗 | 机器真玩(九门 + 富游戏三门 + 首局门),零 LLM | 布尔(过/不过) | 质量分层内唯一拒发权 | 生成环放行、生产复验 |
| L2 内容丰富 | 有料、耐玩吗 | LLM 验证 agent 按品类 rubric,非阻塞 | 逐条 0/1 + 分组小计 | 观测 + 批次验收线,不拦单款 | 品类件验收、批次观测、回流分析 |
| L3 留存结构 | 想再玩的结构前提在吗 | 生成时 rubric 留存组;上线后玩家真数据 | rubric 分;运营 0–100 | 观测;真数据经 quality_score 影响分发 | feed 排序、数据飞轮 |
| L4 传播钩子 | 想让别人看的结构前提在吗 | 生成时 rubric 传播组;上线后 share/remix 漏斗 | rubric 分;漏斗率 | 观测;爆款筛选归运营 | remix 网络效应、爆款签约(P-IPX-06) |
层间纪律三条。质量侧的发布权只在 L1:一款游戏能不能进 feed,质量分层内由确定性证据说了算,L2–L4 任何分数都不拦发布——这是既有防 Goodhart 红线(效果层「绝不放行也绝不拒发」)在整个模型上的推广;发布链上另有治理拒发权(GP9 合规、D12 控制平面),在本模型之外、不受本档约束。推荐权在真数据:玩家行为聚合成运营质量分(0–100)回灌 feed 决定「值不值得推」;生成侧 rubric 分只影响批次改进与回流分析,不直接改 feed 排序。「好玩」的终审归人:审核台人工终审保留,自动分只辅助排序与抽样。另一条贯穿 L3/L4 的诚实边界:设计侧 rubric 只测「结构存在性」(钩子在不在),它与真实留存/传播效果的相关性要到放量后校准(§4 D5)才被验证,验证前 L3/L4 分不得当作效果预测使用。
一处必须消歧:仓内有两套「门」。真玩九门(A_boot…I_control,harness 真玩判)是验收面;开闸六门(D12 控制平面/GP9 合规/9d trace/D11 就绪分/D9 反同质化/首局体验)是放量治理面。本模型的 L1 指前者加富游戏三门与首局门;开闸六门不属质量分层,其中与质量相关的观测件 D11 就绪分,权重管辖自本档定稿起归质量轨(§3.8)。
3.2 L1 机制可玩:引用 + 两条口径裁定
L1 的判据本体在验收门 SoT,本档不重抄:九门 = 客观健康门 A_boot/B_uncaught/C_frame/D_render/E_live + driver 依赖门 F_wiring/G_input/H_progress/I_control,真玩驱动、CDP 探针、零 LLM;富游戏三门 = tier2 多系统档专属(三联动/经济/latch);首局门 = H 门的 additive 派生超集(可玩 ≤2s/首反馈即时/60s 品类闭环),FAIL 不推翻 H。L1 的现状:便宜档 M1 三品类 15/15 达标;tier2 conditional,卡在经济门与 H_progress(§3.7 处理)。
裁定 L1-a(消费口径校正):验收门 §2.4 记有「生成环消费从九门全过收窄成只认 A–E,G/H/I 降参考,F_wiring 改 VLM 判」——那是 gamedef 时代 driver 缺失、G/H/I 不可靠时的消费策略。现行便宜档在门跑前自动生成 play-spec 使 driven=true、九门全部致命,cheap 与 tier2 的判据代码都认九门全量与富门(M1 达标 15/15 正是这个口径)。裁定:driven 时九门全量 AND 为现行 L1 口径;undriven 时 E_live/H_progress 自动降 advisory 的分级保留在 harness(已实装);「收窄 A–E」条款收口时在验收门 SoT 标注历史化,消除文档-代码漂移。F_wiring 保持机器硬门;VLM 视觉判定归 L3 视觉软检,永远软。
裁定 L1-b(富三门的档位适用):富游戏三门只随「多系统富游戏」档位走(现为 tier2 经营类)。便宜档经营品类的进度判定 = occupied 反应族驱动 + score 递增断言,不引入 tier2 经济平衡门(盈利/破产双路判)——单循环游戏没有「经济死局」问题,把它强推到便宜档是给 L1 加不属于该档位的判据。这里要分清「门」与「断言」两个层次:play-spec 里经 H 门校验的 per-game 真玩断言(score 递增,以及游戏含消费扣减时的 currency 扣减断言)是便宜档 L1 的正当判据,照常使用;本裁定挡的是门级判据跨档,不是禁用某类断言(断言与 rubric 的分界见 §3.3 第 5 条)。两档判据差异是档位事实,不是待统一的债。
3.3 L2 内容丰富:rubric 体系(W-GENRE ④ 的上位标准)
丰富有一条结构底线,便宜档也必须有(创始人「2D 丰富游戏」裁定的工程化):成长轴(数值或等级)、解锁阶梯(≥3 级,任意时刻可见下一个)、收集/装饰或等价第二动机、音反馈。这四件是生成 agent 在设计阶段的交付物(品类设计 skill 的职责),不是九门判据——丰富的「生成」归生成 agent,丰富的「校验」归 LLM 验证 agent,两边都不落项目代码。
计分制先立住:每条 rubric 记 0/1(成立/不成立),逐条给一句理由;条目按层标注(L2/L3/L4),一次 LLM 评分同时产出三个分组小计(L2 丰富小计 / L3 留存结构小计 / L4 传播结构小计),不另起三套评分,也不设单一总分——单一总分好看会诱导 Goodhart,分组小计才对得上三层各自的消费点。通用底座与品类扩展分母分开,不混合平均。每条 rubric 的最小形状 = 编号 / 层标 / 一句可判定的判据 / 一对正反例;品类件照这个形状产条目,评分 agent 照它出「逐条判定 + 理由 + 三组小计」。
规范六条,W-GENRE 品类件照此产:
- 通用底座 v2 = 11 条:现行 8 条(即时反馈/可见成长/下一个解锁/30 秒爽点/数值滚雪球/情感锚/放置回归/音反馈,已实装为便宜档丰富度验证 agent 的评分尺,与 sim-business skill §10 同源)+ 新增 3 条(L3「首 3 分钟脚本成立:0–10s 零阅读上手 / 10–60s 首次升级 / 1–3min 露出 2–3 个后续锁」、L4「有炫耀时刻:可截图分享的结算/成就画面」、L4「有同款钩子:品类原型 + 主题标签元数据可供 remix 预填」)。分组归属:L2 = 即时反馈/可见成长/30 秒爽点/数值滚雪球/情感锚/音反馈共 6 条;L3 = 下一个解锁/放置回归/首 3 分钟脚本共 3 条;L4 = 炫耀时刻/同款钩子共 2 条。新增 3 条为草案,随首个品类件落地验证后并入现网评分尺。
- 品类扩展 ≥4 条:每品类另加品类特有维度(经营范例:进货补货循环成立/客流节奏有紧张感/双货币分工明确/卡点「差一点」不卡死;其余品类由各品类件提出),同一字段形状、同样标层,分母独立小计。
- 锚定纪律:每品类 ≥1 金标正例 + ≥1 薄反例;rubric 文本或评分 prompt 变更必须金标复验,单款分组小计漂移超 ±1 即回退。LLM 裁判的漂移用确定性锚点治,不用另一个 LLM 治。
- 判定形态:纯 LLM、非阻塞、逐条给理由;绝不写成代码校验、不进九门、不进脚手架(创始人红线)。
- 与 L1 断言的分界(裁定):sim-business skill §10 标注的「4 条可机检」不同质,分两类处置。纯 code-presence 类(即时反馈/下一个解锁/音反馈——代码里存在调用 ≠ 体验成立)按红线软化为 LLM 评分维度,不落项目代码;经 H 门 assertAfterPlay 校验的 per-game 真玩断言(可见成长的 score/资源递增断言、经营的 currency 扣减断言)属 L1 机制可玩,保留为硬断言、不软化——把真玩硬证据降成软评分会削 L1 的拒发权,方向恰好反了。同名两物并存且分工明确:L1 断言判「机制上真发生」,L2 rubric 判「体验上成立、有层次」。skill §10 注记收口时照此改口。
- 消费点:分组小计消费于品类件验收与批次观测(档位观测线,§3.6)和回流分析(§4 D5);逐条理由消费于品类件迭代——哪条维度长期不成立,就是品类设计 skill 或脚手架的改进信号。
3.4 L3 留存结构
设计侧三要素,进品类设计 skill 与 rubric、生成时交付:目标梯度(任意时刻「下一个目标」可见:解锁阶梯、任务清单)、难度节奏(爽点与平台期交替;成长曲线 ×1.15/级为默认锚;卡点造「差一点」的张力、不卡死)、回归钩子(每日首登奖励、离线收益、限时目标,便宜档至少一种)。首 3 分钟脚本是三要素在开局的浓缩,rubric v2 单列一条。
真判在上线后,MVP 口径立到可建字段的程度:D1 留存 = 同一 game_id 下、同一稳定玩家标识(登录取 userId,未登录取匿名设备标识)在首玩自然日(平台时区)之后的第 1 个自然日内发生 ≥1 次开局事件,按「玩家 × 游戏 × 日」去重;完玩率 = play_end 事件中 completed 占比。现状缺口:遥测聚合表没有次留字段(数据飞轮已挂账),字段或旁路的落地设计归数据飞轮回流环设计与 telemetry 线;字段落地前,用「完玩率 + 互动率(点赞收藏 ÷ 播放)」作代理。运营质量分(0–100)回灌 feed 的既有机制不动,本档不碰其算法。
顺带对齐三个「首 X 时间」口径,免得下游各按各的:GP2「玩家首局 30 秒体验」是产品域体验命题,本档不收编;首局门三断言(可玩 ≤2s / 首反馈即时 / 60s 品类闭环)是它在 L1 的机器可判子集;rubric「首 3 分钟脚本」是它在设计侧的结构化前奏。三者消费场景不同,时间锚不强行统一;体验效果的真判(如前 30 秒流失率)留给放量后校准。
3.5 L4 传播钩子
三件结构要求,生成时交付:炫耀时刻(结算/成就画面可截图、可分享——要求游戏必须有结算展示场景,不是打完就黑屏)、分享点位(结算处一键分享,自愿不打断,与广告点位同一条体验原则)、同款可复刻(游戏页 remix 入口可用 = GP10「爆款做同款」网络效应的供给侧前提;生成侧交付品类原型与主题标签元数据,供 remix 预填)。
真判 = share 事件与 remix_click/remix_submit 漏斗。本档不改契约:share 是 telemetry 既有事件,remix 漏斗按数据飞轮已规划的增量契约落地;品类件或产品面若需新增事件,走契约变更流程(护城河与跨端契约终审)。红线:传播钩子是结构要求(有没有),不是效果承诺(火不火)。本模型保证「具备被传播的结构」;爆款是概率事件,筛选与签约(P-IPX-06)归运营,不做自动「爆火分」。
3.6 丰富度预算档位(数值草案 · 决策包⑦ 待拍)
| 档位 | 成本红线(已拍,创始人 2026-06-25) | 实测基线 | 丰富结构下限 | rubric 观测线(草案) |
|---|---|---|---|---|
| 便宜档(AI 低参与) | per-gen < ¥10(图/音另线) | ¥0.25–0.9/款 | 底线四件(成长轴/解锁阶梯 ≥3 级/第二动机/音反馈)+ 1 主循环 ≤2 主机制 + 首 3 分钟脚本;四件为默认底线,品类件须逐条确认可映射,映射不动的申报品类替代轴 | 品类小批(n=3–5):L2 组均分 ≥60% 组满分(区间 55–65% 待锁)且无恒 0 条目;L3 组 ≥2/3 成立;L4 组 ≥1/2 成立 |
| tier2(AI 深参与) | per-gen < ¥50,目标 ≤¥3/成功款 | ¥1.29/款 | 档位通用项:≥3 个耦合子系统 + 阶段目标长线;品类结构项(现行经营件 = 资源/合成/订单三系统、双终态真可达即富三门)由品类件承载,扩品类时由对应品类件重定义 | 品类 rubric(通用 + 品类扩展,两分母)均分 ≥70% 满分(区间 65–75% 待锁),品类扩展组无恒 0 条目 |
消费点三条,防误用。其一,档位线消费于品类资产验收(W-GENRE 各件 n=3–5 小批)与批次观测,不消费于单款放行——单款放行只看 L1。其二,观测线是拉升目标,不是现状描述:现网 8 条无分组口径下 shop-serve 4.2/8、click-score 3.4/8、whack-mole 2.4/8,全部低于线;线的意义是品类件(设计 skill + few-shot 到位后)必须把分布抬上来,区间值由首批品类件回填分布后锁成单值。品类件对观测线或结构下限的品类适配走申报机制:附理由申报、创始人批;反应类等天然薄品类须同时给出替代丰富轴(连击深度、模式变体等),纯叙事/非遗类可申报以章节推进、工艺步骤解锁等替代成长轴——不许裸降。其三,预算余量优先买丰富、不买省钱:软脚手架数据点显示,富化把单款成本从约 ¥0.7 抬到 ¥0.85(+21%),行数 892≈890 持平——多花的钱买到的是 combo/VIP 这类玩法富化,不是代码量;绝对值距 ¥10 红线余量巨大,这笔钱该花。reskin 锁循环省成本的路线已被创始人否为越线,不回潮。
3.7 平衡门判法裁定(F-4)
背景:tier2 收敛环 conditional 的失败集中在「盈利路赢不了」(经济门 profitPathWin 子检查)与「进度不成立」(H_progress),而判「平衡」这件事现在双写——静态 economyConsistent 从已落盘数据表算「数值可达」(开局金币 + 订单奖励之和 ≥ 赢线,advisory),真玩经济门把游戏真玩到 coins ≥ 阈值且 phase 为 win 且到终态(enforced)。runbook 提问:玩法平衡该静态判,还是交真玩 + agent 自评?
flowchart LR
A["agent 写玩法数值/数据表"] --> S["静态自检 economyConsistent<br/>毫秒级 · advisory · 自检工具"]
S -->|"数值差额即时提示"| A
A --> P["真玩动态门(权威)<br/>经济门 win/lose 双路 + H_progress"]
P -->|"失败:数值证据反馈(F-1)<br/>实测值 vs 期望值 + 为什么"| A
P -->|"全绿"| OK["L1 放行"]
裁定五条:
- 平衡判定的权威 = 真玩动态门,不回退静态判。 静态「数值可达」证明不了「真玩得到」——顾客耐心、时序、操作节奏只在真玩里存在;n=5 实测的失败全部发生在静态检查之后的真玩层。真玩是生成验收阶段的权威硬证据(§3.8 双硬证据口径的生成侧一半),这条与防 Goodhart 红线同源。
- 静态判据定位 = agent 自检工具 + 反馈素材,保持 advisory,不升门。 它确定性可算、毫秒级,适合 agent 写完数值后即时自查(省一轮约十分钟的真玩往返),也适合折进失败反馈;但永远不是放行判据。静态与真玩结论组合是诊断信号,处置固定:真玩过、静态挂 → 放行,静态差额记 warning 进观测(复核静态判据模型);真玩挂、静态过 → 失败,反馈以真玩数值为主并注明「静态认为数值可达」——问题大概率在耐心/时序/操作节奏,不在数值总量;双挂 → 失败,两组证据并喂;真玩无有效观测(探针读不到 state、驱动不到终态)→ 走 harness/driver 故障路径(E/H 门失败处理),绝不以静态判替代放行。
- 反馈契约(F-1 的判据):平衡门失败必须喂回数值证据,不只喂门名。 现状 tier2 富游戏门反馈只给失败子检查名(如 profitPathWin),把 harness 已算出的具体数值(coins 终值 vs 赢线、phase、是否到终态)丢弃;便宜档九门反馈反而带 before/after/why 细节。裁定:tier2 富三门反馈对齐便宜档厚度——每个失败子检查给「实测值 vs 期望值 + 一句为什么」,静态 economyConsistent 的差额一并折进。这是 conditional 的解法(agent 层)在判法侧的落点。
- 平衡的「调」永远是 agent 的玩法职责,工具层不代调。 不做数值模板、不补平衡骨架(创始人 2026-06-29 裁定);工具层的全部义务 = 把「为什么不平衡」讲清(第 3 条)。判法不变、反馈变厚。注意两级验收别混:F-1 的「自修通过 ≥2 例」证的是反馈契约生效;tier2 的 go/no-go 仍以 F-2 干净复跑与收敛环判定为准,前者不替代后者。
- 赢线双源分工,agent 只调自己那一半。 「赢」有两个数:游戏内赢条件(agent 数据表里的目标值)是玩法设计职责,agent 可调;验收外生赢线(品类金标 play-spec 里的门槛)是验收基准,由品类件与档位表锚定,agent 不可调、也不该看着它反向凑数。真玩经济门要求两者同时成立(真玩到游戏内赢态、且量级过验收线),因此 F-1 反馈必须同时暴露三个数——实测终值、游戏内赢线、验收外生线;agent 若把游戏内赢线设得低于验收地板,反馈应直接指出这个结构性错配,而不是让它对着改不动的阈值空转。
3.8 分数量纲与防 Goodhart 纪律
flowchart LR
R["rubric 分 0–N<br/>生成侧局部量纲"] --> C1["品类件验收 · 批次观测 · 回流分析"]
G["生成质量分 0–1<br/>aigc 域"] --> C2["生成域内部"]
Q["运营质量分 0–100<br/>telemetry→feed"] --> C3["feed 排序"]
D["D11 就绪分 0–100<br/>治理观测件"] --> C4["开闸治理看板"]
R -.禁止换算互灌.- G
G -.禁止换算互灌.- Q
量纲纪律:既有双量纲锁死不动——生成质量分(0–1,aigc)与运营质量分(0–100,telemetry→feed)不可互相回灌(契约红线);rubric 分(0–N)是生成侧局部量纲,只在品类验收、批次观测、回流分析消费,禁止换算回灌进前两者;不新造统一「质量总分/爆火分」。D11 就绪分(0–100,开闸治理观测件)的权重(playability 0.5 / firstPlay 0.25 / stability 0.15 / efficiency 0.1)自本档起归质量轨管辖:放量前的起步值仍由 cutover plan 落定(其部署步已在修 efficiency 维 BUDGET_RMB 与便宜档实际成本的错配,该项列为质量轨接管后的首个复核件);放量后第一轮校准见 §4 D5。
防 Goodhart 三条,贯穿全模型:L2–L4 分数一律非阻塞(任何丰富/留存/传播分都不得升为拒发门,升门动议须回本档改 SoT 并过创始人);真玩与真实玩家数据是仅有的两种「硬」证据(设计侧一切 LLM 评分都是软信号);好玩的终审归人(审核台)。
4 步骤计划
| 步 | 交付物 | 验证 | 依赖 |
|---|---|---|---|
| D1 本档双评审 → 文内修 → 创始人拍决策包⑦ | 定稿 SoT | 双评审无 BLOCKER;拍点清单(§5)拍定 | — |
D2 收口折账(opus 小工单):本档落 docs/architecture/架构/生成引擎/ 并登记注册表;验收门 §2.4 历史化注记 + D11 权重管辖注记;「收窄 A–E」引用面处置:验收门 §2.4 历史化注记须同时修正其指向 saa-graph-orchestration skill §3.5 的失真蒸馏指针(该 skill 2026-07-01 已重写、无此节),OpenGame对照 §3.5 加现行口径注(现行 cheap/tier2 消费九门全量,该 Phase 路线属 SAA 线远期参考),_recall 判定录只读留痕不动;数据飞轮挂留存口径需求;sim-business skill §10 注记按 §3.3 第 5 条改口;06-29 设计 §7 标注解锁;SVG 门面图按 atlas 补 |
各 SoT 一次小改 + 新 canonical 落位 | docs-gate 七检绿;全仓 grep「收窄 A–E」旧口径引用面清零 | D1 |
| D3 W-GENRE 四品类批产(rubric 照 §3.3 规范,验收含 §3.6 档位观测线) | 品类四件套 ×4 | 06-29 §7 验收 + 小批均分达线 | D1 |
| D4 tier2 F-1 按 §3.7 反馈契约执行 | 富三门反馈补厚 | runbook F-1 验收门(自修通过 ≥2 例 + 金标仍 ACCEPT) | D1 裁定即可动,不必等档位数值拍定 |
| D5 放量后第一轮校准(owner = 质量轨:回流环设计产校准单、opus 执行;输入 = 放量后足量样本〔起步 ≥100 款〕的 rubric 分组小计 × 留存真数据,含 efficiency 维错配复核) | 校准报告 + 档位线/D11 权重修订提案 | 相关性方向为正;样本不足或回归不显著则维持占位值再观测一期;权重变更整体可回退上一版(D11 只观测不拦,回退零风险) | 放量 + 数据飞轮回流环设计(fable 轨2②) |
5 验证方式
文档门:Codex + Opus 双评审通过(Codex 挂则 Opus 单评);创始人拍决策包⑦。拍点清单 = ①四层定义与权力分配(§3.1)②档位表(§3.6:观测线区间 + 结构下限 + 首批回填锁值机制)③rubric 计分制与通用底座 v2 新增 3 条(§3.3)④平衡门判法五条裁定(§3.7)⑤「收窄 A–E」历史化(§3.2 裁定 L1-a)⑥富三门档位适用与断言分界(§3.2 裁定 L1-b + §3.3 第 5 条)⑦D11 权重管辖移交与校准机制(§3.8 + §4 D5)。
可用性断言,评审时逐条对:①照 §3.3 规范能为「剧情」品类直接列出 rubric 骨架而不缺维;②§3.7 能直接回答 F-1 工单「反馈里该有什么」;③§3.6 档位线判现网 M1 数据的结论符合直觉(shop 逼近线、whack 显著偏薄)。
数据门(后置):D5 校准报告能算出 rubric 分与留存真数据的相关性方向;算不出或为负,回 §6 风险处置。
6 风险与回滚
rubric 被 Goodhart 或 LLM 评分漂移:非阻塞设计把错杀面封为零(评分再错也不拦游戏);金标锚定 ±1 回退管住漂移;放量后真数据校准(D5)是最终纠偏——若 rubric 分与留存相关性为零或负,重审 rubric 维度,回滚面只在 rubric 文本与评分 prompt,不伤门与代码。
档位线拍高挡住品类批产:调线申报机制(§3.6)有界放行;线只影响品类件验收与批次观测、不拦单款,最坏情形是某品类件多一轮申报,不阻塞主线。
留存字段缺口拖 L3 真判:完玩率 + 互动率代理先行,次留字段归数据飞轮线;本档下游(W-GENRE/F-1)不依赖它。
「收窄 A–E」历史化的引用面遗漏:已核实的引用面 = 验收门 §2.4 本体(含指向已重写 skill 的失真蒸馏指针)与 OpenGame对照 §3.5(以收窄为起跑线的 SAA 线 Phase 路线),D2 逐一改注;_recall 判定录只读留痕不改;再全仓 grep 兜底扫尾,若发现新消费方,改该处引用而非改本裁定。
LLM 验证 agent 成本与可用性:每款一次评分调用,成本占比可忽略(便宜档 <¥0.1 量级);评分服务不可用时跳过不阻塞(非阻塞语义自带降级)。
附 图清单与状态
图1 四层质量塔(§0)、图2 平衡门判法与反馈环(§3.7)、图3 分数量纲与消费面(§3.8),均 mermaid 内联为事实源;SVG 门面图收口时按 architecture-diagram-atlas house style 补(D2),无需 HTML 增强页。
状态:2026-07-02 草稿,fable 主笔(轨2①)→ 同日过 Codex + Opus 双评审并文内修复全部发现项,待创始人拍决策包⑦(拍点清单见 §5)。
评审记录(2026-07-02):Codex 无 BLOCKER、7 MAJOR/3 MINOR(「小改后可发布」);Opus 1 BLOCKER、6 MAJOR/5 MINOR(「修订后可收口」)。修复对照:B1+M5 断言归层分界(§3.3 第 5 条 + §3.2 L1-b 术语修正);M1「收窄 A–E」引用面补进 frontmatter/D2/§6(原「预期无」判断错误,撤回;主笔复核修正评审一处失真:所引 saa-graph skill §3.5 已随该 skill 2026-07-01 重写消失,实改对象为验收门内失真指针与 OpenGame对照 §3.5);M2 富化成本数字改忠实(¥0.7→¥0.85 = +21%,原「不涨钱」论据自伤);M3 tier2 结构下限拆档位通用项/品类结构项两层;M4 赢线双源裁定(§3.7 第 5 条);M6 L3/L4 改「结构前提」措辞 + 结构≠效果的诚实边界句(§3.1);Codex 侧:硬证据口径统一(生成侧真玩/运营侧真数据)、rubric 分组计分制与最小字段形状、F-4 静态×真玩冲突处置表(§3.7 第 2 条)、留存口径立到可建字段、传播触点「不改契约」声明(§3.5)、D11 校准单要素(owner/输入/样本门槛/回退,§4 D5)、观测线区间化 + 首批回填锁值、「唯一拒发权」限定为质量分层内、绝对化措辞收敛。