games-development-ai/docs/architecture/架构/生成引擎/游戏质量与爆火能力.md
lili 8edb0ffa39
Some checks failed
contract-gates / contract-gates (push) Has been cancelled
docs-gate / docs-gate (push) Has been cancelled
docs(cheap-gen): W-AXIS-V2 波0——SoT 修订 A1–A5 逐处落 + spike 资产入仓 + 在飞板登记
按已批 v2 plan(2026-07-10-001)附录 A 执行,生效语气统一「已裁定,随波 1/2 兑现」:

- 质量模型 SoT:裁定三四处(四门投影/测试 agent 证据链/同源边界修正——判定档切
  MiniMax-M3 动因与兜底/tester_degraded 归因)+ 裁定一末句四门投影追补 + 裁定二
  occupied/score 历史口径注记 + §2 表 L1 行/门类型消歧段/§3 总述/规范五/首局时间口径
- 验收门:§2.4 追加「便宜档消费口径 v2」段(F 归类坐实、首局门退役去向)+ 门分类段
  与首局门段注记
- 运行时图说:护城河分层验收段 v2 终文 + 出题≠被考实质化修订 + §一概览 + C5/C6
  两契约便宜档消费面退役注记 + driven 段 + §六 A11 modify 链切统一编排器注记
- spike 资产入 spikes/playtest-agent/(v3 脚本仓相对路径化 + 考卷终榜 jsonl +
  10 局转写 + README 复跑方法/真相表/结论:真坏 3/3 全拦零假阳、2 假阴同源接地失手)
- 在飞板:07-09 三波 plan 收口移除(三波+n=5 基线全交),登 W-AXIS-V2 行(波0 、
  波1 待派)

验收:docs-gate 七检全绿;rg 复扫「五门/九门=验收」仅余两处已注记历史叙述,无活口径残留。

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-10 04:40:41 -07:00

155 lines
35 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
topic: 游戏质量与爆火能力
canonical: true
date: 2026-07-02
---
# 游戏质量与爆火能力:四层质量模型
![四层质量塔](assets/quality-01-四层质量塔.svg)
> **生效状态**:本模型经 Codex + Opus 双评审后,由创始人 2026-07-02 以决策包⑦一次拍定生效——四层定义与权力分配、档位观测线、rubric 计分制、平衡门判法五裁定、「收窄 AE」历史化、富三门档位适用与断言分界、D11 权重管辖移交,七项俱批;档内数值草案即生效值,观测线区间待首批品类件回填分布后锁成单值(§10)。2026-07-03 通用底座增补第 12 条口径(「核心操作非无脑」,L2 满分升至 12),图 1 底部明细带按 L2 7 / L3 3 / L4 2 分组列全。设计留痕 = `docs/agent-specs/2026-07-02-游戏质量与爆火能力-设计.md`。
>
> **2026-07-09 修订(创始人当日拍板)**:L1 的证据构成升级——机械门降位为「未见明显死」预筛,独立模型对真玩证据的玩法判定升为阻断,合称 L1 双证据口径(裁定三,§3)。依据是当日五路 harness 审计坐实的三处病根:机械门的玩法语义已空心化(现存五份 verdict 仅凭 score 单调上升即 pass、终态闭环降 advisory)、判卷合约失败被误标为玩法失败、链路真相层缺失(诊断档 = `docs/brainstorms/2026-07-09-生成线harness方向性诊断与换轴方向.md`)。修订面 = §2 表格与权力宪法第一条、§3 裁定三、§9 防 Goodhart 第二条;**L2L4 分数一律非阻塞的纪律不变**——升级的是 L1 自身的证据,不是把丰富度分数变成门。
质量不是一个分,是四层递进的塔:机器门保「能玩」(L1,质量分层内唯一拒发权),LLM 评「有料」(L2),结构要求保「想再玩」(L3)与「想传出去」(L4)的前提;玩家真实数据是 L3/L4 的最终裁判,并回流校准 L2L4 评分与 D11 权重。本档立标准、判定归属与数值档位,是 W-GENRE 品类件 rubric、tier2 富三门反馈契约、数据飞轮留存口径的共同上位标准。它不重定义九门/富三门/首局门的具体判据(判据 SoT 仍是[验收门](验收门.md),本档只裁消费口径),不建留存/传播数据的采集管道(归 telemetry 线与[数据飞轮](数据飞轮.md)回流环),不替 agent 调平衡数值,不写各品类的完整 rubric(归 W-GENRE 品类件),不造统一「质量总分/爆火分」或任何自动爆火门,也不改开闸六门的治理设计(仅接管其中 D11 就绪分的权重管辖)。
## 1 命题与实证:为什么「过九门」不够
命题来自创始人两条既有裁定:「轻量≠简单——便宜档是低成本生成相对不复杂、又不易同质化的高质小游戏,不是产没人会玩的简单玩具」([agentic运行时架构图说](agentic运行时架构图说.md) §4.1);「便宜 = LLM 低参与度,不是游戏低质量,游戏底线 = 2D 丰富游戏(进货/解锁/成长/音乐/丰富玩法)」(创始人纠正,记于 `docs/agent-specs/2026-06-29-便宜档降AI参与-减摩擦与扩模板覆盖-设计.md` §6)。这不只是生成线的事:feed 分发的游戏若普遍单薄,推荐、广告、remix 同款这三条变现与增长线全部失去弹药——爆火能力是平台命题。
分层的必要性有三个实证。第一,**「过九门 ≠ 好玩」已被现网数据坐实**:M1 达标 bake-off 三品类 15/15 全过九门,但丰富度评分(旧 8 条口径,满分 8)均分只有 whack-mole 2.4、click-score 3.4、shop-serve 4.2。机器门保「能玩、玩得通」,对「有料、耐玩」不设防,也不该设防——判「有料」超出确定性信号的能力边界;缺的不是把九门加严,而是九门之上的分层标准。第二,**质量概念此前散落、无上位标准**:D11 就绪评分的权重自标占位待校准;丰富度清单已实装但只观测;GP12 王蓝莓黄金标尺、GP2 首局 30 秒、「完玩率 + 次日留存」散在产品域各处;W-GENRE 品类件的 rubric 明文一直在等上位标准,先批产会返工。第三,**平衡门判法此前双写悬而未裁**:判「平衡」一静一动两套(静态数值可达检查 advisory、真玩经济门 enforced),该谁说了算、失败后反馈里该有什么,tier2 n=5 收敛环 runbook(`docs/plans/2026-06-28-002-feat-tier2-n5收敛环-go-no-go-plan.md`,工单 F-4)明文挂到本模型一并裁定(§8)。
## 2 四层总览与权力分配
| 层 | 回答 | 判定者 | 量纲 | 权力 | 消费者 |
|---|---|---|---|---|---|
| **L1 机制可玩** | 能玩、玩得通吗 | 双证据:机器真玩预筛(便宜档 = 契约无关四门投影 A_boot/B_uncaught/C_frame/D_render,首局门语义并入测试员转写——已裁定,随 W-AXIS-V2 波 1/2 兑现;tier2 = 九门 + 富游戏三门)**∧** 玩法地板判定(便宜档 = 独立模型看真玩证据,出题 ≠ 被考——实质见裁定三 2026-07-10 修订;tier2 现 = 富三门双路,见裁定三落地范围) | 布尔(过/不过) | **质量分层内唯一拒发权** | 生成环放行、生产复验 |
| **L2 内容丰富** | 有料、耐玩吗 | LLM 验证 agent 按品类 rubric,非阻塞 | 逐条 0/1 + 分组小计 | 观测 + 批次验收线,不拦单款 | 品类件验收、批次观测、回流分析 |
| **L3 留存结构** | 想再玩的结构前提在吗 | 生成时 rubric 留存组;上线后玩家真数据 | rubric 分;运营 0100 | 观测;真数据经 quality_score 影响分发 | feed 排序、数据飞轮 |
| **L4 传播钩子** | 想让别人看的结构前提在吗 | 生成时 rubric 传播组;上线后 share/remix 漏斗 | rubric 分;漏斗率 | 观测;爆款筛选归运营 | remix 网络效应、爆款签约(P-IPX-06) |
层间纪律三条,是整个模型的权力宪法。
**质量侧的发布权只在 L1。** 一款游戏能不能进 feed,质量分层内由 L1 说了算,L2L4 任何分数都不拦发布。L1 自身的证据构成 2026-07-09 起为双份:机械真玩预筛是地板(挡明显死:起不来、抛异常、不渲染、不掌帧),独立模型对真玩证据的玩法判定是裁决(能玩到终局吗、核心操作有真决策吗、切 brief 的题吗)。这样改的原因写在裁定三:机械断言曾被当成「可玩」的完整证据,实测它只证得了「有东西在涨」,秒死、刷分、死锁、永不结束的游戏都能空心过门——把发布权全押在它上面,恰好造出了另一种 Goodhart(游戏围着盲驱动器的盲区设计)。原防 Goodhart 红线本身不动:LLM 的丰富度/留存/传播**评分**仍是软信号、永不拿拒发权;玩法判定不是评分——它裁的是**地板的有无**(玩得通吗/有决策层吗/切题吗),不是**程度的高低**(丰富、耐玩、好玩到什么程度——那些永远归 L2 软信号),与机械预筛同属 L1,受金标校准与人工抽检约束。发布链上另有治理拒发权(GP9 合规、D12 控制平面),在本模型之外、不受本档约束。
**推荐权在真数据。** 玩家行为聚合成运营质量分(0100)回灌 feed 决定「值不值得推」;生成侧 rubric 分只影响批次改进与回流分析,不直接改 feed 排序。
**「好玩」的终审归人。** 审核台人工终审保留,自动分只辅助排序与抽样。
另有一条贯穿 L3/L4 的诚实边界:设计侧 rubric 只测「结构存在性」(钩子在不在),它与真实留存/传播效果的相关性要到放量后校准(§10)才被验证;验证之前,L3/L4 分不得当作效果预测使用。
一处必须消歧:仓内有两套「门」。真玩九门(A_boot…I_control,harness 真玩判)是**验收面**;开闸六门(D12 控制平面/GP9 合规/9d trace/D11 就绪分/D9 反同质化/首局体验)是**放量治理面**。本模型的 L1 指前者加富游戏三门与首局门(便宜档 v2 机械取值收敛为契约无关四门投影,见裁定一 2026-07-10 追补——已裁定,随 W-AXIS-V2 波 1/2 兑现);开闸六门不属质量分层,其中与质量相关的观测件 D11 就绪分,权重管辖自本档定稿起归质量轨(§9)。
## 3 L1 机制可玩:唯一拒发权与两条口径裁定
判据本体在[验收门](验收门.md),本档不重抄:九门 = 客观健康门 A_boot/B_uncaught/C_frame/D_render/E_live 加 driver 依赖门 F_wiring/G_input/H_progress/I_control,真玩驱动、CDP 探针、零 LLM(便宜档 v2 消费取值收敛为契约无关四门投影,见裁定一 2026-07-10 追补——已裁定,随 W-AXIS-V2 波 1/2 兑现);富游戏三门 = tier2 多系统档专属(三联动/经济/latch);首局门 = H 门的 additive 派生超集(可玩 ≤2s/首反馈即时/60s 品类闭环),FAIL 不推翻 H。定稿时点的现状:便宜档 M1 三品类 15/15 达标;tier2 收敛环 conditional,卡在经济门与 H_progress——判法与反馈的解法见 §8。
**裁定一(消费口径):driven 时九门全量 AND 为机械层取值口径,「收窄 AE」历史化;2026-07-09 起该口径的通过 = 预筛通过,不再单独构成 L1 通过(见裁定三)。** 验收门 §2.4 曾记「生成环消费从九门全过收窄成只认 AE,G/H/I 降参考,F_wiring 改 VLM 判」——那是 gamedef 时代 driver 缺失、G/H/I 不可靠时的消费策略。现行便宜档在门跑前自动生成 play-spec 使 driven=true、九门全部致命,cheap 与 tier2 的判据代码都认九门全量与富门,M1 达标 15/15 正是这个口径。据此裁定:driven 时九门全量 AND 为机械层现行取值口径(自裁定三起它构成 L1 的预筛半,另一半 = 独立模型玩法判定);undriven 时 E_live/H_progress 自动降 advisory 的分级保留在 harness(已实装);「收窄 AE」条款自本档定稿起历史化,消除文档-代码漂移,存量引用面随收口逐一改注,此后再发现的引用面一律改该处引用、不回改本裁定。F_wiring 保持机器硬门;VLM 视觉**效果**评分归 L3 视觉软检,永远软——它与裁定三的玩法判定(布尔裁决、阻断)是两物,别混。2026-07-10 起『driven 时九门全量 AND』口径仅存于 tier2 与历史复跑;便宜档机械取值 = 从 verdict.guards 显式抽取的契约无关四门投影(G/I 在 undriven 下恒 skip-pass、E/H 降 advisory、F 期望集随 play-spec 退役,均不进取值)——四门投影是消费层函数,不等于也不改写 harness 原生 verdict.pass(见裁定三 2026-07-10 修订;已裁定,随 W-AXIS-V2 波 1/2 兑现)。
**裁定二(富三门档位适用):富游戏三门只随「多系统富游戏」档位走**(现为 tier2 经营类)。便宜档经营品类的进度判定曾 = occupied 反应族驱动 + score 递增断言(历史口径:2026-07-10 起该判定手段随取证契约退役,进度证据改由测试员转写承担——已裁定,随 W-AXIS-V2 波 1/2 兑现),且不引入 tier2 经济平衡门(盈利/破产双路判)——单循环游戏没有「经济死局」问题,把它强推到便宜档,是给 L1 加不属于该档位的判据。这里要分清「门」与「断言」两个层次:play-spec 里经 H 门校验的 per-game 真玩断言(score 递增,以及游戏含消费扣减时的 currency 扣减断言)是便宜档 L1 的正当判据,照常使用;本裁定挡的是门级判据跨档,不是禁用某类断言(断言与 rubric 的分界见 §4 规范五)。两档判据差异是档位事实,不是待统一的债。
**裁定三(2026-07-09,L1 双证据口径):机械门降位为预筛,独立模型玩法判定升为阻断,两者相与才是 L1 通过。** 依据是当日五路 harness 审计:九门里唯一带玩法语义的 H_progress 实测退化成「score 单调上升」,终态闭环 latch 在「有进展」时一律降 advisory,现存五份 pass verdict(hard-heritage/hard-trpg/hard-idle-sim/c2v-1/c2v-3)全部仅凭 score↑ 过门——机械断言证得了「有东西在涨」,证不了「人能玩通」;而系统提示为让盲驱动器能跑,曾教模型把计分结构围着验收器的盲区设计(「两层奖励」条款),机械门独裁的后果正是它自己被 Goodhart。据此裁定四条:**其一**,机械真玩链(九门/富三门/首局门)语义降位为「未见明显死」的预筛地板,driven 时仍按裁定一全量 AND 取值,但其通过不再单独构成 L1 通过,verdict 的对外语义随之改名(预筛通过 ≠ 验收通过)。2026-07-10 再修订(W-AXIS-V2):便宜档机械预筛收敛为契约无关四门投影(A_boot/B_uncaught/C_frame/D_render,消费层从 guards 显式抽取,权威字段 floor,不复用 harness 原生 verdict.pass);F_wiring 的期望前缀集源自 play-spec,随契约退役降观测,『真接线』关切移交 check 静态层与测试员观察;E_live/G_input/H_progress/I_control 退出便宜档验收取值(判据代码保留、降观测)。依据是 2026-07-10 基线逐局破案:取证契约实现缺陷在 25 局里坑杀 2 局好游戏、误导续修每局烧 ¥10+,契约面最大的品类失败最集中(执行与证据 = W-AXIS-V2 plan;已裁定,随其波 1/2 兑现);**其二**,新增独立模型玩法判定,输入 = brief 加真玩证据链;v2 起证据由测试 agent 亲手真玩产生(视觉引导逐步操作的全程截图序列、行动转写、运行日志),取证状态时间线随 `_forensicsView` 契约退役不再作判定输入——判定与真玩合一于测试 agent,其裁决即玩法判定半,三类拒绝与『判有无不判多好』分界不变(已裁定,随 W-AXIS-V2 波 1/2 兑现)。产出 = 布尔裁决加逐条理由,阻断放行,理由原文回喂续修——出题≠被考的实质 = 判定只吃运行证据、不吃生成 agent 的自报,且测试员与写手会话隔离;判定模型允许与生成同源(2026-07-10 创始人拍板切 MiniMax-M3)——地板布尔判『有无』使同源盲区风险最小,同源模型抓自家缺陷已有实证(spike 考卷 8undefine 案);残余风险由金标正反例复验与创始人抽玩兜底,动因:glm-5.2 唯一供给通道为二手中转,图像支持按池轮换、2026-07-09 整日全盲,判定层可用性不押注二手供给。**玩法判定只裁地板布尔,分界钉死**:它的三类拒绝 = broken(真人玩不通/到不了终局)、hollow(空壳——核心循环不存在决策层,判「有没有」、不判「做得多好」)、off-brief(不切题);凡「多丰富/多耐玩/多好玩」的**程度**问题一律归 L2 rubric 非阻塞——同一维度在两层各管一半:L1 判定裁「有无」(如:决策层存在吗),L2 rubric 评「高低」(如:rubric 第 12 条评决策做得多有层次),谁想把某条 rubric 升成门,仍须回本档改 SoT 并过创始人,近义措辞不构成升门依据;**其三**,判定失败或评不出一律 fail-closed:不放行、标 degraded、入人工复核队列,人可放行——绝不静默降级成自动通过;**其四**,判定的校准纪律与 rubric 同构:每品类金标正反例复验、漂移超线先复采样再回退,创始人抽玩是最终校准锚,判定阻断带配置开关可整体回退到修订前口径。**落地范围**:模型判定先在便宜档生效(执行 = W-AXIS 换轴 plan 波 2);tier2 的玩法地板现由富三门双路真玩承担——其经济双路(赢得了且输得了且都到终态)正是「地板布尔」的机械对位物——tier2 是否叠加模型判定,随便宜档校准结果另议,在此之前 §2 表行的「模型判定」对 tier2 读作「富三门双路」。失败归因随本裁定分三层——判卷驱动器合约失败(取证不完整;v2 起该层随契约退役自然消亡,存量归因保留历史语义,新增 tester_degraded = 测试员评不出、fail-closed 待人工)、机械门失败(代码/运行缺陷)、玩法判定失败(设计缺陷)——回喂反馈必须按真实层次措辞,不得再把合约缺口说成「玩法坏死」。
## 4 L2 内容丰富:rubric 体系
![rubric 计分制与 F-4 平衡门五裁定](assets/quality-02-rubric计分与平衡门.svg)
质量模型有两条「怎么判」的主线,这张图把它们并排摊开。左半是 L2L4 内容质量的 rubric 计分制:每条 rubric 记 0/1 加一句理由,一次评分同时产 L2 丰富、L3 留存、L4 传播三个分组小计,不合成单一总分(单一总分会诱导 Goodhart),通用底座 12 条与品类扩展 ≥4 条两个分母分开、不混合平均;评分纯 LLM、非阻塞,失败即降级为「本次未评出」、绝不拦游戏。底下高亮的复采样纪律是这套软评分的确定性锚——金标正反例复验,单款分组小计漂移超 ±1 才回退,而回退前先对同一输入复采样 ≥3 次取中位,免得把 LLM 固有的采样噪声误判成漂移。右半是 L1 经济平衡的 F-4 五裁定:agent 写完数值先过毫秒级的静态 economyConsistent 自检(只作提示、永不放行),真正说了算的是把游戏真玩到终态的动态门;门一旦失败,反馈必须带上实测终值、游戏内赢线与验收外生线三个数,而不是只丢一个门名。两条主线一软一硬——rubric 是软信号只供观测,平衡门是真玩硬证据、握 L1 唯一拒发权;共同的纪律都是用确定性锚点把 Goodhart 与评分漂移封死。§8 正文的平衡门流程与本图右半同源,判法细节以那五条裁定为准。
丰富有一条结构底线,便宜档也必须有,这是创始人「2D 丰富游戏」裁定的工程化:**成长轴**(数值或等级)、**解锁阶梯**(≥3 级,任意时刻可见下一个)、**收集/装饰或等价第二动机**、**音反馈**。这四件是生成 agent 在设计阶段的交付物(品类设计 skill 的职责),不是九门判据——丰富的「生成」归生成 agent,丰富的「校验」归 LLM 验证 agent,两边都不落项目代码。
计分制先立住:每条 rubric 记 0/1(成立/不成立),逐条给一句理由;条目按层标注(L2/L3/L4),一次 LLM 评分同时产出**三个分组小计**(L2 丰富小计/L3 留存结构小计/L4 传播结构小计),不另起三套评分,也**不设单一总分**——单一总分好看,但会诱导 Goodhart;分组小计才对得上三层各自的消费点。通用底座与品类扩展**分母分开**,不混合平均。每条 rubric 的最小形状 = 编号/层标/一句可判定的判据/一对正反例;品类件照这个形状产条目,评分 agent 照它出「逐条判定 + 理由 + 三组小计」。
规范六条,W-GENRE 品类件照此产 rubric:
**规范一:通用底座 v2 = 11 条,已实装为现网评分尺。** 原 8 条(即时反馈/可见成长/下一个解锁/30 秒爽点/数值滚雪球/情感锚/放置回归/音反馈,与 `.agents/skills/sim-business-game-design.md` §10 同源)加新增 3 条:L3「首 3 分钟脚本成立:010s 零阅读上手/1060s 首次升级/13min 露出 23 个后续锁」、L4「炫耀时刻:有可截图分享的结算/成就画面,不是打完就黑屏」、L4「同款钩子:品类原型 + 主题标签元数据可供 remix 预填」。分组归属:L2 = 即时反馈/可见成长/30 秒爽点/数值滚雪球/情感锚/音反馈共 6 条,L3 = 下一个解锁/放置回归/首 3 分钟脚本共 3 条,L4 = 炫耀时刻/同款钩子共 2 条。这 11 条已随 `cheap-worker/cheap_verify.py` 的 RICHNESS_CHECKLIST(commit ba82e63c)实装为便宜档丰富度验证 agent 的评分尺并落库三分组小计;实装遵守锚定纪律——原 8 条判据文本与顺序一字不改,新增 3 条追加于末尾,层标只是聚合归属、不改原条目的判据本身。新增 3 条的判据文本仍标草案,随首个品类件落地验证后确认或修订(修订须金标复验)。
2026-07-03 增补第 12 条,通用底座随之为 12 条口径:**「核心操作非无脑」**,层标 L2。判据:每次主操作含真实决策或技巧含量、判错有真代价,不是点了就自动结算;正例 = 顾客上门先看要什么再决定补哪种货,补错压库存;反例 = 点哪里都加分、无判断成分的挂机点击。该条源自便宜档主 prompt 自检第 ⑨ 条(策划知识包 v2 的否决项判定句式),升为评分尺条目;创始人 2026-07-03 授权按默认项拍板采纳。分组归属随之 L2 = 7 条、通用底座满分 12;档位观测线(§7)的百分比线不变,分母随升。实装遵守锚定纪律:追加于清单末尾、既有 11 条一字不动;落 `RICHNESS_CHECKLIST` 与金标复验同批执行,复验漂移超线按规范三处置。
**规范二:品类扩展 ≥4 条。** 每品类另加品类特有维度(经营范例:进货补货循环成立/客流节奏有紧张感/双货币分工明确/卡点「差一点」不卡死;其余品类由各品类件提出),同一字段形状、同样标层,分母独立小计。
**规范三:锚定纪律。** 每品类 ≥1 金标正例 + ≥1 薄反例;rubric 文本或评分 prompt 变更必须金标复验,单款分组小计漂移超 ±1 即回退。LLM 裁判的漂移用确定性锚点治,不用另一个 LLM 治。复采样定性补一条(2026-07-03,rubric 挂点归一单实测沉淀):复验遇漂移超 ±1,先同输入复采样 ≥3 次取中位再判——LLM 裁判对逐字节相同的输入,单次采样命中数差可达 3,属固有噪声;prompt 逐字节未变可机器证明时,不据单样本判回退,中位仍超线才回退。另一条实测教训同录:薄反例锚必须先验证「真的薄」——模板可能天然品类饱和(解谜模板曾在品类条目上拿满分),此时用合成薄壳作反例,不用模板。
**规范四:判定形态。** 纯 LLM、非阻塞、逐条给理由;绝不写成代码校验、不进九门、不进脚手架(创始人红线)。评分调用失败/超时/解析失败一律降级为「本次未评出」,不抛、不阻断生成、不进达标判定——非阻塞语义自带降级,也把错杀面封为零(评分再错也不拦游戏)。每款一次评分调用,成本占比可忽略(便宜档 <¥0.1 量级)。
**规范五:与 L1 断言的分界。** `sim-business-game-design` skill §10 曾注「4 条可机检」,这四条不同质,分两类处置:纯 code-presence 类(即时反馈/下一个解锁/音反馈——代码里存在调用 ≠ 体验成立)按红线软化为 LLM 评分维度,不落项目代码;经 H 门 assertAfterPlay 校验的 per-game 真玩断言(可见成长的 score/资源递增断言、经营的 currency 扣减断言)属 L1 机制可玩,保留为硬断言、不软化——把真玩硬证据降成软评分会削 L1 的拒发权,方向恰好反了。同名两物并存且分工明确:L1 断言判「机制上真发生」,L2 rubric 判「体验上成立、有层次」;skill §10 注记照此改口。(v2 注记:play-spec 这一断言载体随取证契约退役——已裁定,随 W-AXIS-V2 波 2 兑现;分界原则本身保留:机械可判的归地板与测试员转写,程度评价归 rubric。)2026-07-09 起这套分类学加入第三员——L1 模型玩法判定,判「作为游戏成立的**地板有无**」(broken/hollow/off-brief 三类拒绝,见裁定三):同一维度可以同时出现在 L1 判定与 L2 rubric,前者裁有无、后者评高低(例:决策层——L1 判定裁「有没有真决策」,rubric 第 12 条评「决策做得多好」),近义措辞不使 rubric 条目获得门权。
**规范六:消费点。** 分组小计消费于品类件验收与批次观测(档位观测线,§7)和回流分析(§10);逐条理由消费于品类件迭代——哪条维度长期不成立,就是品类设计 skill 或脚手架的改进信号。
## 5 L3 留存结构
设计侧三要素,进品类设计 skill 与 rubric、生成时交付:**目标梯度**(任意时刻「下一个目标」可见:解锁阶梯、任务清单)、**难度节奏**(爽点与平台期交替;成长曲线 ×1.15/级为默认锚;卡点造「差一点」的张力、不卡死)、**回归钩子**(每日首登奖励、离线收益、限时目标,便宜档至少一种)。首 3 分钟脚本是三要素在开局的浓缩,rubric v2 单列一条。
真判在上线后,口径立到可建字段的程度:**D1 留存** = 同一 game_id 下、同一稳定玩家标识(登录取 userId,未登录取匿名设备标识)在首玩自然日(平台时区)之后的第 1 个自然日内发生 ≥1 次开局事件,按「玩家 × 游戏 × 日」去重;**完玩率** = play_end 事件中 completed 占比。现状缺口:遥测聚合表没有次留字段(数据飞轮已挂账),字段或旁路的落地设计归数据飞轮回流环设计与 telemetry 线;字段落地前,用「完玩率 + 互动率(点赞收藏 ÷ 播放)」作代理,该缺口不阻塞品类批产与反馈契约两线。运营质量分(0100)回灌 feed 的既有机制不动,本档不碰其算法。
三个「首 X 时间」口径就此对齐,免得下游各按各的:GP2「玩家首局 30 秒体验」是产品域体验命题,本模型不收编;首局门三断言(可玩 ≤2s/首反馈即时/60s 品类闭环)是它在 L1 的机器可判子集(便宜档 v2 起断言语义迁移至测试员转写 firstPlay 三字段、独立门名退役——已裁定,随 W-AXIS-V2 波 1 兑现,见 W-AXIS-V2 plan §5);rubric「首 3 分钟脚本」是它在设计侧的结构化前奏。三者消费场景不同,时间锚不强行统一;体验效果的真判(如前 30 秒流失率)留给放量后校准。
## 6 L4 传播钩子
三件结构要求,生成时交付:**炫耀时刻**(结算/成就画面可截图、可分享——游戏必须有结算展示场景,不是打完就黑屏)、**分享点位**(结算处一键分享,自愿不打断,与广告点位同一条体验原则)、**同款可复刻**(游戏页 remix 入口可用,是 GP10「爆款做同款」网络效应的供给侧前提;生成侧交付品类原型与主题标签元数据,供 remix 预填)。
真判 = share 事件与 remix_click/remix_submit 漏斗。本模型不改契约:share 是 telemetry 既有事件,remix 漏斗按数据飞轮已规划的增量契约落地;品类件或产品面若需新增事件,走契约变更流程(护城河与跨端契约终审)。红线一条:传播钩子是**结构要求(有没有),不是效果承诺(火不火)**。本模型保证「具备被传播的结构」;爆款是概率事件,筛选与签约(P-IPX-06)归运营,不做自动「爆火分」。
## 7 丰富度预算档位(生效值)
| 档位 | 成本红线(创始人 2026-06-25 拍) | 实测基线 | 丰富结构下限 | rubric 观测线(生效值,区间待锁) |
|---|---|---|---|---|
| **便宜档**(AI 低参与) | per-gen < ¥10(图/音另线) | ¥0.250.9/款 | 底线四件(成长轴/解锁阶梯 ≥3 级/第二动机/音反馈)+ 1 主循环 ≤2 主机制 + 首 3 分钟脚本;四件为默认底线,品类件须逐条确认可映射,映射不动的申报品类替代轴 | 品类小批(n=35):**L2 组均分 ≥60% 组满分**(区间 5565% 待锁)且无恒 0 条目;L3 组 ≥2/3 成立;L4 组 ≥1/2 成立 |
| **tier2**(AI 深参与) | per-gen < ¥50,目标 ≤¥3/成功款 | ¥1.29/款 | 档位通用项:≥3 个耦合子系统 + 阶段目标长线;品类结构项(现行经营件 = 资源/合成/订单三系统、双终态真可达,即富三门)由品类件承载,扩品类时由对应品类件重定义 | 品类 rubric(通用 + 品类扩展,两分母)**均分 ≥70% 满分**(区间 6575% 待锁),品类扩展组无恒 0 条目 |
消费纪律三条,防误用。
**其一,档位线消费于品类资产验收(W-GENRE 各件 n=35 小批)与批次观测,不消费于单款放行**——单款放行只看 L1。线拍高最坏也只是某品类件多一轮申报,不错杀单款、不阻塞主线。
**其二,观测线是拉升目标,不是现状描述。** 现网 8 条无分组口径下 shop-serve 4.2/8、click-score 3.4/8、whack-mole 2.4/8,全部低于线;线的意义是品类件(设计 skill + few-shot 到位后)必须把分布抬上来,区间值由首批品类件回填分布后锁成单值。品类件对观测线或结构下限的品类适配走申报机制:附理由申报、创始人批;反应类等天然薄品类须同时给出替代丰富轴(连击深度、模式变体等),纯叙事/非遗类可申报以章节推进、工艺步骤解锁等替代成长轴——不许裸降。首批申报已批两件(2026-07-03,创始人授权默认项拍板):非遗类的「情感锚/放置回归」两条按替代轴判——作品集养成为情感锚的等价物,工序晾晒/窑烧类工艺周期节点为回归钩的等价物;解谜类按收集图鉴/伙伴系统为情感锚等价物,每日一题为回归钩等价物。替代轴落评分 prompt 的品类注解,通用条目文本不动,随下一轮金标复验一并验证。
**其三,预算余量优先买丰富、不买省钱。** 软脚手架数据点显示,富化把单款成本从约 ¥0.7 抬到 ¥0.85(+21%),行数 892≈890 持平——多花的钱买到的是 combo/VIP 这类玩法富化,不是代码量;绝对值距 ¥10 红线余量巨大,这笔钱该花。reskin 锁循环省成本的路线已被创始人否为越线,不回潮。
## 8 平衡门判法:五条裁定
背景:tier2 收敛环 conditional 的失败集中在「盈利路赢不了」(经济门 profitPathWin 子检查)与「进度不成立」(H_progress),而判「平衡」这件事此前双写——静态 economyConsistent 从已落盘数据表算「数值可达」(开局金币 + 订单奖励之和 ≥ 赢线,advisory),真玩经济门把游戏真玩到 coins ≥ 阈值且 phase 为 win 且到终态(enforced)。该谁说了算、失败后反馈里该有什么,裁定五条如下(即 n=5 收敛环 runbook 的工单 F-4;下文 F-1 = 该 runbook 的富三门反馈补厚工单,F-2 = 干净复跑工单):
```mermaid
flowchart LR
A["agent 写玩法数值/数据表"] --> S["静态自检 economyConsistent<br/>毫秒级 · advisory · 自检工具"]
S -->|"数值差额即时提示"| A
A --> P["真玩动态门(权威)<br/>经济门 win/lose 双路 + H_progress"]
P -->|"失败:数值证据反馈(F-1)<br/>实测值 vs 期望值 + 为什么"| A
P -->|"全绿"| OK["L1 放行"]
```
**其一,平衡判定的权威 = 真玩动态门,不回退静态判。** 静态「数值可达」证明不了「真玩得到」——顾客耐心、时序、操作节奏只在真玩里存在;n=5 实测的失败全部发生在静态检查之后的真玩层。真玩是生成验收阶段的权威硬证据(§9 双硬证据口径的生成侧一半),这条与防 Goodhart 红线同源。
**其二,静态判据定位 = agent 自检工具 + 反馈素材,保持 advisory,不升门。** 它确定性可算、毫秒级,适合 agent 写完数值后即时自查(省一轮约十分钟的真玩往返),也适合折进失败反馈,但永远不是放行判据。静态与真玩结论组合是诊断信号,处置固定:真玩过、静态挂 → 放行,静态差额记 warning 进观测(复核静态判据模型);真玩挂、静态过 → 失败,反馈以真玩数值为主并注明「静态认为数值可达」——问题大概率在耐心/时序/操作节奏,不在数值总量;双挂 → 失败,两组证据并喂;真玩无有效观测(探针读不到 state、驱动不到终态)→ 走 harness/driver 故障路径(E/H 门失败处理),绝不以静态判替代放行。
**其三,反馈契约:平衡门失败必须喂回数值证据,不只喂门名。** 此前 tier2 富游戏门反馈只给失败子检查名(如 profitPathWin),把 harness 已算出的具体数值(coins 终值 vs 赢线、phase、是否到终态)丢弃;便宜档九门反馈反而带 before/after/why 细节。裁定:tier2 富三门反馈对齐便宜档厚度——每个失败子检查给「实测值 vs 期望值 + 一句为什么」,静态 economyConsistent 的差额一并折进。这是收敛环 conditional 的解法(agent 层)在判法侧的落点。两级验收别混:F-1 的「自修通过 ≥2 例」证的是反馈契约生效;tier2 的 go/no-go 仍以 F-2 干净复跑与收敛环判定为准,前者不替代后者。
**其四,平衡的「调」永远是 agent 的玩法职责,工具层不代调。** 不做数值模板、不补平衡骨架(创始人 2026-06-29 裁定);工具层的全部义务 = 把「为什么不平衡」讲清(其三)。判法不变、反馈变厚。
**其五,赢线双源分工,agent 只调自己那一半。** 「赢」有两个数:游戏内赢条件(agent 数据表里的目标值)是玩法设计职责,agent 可调;验收外生赢线(品类金标 play-spec 里的门槛)是验收基准,由品类件与档位表锚定,agent 不可调、也不该看着它反向凑数。真玩经济门要求两者同时成立(真玩到游戏内赢态、且量级过验收线),因此失败反馈必须同时暴露三个数——实测终值、游戏内赢线、验收外生线;agent 若把游戏内赢线设得低于验收地板,反馈应直接指出这个结构性错配,而不是让它对着改不动的阈值空转。
## 9 分数量纲与防 Goodhart 纪律
```mermaid
flowchart LR
R["rubric 分 0N<br/>生成侧局部量纲"] --> C1["品类件验收 · 批次观测 · 回流分析"]
G["生成质量分 01<br/>aigc 域"] --> C2["生成域内部"]
Q["运营质量分 0100<br/>telemetry→feed"] --> C3["feed 排序"]
D["D11 就绪分 0100<br/>治理观测件"] --> C4["开闸治理看板"]
R -.禁止换算互灌.- G
G -.禁止换算互灌.- Q
```
量纲纪律:既有双量纲锁死不动——生成质量分(01,aigc 域)与运营质量分(0100,telemetry→feed)不可互相回灌(`contracts/README.md` 双量纲红线);rubric 分(0N)是生成侧局部量纲,只在品类验收、批次观测、回流分析消费,禁止换算回灌进前两者;**不新造统一「质量总分/爆火分」**。D11 就绪分(0100,开闸治理观测件)的权重(playability 0.5/firstPlay 0.25/stability 0.15/efficiency 0.1)自本档起归质量轨管辖:放量前的起步值仍由生产 cutover plan 落定(其部署步已在修 efficiency 维 BUDGET_RMB 与便宜档实际成本的错配,该项列为质量轨接管后的首个复核件);放量后第一轮校准见 §10。
防 Goodhart 三条,贯穿全模型:**L2L4 分数一律非阻塞**——任何丰富/留存/传播分都不得升为拒发门,升门动议须回本档改 SoT 并过创始人;**真玩与真实玩家数据是仅有的两种「硬」证据,且真玩证据必须被判读**——设计侧一切 LLM 评分都是软信号;机械断言对真玩证据的解读同样会空心(2026-07-09 实证:score-only pass 五案),所以 L1 的判读自裁定三起是「机械预筛 ∧ 独立模型判定」双份,单独哪一份都不许自称完整硬证据;**「好玩」的终审归人**(审核台与创始人抽玩)。rubric 被 Goodhart 或评分漂移的兜底与此同构:非阻塞设计把错杀面封为零,金标锚定 ±1 回退管住漂移,放量后真数据校准是最终纠偏——若 rubric 分与留存相关性为零或负,重审 rubric 维度,回滚面只在 rubric 文本与评分 prompt,不伤门与代码。
## 10 生效、校准与升级路径
生效态分三层:四层定义与权力分配、两条 L1 口径裁定、五条平衡门裁定即日生效;档位观测线以草案值生效(便宜档 L2 组均分 ≥60%、tier2 均分 ≥70%),区间(5565%/6575%)由首批品类件回填分布后锁成单值;rubric 通用底座 v2 的新增 3 条判据文本标草案,随首个品类件落地验证后确认或修订。
放量后第一轮校准归质量轨:回流环设计产校准单、opus 执行;输入 = 放量后足量样本(起步 ≥100 款)的 rubric 分组小计 × 留存真数据,含 D11 efficiency 维错配复核;判定 = 相关性方向为正,样本不足或回归不显著则维持占位值再观测一期;D11 权重变更整体可回退上一版(D11 只观测不拦,回退零风险)。此后一切档位线、rubric 维度、D11 权重的修订都走同一条路:质量轨提案,即[数据飞轮](数据飞轮.md)回流环的校准单机制——不在现场拍脑袋改阈值;L2L4 任何升门动议同样须回本档改 SoT 并过创始人。
下游三线从本档直接开工,不再各自发明标准:W-GENRE 品类件照 §4 规范产 rubric、按 §7 档位观测线验收;tier2 富三门反馈契约照 §8 补厚(裁定即可执行,不依赖档位数值);数据飞轮与 telemetry 线照 §5 口径立留存字段。