--- topic: 游戏质量与爆火能力 canonical: true date: 2026-07-02 --- # 游戏质量与爆火能力:四层质量模型 ![四层质量塔](assets/quality-01-四层质量塔.svg) > **生效状态**:本模型经 Codex + Opus 双评审后,由创始人 2026-07-02 以决策包⑦一次拍定生效——四层定义与权力分配、档位观测线、rubric 计分制、平衡门判法五裁定、「收窄 A–E」历史化、富三门档位适用与断言分界、D11 权重管辖移交,七项俱批;档内数值草案即生效值,观测线区间待首批品类件回填分布后锁成单值(§10)。2026-07-03 通用底座增补第 12 条口径(「核心操作非无脑」,L2 满分升至 12),图 1 底部明细带按 L2 7 / L3 3 / L4 2 分组列全。设计留痕 = `docs/agent-specs/2026-07-02-游戏质量与爆火能力-设计.md`。 > > **2026-07-09 修订(创始人当日拍板)**:L1 的证据构成升级——机械门降位为「未见明显死」预筛,独立模型对真玩证据的玩法判定升为阻断,合称 L1 双证据口径(裁定三,§3)。依据是当日五路 harness 审计坐实的三处病根:机械门的玩法语义已空心化(现存五份 verdict 仅凭 score 单调上升即 pass、终态闭环降 advisory)、判卷合约失败被误标为玩法失败、链路真相层缺失(诊断档 = `docs/brainstorms/2026-07-09-生成线harness方向性诊断与换轴方向.md`)。修订面 = §2 表格与权力宪法第一条、§3 裁定三、§9 防 Goodhart 第二条;**L2–L4 分数一律非阻塞的纪律不变**——升级的是 L1 自身的证据,不是把丰富度分数变成门。 质量不是一个分,是四层递进的塔:机器门保「能玩」(L1,质量分层内唯一拒发权),LLM 评「有料」(L2),结构要求保「想再玩」(L3)与「想传出去」(L4)的前提;玩家真实数据是 L3/L4 的最终裁判,并回流校准 L2–L4 评分与 D11 权重。本档立标准、判定归属与数值档位,是 W-GENRE 品类件 rubric、tier2 富三门反馈契约、数据飞轮留存口径的共同上位标准。它不重定义九门/富三门/首局门的具体判据(判据 SoT 仍是[验收门](验收门.md),本档只裁消费口径),不建留存/传播数据的采集管道(归 telemetry 线与[数据飞轮](数据飞轮.md)回流环),不替 agent 调平衡数值,不写各品类的完整 rubric(归 W-GENRE 品类件),不造统一「质量总分/爆火分」或任何自动爆火门,也不改开闸六门的治理设计(仅接管其中 D11 就绪分的权重管辖)。 ## 1 命题与实证:为什么「过九门」不够 命题来自创始人两条既有裁定:「轻量≠简单——便宜档是低成本生成相对不复杂、又不易同质化的高质小游戏,不是产没人会玩的简单玩具」([agentic运行时架构图说](agentic运行时架构图说.md) §4.1);「便宜 = LLM 低参与度,不是游戏低质量,游戏底线 = 2D 丰富游戏(进货/解锁/成长/音乐/丰富玩法)」(创始人纠正,记于 `docs/agent-specs/2026-06-29-便宜档降AI参与-减摩擦与扩模板覆盖-设计.md` §6)。这不只是生成线的事:feed 分发的游戏若普遍单薄,推荐、广告、remix 同款这三条变现与增长线全部失去弹药——爆火能力是平台命题。 分层的必要性有三个实证。第一,**「过九门 ≠ 好玩」已被现网数据坐实**:M1 达标 bake-off 三品类 15/15 全过九门,但丰富度评分(旧 8 条口径,满分 8)均分只有 whack-mole 2.4、click-score 3.4、shop-serve 4.2。机器门保「能玩、玩得通」,对「有料、耐玩」不设防,也不该设防——判「有料」超出确定性信号的能力边界;缺的不是把九门加严,而是九门之上的分层标准。第二,**质量概念此前散落、无上位标准**:D11 就绪评分的权重自标占位待校准;丰富度清单已实装但只观测;GP12 王蓝莓黄金标尺、GP2 首局 30 秒、「完玩率 + 次日留存」散在产品域各处;W-GENRE 品类件的 rubric 明文一直在等上位标准,先批产会返工。第三,**平衡门判法此前双写悬而未裁**:判「平衡」一静一动两套(静态数值可达检查 advisory、真玩经济门 enforced),该谁说了算、失败后反馈里该有什么,tier2 n=5 收敛环 runbook(`docs/plans/2026-06-28-002-feat-tier2-n5收敛环-go-no-go-plan.md`,工单 F-4)明文挂到本模型一并裁定(§8)。 ## 2 四层总览与权力分配 | 层 | 回答 | 判定者 | 量纲 | 权力 | 消费者 | |---|---|---|---|---|---| | **L1 机制可玩** | 能玩、玩得通吗 | 双证据:机器真玩预筛(便宜档 = 契约无关四门投影 A_boot/B_uncaught/C_frame/D_render,首局门语义并入测试员转写——已裁定,随 W-AXIS-V2 波 1/2 兑现;tier2 = 九门 + 富游戏三门)**∧** 玩法地板判定(便宜档 = 独立模型看真玩证据,出题 ≠ 被考——实质见裁定三 2026-07-10 修订;tier2 现 = 富三门双路,见裁定三落地范围) | 布尔(过/不过) | **质量分层内唯一拒发权** | 生成环放行、生产复验 | | **L2 内容丰富** | 有料、耐玩吗 | LLM 验证 agent 按品类 rubric,非阻塞 | 逐条 0/1 + 分组小计 | 观测 + 批次验收线,不拦单款 | 品类件验收、批次观测、回流分析 | | **L3 留存结构** | 想再玩的结构前提在吗 | 生成时 rubric 留存组;上线后玩家真数据 | rubric 分;运营 0–100 | 观测;真数据经 quality_score 影响分发 | feed 排序、数据飞轮 | | **L4 传播钩子** | 想让别人看的结构前提在吗 | 生成时 rubric 传播组;上线后 share/remix 漏斗 | rubric 分;漏斗率 | 观测;爆款筛选归运营 | remix 网络效应、爆款签约(P-IPX-06) | 层间纪律三条,是整个模型的权力宪法。 **质量侧的发布权只在 L1。** 一款游戏能不能进 feed,质量分层内由 L1 说了算,L2–L4 任何分数都不拦发布。L1 自身的证据构成 2026-07-09 起为双份:机械真玩预筛是地板(挡明显死:起不来、抛异常、不渲染、不掌帧),独立模型对真玩证据的玩法判定是裁决(能玩到终局吗、核心操作有真决策吗、切 brief 的题吗)。这样改的原因写在裁定三:机械断言曾被当成「可玩」的完整证据,实测它只证得了「有东西在涨」,秒死、刷分、死锁、永不结束的游戏都能空心过门——把发布权全押在它上面,恰好造出了另一种 Goodhart(游戏围着盲驱动器的盲区设计)。原防 Goodhart 红线本身不动:LLM 的丰富度/留存/传播**评分**仍是软信号、永不拿拒发权;玩法判定不是评分——它裁的是**地板的有无**(玩得通吗/有决策层吗/切题吗),不是**程度的高低**(丰富、耐玩、好玩到什么程度——那些永远归 L2 软信号),与机械预筛同属 L1,受金标校准与人工抽检约束。发布链上另有治理拒发权(GP9 合规、D12 控制平面),在本模型之外、不受本档约束。 **推荐权在真数据。** 玩家行为聚合成运营质量分(0–100)回灌 feed 决定「值不值得推」;生成侧 rubric 分只影响批次改进与回流分析,不直接改 feed 排序。 **「好玩」的终审归人。** 审核台人工终审保留,自动分只辅助排序与抽样。 另有一条贯穿 L3/L4 的诚实边界:设计侧 rubric 只测「结构存在性」(钩子在不在),它与真实留存/传播效果的相关性要到放量后校准(§10)才被验证;验证之前,L3/L4 分不得当作效果预测使用。 一处必须消歧:仓内有两套「门」。真玩九门(A_boot…I_control,harness 真玩判)是**验收面**;开闸六门(D12 控制平面/GP9 合规/9d trace/D11 就绪分/D9 反同质化/首局体验)是**放量治理面**。本模型的 L1 指前者加富游戏三门与首局门(便宜档 v2 机械取值收敛为契约无关四门投影,见裁定一 2026-07-10 追补——已裁定,随 W-AXIS-V2 波 1/2 兑现);开闸六门不属质量分层,其中与质量相关的观测件 D11 就绪分,权重管辖自本档定稿起归质量轨(§9)。 ## 3 L1 机制可玩:唯一拒发权与两条口径裁定 判据本体在[验收门](验收门.md),本档不重抄:九门 = 客观健康门 A_boot/B_uncaught/C_frame/D_render/E_live 加 driver 依赖门 F_wiring/G_input/H_progress/I_control,真玩驱动、CDP 探针、零 LLM(便宜档 v2 消费取值收敛为契约无关四门投影,见裁定一 2026-07-10 追补——已裁定,随 W-AXIS-V2 波 1/2 兑现);富游戏三门 = tier2 多系统档专属(三联动/经济/latch);首局门 = H 门的 additive 派生超集(可玩 ≤2s/首反馈即时/60s 品类闭环),FAIL 不推翻 H。定稿时点的现状:便宜档 M1 三品类 15/15 达标;tier2 收敛环 conditional,卡在经济门与 H_progress——判法与反馈的解法见 §8。 **裁定一(消费口径):driven 时九门全量 AND 为机械层取值口径,「收窄 A–E」历史化;2026-07-09 起该口径的通过 = 预筛通过,不再单独构成 L1 通过(见裁定三)。** 验收门 §2.4 曾记「生成环消费从九门全过收窄成只认 A–E,G/H/I 降参考,F_wiring 改 VLM 判」——那是 gamedef 时代 driver 缺失、G/H/I 不可靠时的消费策略。现行便宜档在门跑前自动生成 play-spec 使 driven=true、九门全部致命,cheap 与 tier2 的判据代码都认九门全量与富门,M1 达标 15/15 正是这个口径。据此裁定:driven 时九门全量 AND 为机械层现行取值口径(自裁定三起它构成 L1 的预筛半,另一半 = 独立模型玩法判定);undriven 时 E_live/H_progress 自动降 advisory 的分级保留在 harness(已实装);「收窄 A–E」条款自本档定稿起历史化,消除文档-代码漂移,存量引用面随收口逐一改注,此后再发现的引用面一律改该处引用、不回改本裁定。F_wiring 保持机器硬门;VLM 视觉**效果**评分归 L3 视觉软检,永远软——它与裁定三的玩法判定(布尔裁决、阻断)是两物,别混。2026-07-10 起『driven 时九门全量 AND』口径仅存于 tier2 与历史复跑;便宜档机械取值 = 从 verdict.guards 显式抽取的契约无关四门投影(G/I 在 undriven 下恒 skip-pass、E/H 降 advisory、F 期望集随 play-spec 退役,均不进取值)——四门投影是消费层函数,不等于也不改写 harness 原生 verdict.pass(见裁定三 2026-07-10 修订;已裁定,随 W-AXIS-V2 波 1/2 兑现)。 **裁定二(富三门档位适用):富游戏三门只随「多系统富游戏」档位走**(现为 tier2 经营类)。便宜档经营品类的进度判定曾 = occupied 反应族驱动 + score 递增断言(历史口径:2026-07-10 起该判定手段随取证契约退役,进度证据改由测试员转写承担——已裁定,随 W-AXIS-V2 波 1/2 兑现),且不引入 tier2 经济平衡门(盈利/破产双路判)——单循环游戏没有「经济死局」问题,把它强推到便宜档,是给 L1 加不属于该档位的判据。这里要分清「门」与「断言」两个层次:play-spec 里经 H 门校验的 per-game 真玩断言(score 递增,以及游戏含消费扣减时的 currency 扣减断言)是便宜档 L1 的正当判据,照常使用;本裁定挡的是门级判据跨档,不是禁用某类断言(断言与 rubric 的分界见 §4 规范五)。两档判据差异是档位事实,不是待统一的债。 **裁定三(2026-07-09,L1 双证据口径):机械门降位为预筛,独立模型玩法判定升为阻断,两者相与才是 L1 通过。** 依据是当日五路 harness 审计:九门里唯一带玩法语义的 H_progress 实测退化成「score 单调上升」,终态闭环 latch 在「有进展」时一律降 advisory,现存五份 pass verdict(hard-heritage/hard-trpg/hard-idle-sim/c2v-1/c2v-3)全部仅凭 score↑ 过门——机械断言证得了「有东西在涨」,证不了「人能玩通」;而系统提示为让盲驱动器能跑,曾教模型把计分结构围着验收器的盲区设计(「两层奖励」条款),机械门独裁的后果正是它自己被 Goodhart。据此裁定四条:**其一**,机械真玩链(九门/富三门/首局门)语义降位为「未见明显死」的预筛地板,driven 时仍按裁定一全量 AND 取值,但其通过不再单独构成 L1 通过,verdict 的对外语义随之改名(预筛通过 ≠ 验收通过)。2026-07-10 再修订(W-AXIS-V2):便宜档机械预筛收敛为契约无关四门投影(A_boot/B_uncaught/C_frame/D_render,消费层从 guards 显式抽取,权威字段 floor,不复用 harness 原生 verdict.pass);F_wiring 的期望前缀集源自 play-spec,随契约退役降观测,『真接线』关切移交 check 静态层与测试员观察;E_live/G_input/H_progress/I_control 退出便宜档验收取值(判据代码保留、降观测)。依据是 2026-07-10 基线逐局破案:取证契约实现缺陷在 25 局里坑杀 2 局好游戏、误导续修每局烧 ¥10+,契约面最大的品类失败最集中(执行与证据 = W-AXIS-V2 plan;已裁定,随其波 1/2 兑现);**其二**,新增独立模型玩法判定,输入 = brief 加真玩证据链;v2 起证据由测试 agent 亲手真玩产生(视觉引导逐步操作的全程截图序列、行动转写、运行日志),取证状态时间线随 `_forensicsView` 契约退役不再作判定输入——判定与真玩合一于测试 agent,其裁决即玩法判定半,三类拒绝与『判有无不判多好』分界不变(已裁定,随 W-AXIS-V2 波 1/2 兑现)。产出 = 布尔裁决加逐条理由,阻断放行,理由原文回喂续修——出题≠被考的实质 = 判定只吃运行证据、不吃生成 agent 的自报,且测试员与写手会话隔离;判定模型允许与生成同源(2026-07-10 创始人拍板切 MiniMax-M3)——地板布尔判『有无』使同源盲区风险最小,同源模型抓自家缺陷已有实证(spike 考卷 8undefine 案);残余风险由金标正反例复验与创始人抽玩兜底,动因:glm-5.2 唯一供给通道为二手中转,图像支持按池轮换、2026-07-09 整日全盲,判定层可用性不押注二手供给。**玩法判定只裁地板布尔,分界钉死**:它的三类拒绝 = broken(真人玩不通/到不了终局)、hollow(空壳——核心循环不存在决策层,判「有没有」、不判「做得多好」)、off-brief(不切题);凡「多丰富/多耐玩/多好玩」的**程度**问题一律归 L2 rubric 非阻塞——同一维度在两层各管一半:L1 判定裁「有无」(如:决策层存在吗),L2 rubric 评「高低」(如:rubric 第 12 条评决策做得多有层次),谁想把某条 rubric 升成门,仍须回本档改 SoT 并过创始人,近义措辞不构成升门依据;**其三**,判定失败或评不出一律 fail-closed:不放行、标 degraded、入人工复核队列,人可放行——绝不静默降级成自动通过;**其四**,判定的校准纪律与 rubric 同构:每品类金标正反例复验、漂移超线先复采样再回退,创始人抽玩是最终校准锚,判定阻断带配置开关可整体回退到修订前口径。**落地范围**:模型判定先在便宜档生效(执行 = W-AXIS 换轴 plan 波 2);tier2 的玩法地板现由富三门双路真玩承担——其经济双路(赢得了且输得了且都到终态)正是「地板布尔」的机械对位物——tier2 是否叠加模型判定,随便宜档校准结果另议,在此之前 §2 表行的「模型判定」对 tier2 读作「富三门双路」。失败归因随本裁定分三层——判卷驱动器合约失败(取证不完整;v2 起该层随契约退役自然消亡,存量归因保留历史语义,新增 tester_degraded = 测试员评不出、fail-closed 待人工)、机械门失败(代码/运行缺陷)、玩法判定失败(设计缺陷)——回喂反馈必须按真实层次措辞,不得再把合约缺口说成「玩法坏死」。 ## 4 L2 内容丰富:rubric 体系 ![rubric 计分制与 F-4 平衡门五裁定](assets/quality-02-rubric计分与平衡门.svg) 质量模型有两条「怎么判」的主线,这张图把它们并排摊开。左半是 L2–L4 内容质量的 rubric 计分制:每条 rubric 记 0/1 加一句理由,一次评分同时产 L2 丰富、L3 留存、L4 传播三个分组小计,不合成单一总分(单一总分会诱导 Goodhart),通用底座 12 条与品类扩展 ≥4 条两个分母分开、不混合平均;评分纯 LLM、非阻塞,失败即降级为「本次未评出」、绝不拦游戏。底下高亮的复采样纪律是这套软评分的确定性锚——金标正反例复验,单款分组小计漂移超 ±1 才回退,而回退前先对同一输入复采样 ≥3 次取中位,免得把 LLM 固有的采样噪声误判成漂移。右半是 L1 经济平衡的 F-4 五裁定:agent 写完数值先过毫秒级的静态 economyConsistent 自检(只作提示、永不放行),真正说了算的是把游戏真玩到终态的动态门;门一旦失败,反馈必须带上实测终值、游戏内赢线与验收外生线三个数,而不是只丢一个门名。两条主线一软一硬——rubric 是软信号只供观测,平衡门是真玩硬证据、握 L1 唯一拒发权;共同的纪律都是用确定性锚点把 Goodhart 与评分漂移封死。§8 正文的平衡门流程与本图右半同源,判法细节以那五条裁定为准。 丰富有一条结构底线,便宜档也必须有,这是创始人「2D 丰富游戏」裁定的工程化:**成长轴**(数值或等级)、**解锁阶梯**(≥3 级,任意时刻可见下一个)、**收集/装饰或等价第二动机**、**音反馈**。这四件是生成 agent 在设计阶段的交付物(品类设计 skill 的职责),不是九门判据——丰富的「生成」归生成 agent,丰富的「校验」归 LLM 验证 agent,两边都不落项目代码。 计分制先立住:每条 rubric 记 0/1(成立/不成立),逐条给一句理由;条目按层标注(L2/L3/L4),一次 LLM 评分同时产出**三个分组小计**(L2 丰富小计/L3 留存结构小计/L4 传播结构小计),不另起三套评分,也**不设单一总分**——单一总分好看,但会诱导 Goodhart;分组小计才对得上三层各自的消费点。通用底座与品类扩展**分母分开**,不混合平均。每条 rubric 的最小形状 = 编号/层标/一句可判定的判据/一对正反例;品类件照这个形状产条目,评分 agent 照它出「逐条判定 + 理由 + 三组小计」。 规范六条,W-GENRE 品类件照此产 rubric: **规范一:通用底座 v2 = 11 条,已实装为现网评分尺。** 原 8 条(即时反馈/可见成长/下一个解锁/30 秒爽点/数值滚雪球/情感锚/放置回归/音反馈,与 `.agents/skills/sim-business-game-design.md` §10 同源)加新增 3 条:L3「首 3 分钟脚本成立:0–10s 零阅读上手/10–60s 首次升级/1–3min 露出 2–3 个后续锁」、L4「炫耀时刻:有可截图分享的结算/成就画面,不是打完就黑屏」、L4「同款钩子:品类原型 + 主题标签元数据可供 remix 预填」。分组归属:L2 = 即时反馈/可见成长/30 秒爽点/数值滚雪球/情感锚/音反馈共 6 条,L3 = 下一个解锁/放置回归/首 3 分钟脚本共 3 条,L4 = 炫耀时刻/同款钩子共 2 条。这 11 条已随 `cheap-worker/cheap_verify.py` 的 RICHNESS_CHECKLIST(commit ba82e63c)实装为便宜档丰富度验证 agent 的评分尺并落库三分组小计;实装遵守锚定纪律——原 8 条判据文本与顺序一字不改,新增 3 条追加于末尾,层标只是聚合归属、不改原条目的判据本身。新增 3 条的判据文本仍标草案,随首个品类件落地验证后确认或修订(修订须金标复验)。 2026-07-03 增补第 12 条,通用底座随之为 12 条口径:**「核心操作非无脑」**,层标 L2。判据:每次主操作含真实决策或技巧含量、判错有真代价,不是点了就自动结算;正例 = 顾客上门先看要什么再决定补哪种货,补错压库存;反例 = 点哪里都加分、无判断成分的挂机点击。该条源自便宜档主 prompt 自检第 ⑨ 条(策划知识包 v2 的否决项判定句式),升为评分尺条目;创始人 2026-07-03 授权按默认项拍板采纳。分组归属随之 L2 = 7 条、通用底座满分 12;档位观测线(§7)的百分比线不变,分母随升。实装遵守锚定纪律:追加于清单末尾、既有 11 条一字不动;落 `RICHNESS_CHECKLIST` 与金标复验同批执行,复验漂移超线按规范三处置。 **规范二:品类扩展 ≥4 条。** 每品类另加品类特有维度(经营范例:进货补货循环成立/客流节奏有紧张感/双货币分工明确/卡点「差一点」不卡死;其余品类由各品类件提出),同一字段形状、同样标层,分母独立小计。 **规范三:锚定纪律。** 每品类 ≥1 金标正例 + ≥1 薄反例;rubric 文本或评分 prompt 变更必须金标复验,单款分组小计漂移超 ±1 即回退。LLM 裁判的漂移用确定性锚点治,不用另一个 LLM 治。复采样定性补一条(2026-07-03,rubric 挂点归一单实测沉淀):复验遇漂移超 ±1,先同输入复采样 ≥3 次取中位再判——LLM 裁判对逐字节相同的输入,单次采样命中数差可达 3,属固有噪声;prompt 逐字节未变可机器证明时,不据单样本判回退,中位仍超线才回退。另一条实测教训同录:薄反例锚必须先验证「真的薄」——模板可能天然品类饱和(解谜模板曾在品类条目上拿满分),此时用合成薄壳作反例,不用模板。 **规范四:判定形态。** 纯 LLM、非阻塞、逐条给理由;绝不写成代码校验、不进九门、不进脚手架(创始人红线)。评分调用失败/超时/解析失败一律降级为「本次未评出」,不抛、不阻断生成、不进达标判定——非阻塞语义自带降级,也把错杀面封为零(评分再错也不拦游戏)。每款一次评分调用,成本占比可忽略(便宜档 <¥0.1 量级)。 **规范五:与 L1 断言的分界。** `sim-business-game-design` skill §10 曾注「4 条可机检」,这四条不同质,分两类处置:纯 code-presence 类(即时反馈/下一个解锁/音反馈——代码里存在调用 ≠ 体验成立)按红线软化为 LLM 评分维度,不落项目代码;经 H 门 assertAfterPlay 校验的 per-game 真玩断言(可见成长的 score/资源递增断言、经营的 currency 扣减断言)属 L1 机制可玩,保留为硬断言、不软化——把真玩硬证据降成软评分会削 L1 的拒发权,方向恰好反了。同名两物并存且分工明确:L1 断言判「机制上真发生」,L2 rubric 判「体验上成立、有层次」;skill §10 注记照此改口。(v2 注记:play-spec 这一断言载体随取证契约退役——已裁定,随 W-AXIS-V2 波 2 兑现;分界原则本身保留:机械可判的归地板与测试员转写,程度评价归 rubric。)2026-07-09 起这套分类学加入第三员——L1 模型玩法判定,判「作为游戏成立的**地板有无**」(broken/hollow/off-brief 三类拒绝,见裁定三):同一维度可以同时出现在 L1 判定与 L2 rubric,前者裁有无、后者评高低(例:决策层——L1 判定裁「有没有真决策」,rubric 第 12 条评「决策做得多好」),近义措辞不使 rubric 条目获得门权。 **规范六:消费点。** 分组小计消费于品类件验收与批次观测(档位观测线,§7)和回流分析(§10);逐条理由消费于品类件迭代——哪条维度长期不成立,就是品类设计 skill 或脚手架的改进信号。 ## 5 L3 留存结构 设计侧三要素,进品类设计 skill 与 rubric、生成时交付:**目标梯度**(任意时刻「下一个目标」可见:解锁阶梯、任务清单)、**难度节奏**(爽点与平台期交替;成长曲线 ×1.15/级为默认锚;卡点造「差一点」的张力、不卡死)、**回归钩子**(每日首登奖励、离线收益、限时目标,便宜档至少一种)。首 3 分钟脚本是三要素在开局的浓缩,rubric v2 单列一条。 真判在上线后,口径立到可建字段的程度:**D1 留存** = 同一 game_id 下、同一稳定玩家标识(登录取 userId,未登录取匿名设备标识)在首玩自然日(平台时区)之后的第 1 个自然日内发生 ≥1 次开局事件,按「玩家 × 游戏 × 日」去重;**完玩率** = play_end 事件中 completed 占比。现状缺口:遥测聚合表没有次留字段(数据飞轮已挂账),字段或旁路的落地设计归数据飞轮回流环设计与 telemetry 线;字段落地前,用「完玩率 + 互动率(点赞收藏 ÷ 播放)」作代理,该缺口不阻塞品类批产与反馈契约两线。运营质量分(0–100)回灌 feed 的既有机制不动,本档不碰其算法。 三个「首 X 时间」口径就此对齐,免得下游各按各的:GP2「玩家首局 30 秒体验」是产品域体验命题,本模型不收编;首局门三断言(可玩 ≤2s/首反馈即时/60s 品类闭环)是它在 L1 的机器可判子集(便宜档 v2 起断言语义迁移至测试员转写 firstPlay 三字段、独立门名退役——已裁定,随 W-AXIS-V2 波 1 兑现,见 W-AXIS-V2 plan §5);rubric「首 3 分钟脚本」是它在设计侧的结构化前奏。三者消费场景不同,时间锚不强行统一;体验效果的真判(如前 30 秒流失率)留给放量后校准。 ## 6 L4 传播钩子 三件结构要求,生成时交付:**炫耀时刻**(结算/成就画面可截图、可分享——游戏必须有结算展示场景,不是打完就黑屏)、**分享点位**(结算处一键分享,自愿不打断,与广告点位同一条体验原则)、**同款可复刻**(游戏页 remix 入口可用,是 GP10「爆款做同款」网络效应的供给侧前提;生成侧交付品类原型与主题标签元数据,供 remix 预填)。 真判 = share 事件与 remix_click/remix_submit 漏斗。本模型不改契约:share 是 telemetry 既有事件,remix 漏斗按数据飞轮已规划的增量契约落地;品类件或产品面若需新增事件,走契约变更流程(护城河与跨端契约终审)。红线一条:传播钩子是**结构要求(有没有),不是效果承诺(火不火)**。本模型保证「具备被传播的结构」;爆款是概率事件,筛选与签约(P-IPX-06)归运营,不做自动「爆火分」。 ## 7 丰富度预算档位(生效值) | 档位 | 成本红线(创始人 2026-06-25 拍) | 实测基线 | 丰富结构下限 | rubric 观测线(生效值,区间待锁) | |---|---|---|---|---| | **便宜档**(AI 低参与) | per-gen < ¥10(图/音另线) | ¥0.25–0.9/款 | 底线四件(成长轴/解锁阶梯 ≥3 级/第二动机/音反馈)+ 1 主循环 ≤2 主机制 + 首 3 分钟脚本;四件为默认底线,品类件须逐条确认可映射,映射不动的申报品类替代轴 | 品类小批(n=3–5):**L2 组均分 ≥60% 组满分**(区间 55–65% 待锁)且无恒 0 条目;L3 组 ≥2/3 成立;L4 组 ≥1/2 成立 | | **tier2**(AI 深参与) | per-gen < ¥50,目标 ≤¥3/成功款 | ¥1.29/款 | 档位通用项:≥3 个耦合子系统 + 阶段目标长线;品类结构项(现行经营件 = 资源/合成/订单三系统、双终态真可达,即富三门)由品类件承载,扩品类时由对应品类件重定义 | 品类 rubric(通用 + 品类扩展,两分母)**均分 ≥70% 满分**(区间 65–75% 待锁),品类扩展组无恒 0 条目 | 消费纪律三条,防误用。 **其一,档位线消费于品类资产验收(W-GENRE 各件 n=3–5 小批)与批次观测,不消费于单款放行**——单款放行只看 L1。线拍高最坏也只是某品类件多一轮申报,不错杀单款、不阻塞主线。 **其二,观测线是拉升目标,不是现状描述。** 现网 8 条无分组口径下 shop-serve 4.2/8、click-score 3.4/8、whack-mole 2.4/8,全部低于线;线的意义是品类件(设计 skill + few-shot 到位后)必须把分布抬上来,区间值由首批品类件回填分布后锁成单值。品类件对观测线或结构下限的品类适配走申报机制:附理由申报、创始人批;反应类等天然薄品类须同时给出替代丰富轴(连击深度、模式变体等),纯叙事/非遗类可申报以章节推进、工艺步骤解锁等替代成长轴——不许裸降。首批申报已批两件(2026-07-03,创始人授权默认项拍板):非遗类的「情感锚/放置回归」两条按替代轴判——作品集养成为情感锚的等价物,工序晾晒/窑烧类工艺周期节点为回归钩的等价物;解谜类按收集图鉴/伙伴系统为情感锚等价物,每日一题为回归钩等价物。替代轴落评分 prompt 的品类注解,通用条目文本不动,随下一轮金标复验一并验证。 **其三,预算余量优先买丰富、不买省钱。** 软脚手架数据点显示,富化把单款成本从约 ¥0.7 抬到 ¥0.85(+21%),行数 892≈890 持平——多花的钱买到的是 combo/VIP 这类玩法富化,不是代码量;绝对值距 ¥10 红线余量巨大,这笔钱该花。reskin 锁循环省成本的路线已被创始人否为越线,不回潮。 ## 8 平衡门判法:五条裁定 背景:tier2 收敛环 conditional 的失败集中在「盈利路赢不了」(经济门 profitPathWin 子检查)与「进度不成立」(H_progress),而判「平衡」这件事此前双写——静态 economyConsistent 从已落盘数据表算「数值可达」(开局金币 + 订单奖励之和 ≥ 赢线,advisory),真玩经济门把游戏真玩到 coins ≥ 阈值且 phase 为 win 且到终态(enforced)。该谁说了算、失败后反馈里该有什么,裁定五条如下(即 n=5 收敛环 runbook 的工单 F-4;下文 F-1 = 该 runbook 的富三门反馈补厚工单,F-2 = 干净复跑工单): ```mermaid flowchart LR A["agent 写玩法数值/数据表"] --> S["静态自检 economyConsistent
毫秒级 · advisory · 自检工具"] S -->|"数值差额即时提示"| A A --> P["真玩动态门(权威)
经济门 win/lose 双路 + H_progress"] P -->|"失败:数值证据反馈(F-1)
实测值 vs 期望值 + 为什么"| A P -->|"全绿"| OK["L1 放行"] ``` **其一,平衡判定的权威 = 真玩动态门,不回退静态判。** 静态「数值可达」证明不了「真玩得到」——顾客耐心、时序、操作节奏只在真玩里存在;n=5 实测的失败全部发生在静态检查之后的真玩层。真玩是生成验收阶段的权威硬证据(§9 双硬证据口径的生成侧一半),这条与防 Goodhart 红线同源。 **其二,静态判据定位 = agent 自检工具 + 反馈素材,保持 advisory,不升门。** 它确定性可算、毫秒级,适合 agent 写完数值后即时自查(省一轮约十分钟的真玩往返),也适合折进失败反馈,但永远不是放行判据。静态与真玩结论组合是诊断信号,处置固定:真玩过、静态挂 → 放行,静态差额记 warning 进观测(复核静态判据模型);真玩挂、静态过 → 失败,反馈以真玩数值为主并注明「静态认为数值可达」——问题大概率在耐心/时序/操作节奏,不在数值总量;双挂 → 失败,两组证据并喂;真玩无有效观测(探针读不到 state、驱动不到终态)→ 走 harness/driver 故障路径(E/H 门失败处理),绝不以静态判替代放行。 **其三,反馈契约:平衡门失败必须喂回数值证据,不只喂门名。** 此前 tier2 富游戏门反馈只给失败子检查名(如 profitPathWin),把 harness 已算出的具体数值(coins 终值 vs 赢线、phase、是否到终态)丢弃;便宜档九门反馈反而带 before/after/why 细节。裁定:tier2 富三门反馈对齐便宜档厚度——每个失败子检查给「实测值 vs 期望值 + 一句为什么」,静态 economyConsistent 的差额一并折进。这是收敛环 conditional 的解法(agent 层)在判法侧的落点。两级验收别混:F-1 的「自修通过 ≥2 例」证的是反馈契约生效;tier2 的 go/no-go 仍以 F-2 干净复跑与收敛环判定为准,前者不替代后者。 **其四,平衡的「调」永远是 agent 的玩法职责,工具层不代调。** 不做数值模板、不补平衡骨架(创始人 2026-06-29 裁定);工具层的全部义务 = 把「为什么不平衡」讲清(其三)。判法不变、反馈变厚。 **其五,赢线双源分工,agent 只调自己那一半。** 「赢」有两个数:游戏内赢条件(agent 数据表里的目标值)是玩法设计职责,agent 可调;验收外生赢线(品类金标 play-spec 里的门槛)是验收基准,由品类件与档位表锚定,agent 不可调、也不该看着它反向凑数。真玩经济门要求两者同时成立(真玩到游戏内赢态、且量级过验收线),因此失败反馈必须同时暴露三个数——实测终值、游戏内赢线、验收外生线;agent 若把游戏内赢线设得低于验收地板,反馈应直接指出这个结构性错配,而不是让它对着改不动的阈值空转。 ## 9 分数量纲与防 Goodhart 纪律 ```mermaid flowchart LR R["rubric 分 0–N
生成侧局部量纲"] --> C1["品类件验收 · 批次观测 · 回流分析"] G["生成质量分 0–1
aigc 域"] --> C2["生成域内部"] Q["运营质量分 0–100
telemetry→feed"] --> C3["feed 排序"] D["D11 就绪分 0–100
治理观测件"] --> C4["开闸治理看板"] R -.禁止换算互灌.- G G -.禁止换算互灌.- Q ``` 量纲纪律:既有双量纲锁死不动——生成质量分(0–1,aigc 域)与运营质量分(0–100,telemetry→feed)不可互相回灌(`contracts/README.md` 双量纲红线);rubric 分(0–N)是生成侧局部量纲,只在品类验收、批次观测、回流分析消费,禁止换算回灌进前两者;**不新造统一「质量总分/爆火分」**。D11 就绪分(0–100,开闸治理观测件)的权重(playability 0.5/firstPlay 0.25/stability 0.15/efficiency 0.1)自本档起归质量轨管辖:放量前的起步值仍由生产 cutover plan 落定(其部署步已在修 efficiency 维 BUDGET_RMB 与便宜档实际成本的错配,该项列为质量轨接管后的首个复核件);放量后第一轮校准见 §10。 防 Goodhart 三条,贯穿全模型:**L2–L4 分数一律非阻塞**——任何丰富/留存/传播分都不得升为拒发门,升门动议须回本档改 SoT 并过创始人;**真玩与真实玩家数据是仅有的两种「硬」证据,且真玩证据必须被判读**——设计侧一切 LLM 评分都是软信号;机械断言对真玩证据的解读同样会空心(2026-07-09 实证:score-only pass 五案),所以 L1 的判读自裁定三起是「机械预筛 ∧ 独立模型判定」双份,单独哪一份都不许自称完整硬证据;**「好玩」的终审归人**(审核台与创始人抽玩)。rubric 被 Goodhart 或评分漂移的兜底与此同构:非阻塞设计把错杀面封为零,金标锚定 ±1 回退管住漂移,放量后真数据校准是最终纠偏——若 rubric 分与留存相关性为零或负,重审 rubric 维度,回滚面只在 rubric 文本与评分 prompt,不伤门与代码。 ## 10 生效、校准与升级路径 生效态分三层:四层定义与权力分配、两条 L1 口径裁定、五条平衡门裁定即日生效;档位观测线以草案值生效(便宜档 L2 组均分 ≥60%、tier2 均分 ≥70%),区间(55–65%/65–75%)由首批品类件回填分布后锁成单值;rubric 通用底座 v2 的新增 3 条判据文本标草案,随首个品类件落地验证后确认或修订。 放量后第一轮校准归质量轨:回流环设计产校准单、opus 执行;输入 = 放量后足量样本(起步 ≥100 款)的 rubric 分组小计 × 留存真数据,含 D11 efficiency 维错配复核;判定 = 相关性方向为正,样本不足或回归不显著则维持占位值再观测一期;D11 权重变更整体可回退上一版(D11 只观测不拦,回退零风险)。此后一切档位线、rubric 维度、D11 权重的修订都走同一条路:质量轨提案,即[数据飞轮](数据飞轮.md)回流环的校准单机制——不在现场拍脑袋改阈值;L2–L4 任何升门动议同样须回本档改 SoT 并过创始人。 下游三线从本档直接开工,不再各自发明标准:W-GENRE 品类件照 §4 规范产 rubric、按 §7 档位观测线验收;tier2 富三门反馈契约照 §8 补厚(裁定即可执行,不依赖档位数值);数据飞轮与 telemetry 线照 §5 口径立留存字段。