lili cbfd4d871b
Some checks failed
contract-gates / contract-gates (push) Has been cancelled
docs-gate / docs-gate (push) Has been cancelled
feat(acceptance): 闭合 playtest v3 与 A+ 可信消费链
固化 Match-3 生产者、视觉、音频与双 Judge 证据闭包。

将《山海行纪》r1.1 绑定新的不可变 release,并以生产预检现场核验 bundle、Registry/2 和 25 项 Writer 快照。

同步地图1平衡锁值、跨游戏回归修复、验收契约与 SoT 证据。
2026-07-28 20:16:13 -07:00

41 KiB
Raw Permalink Blame History

topic, canonical, date
topic canonical date
游戏质量与爆火能力 true 2026-07-02

游戏质量与爆火能力:四层质量模型

四层质量塔

生效状态:本模型经 Codex + Opus 双评审后,由创始人 2026-07-02 以决策包⑦一次拍定生效——四层定义与权力分配、档位观测线、rubric 计分制、平衡门判法五裁定、「收窄 AE」历史化、富三门档位适用与断言分界、D11 权重管辖移交,七项俱批;档内数值草案即生效值,观测线区间待首批品类件回填分布后锁成单值(§10)。2026-07-03 通用底座增补第 12 条口径(「核心操作非无脑」,L2 满分升至 12),图 1 底部明细带按 L2 7 / L3 3 / L4 2 分组列全。设计留痕 = docs/agent-specs/2026-07-02-游戏质量与爆火能力-设计.md

2026-07-09 修订(创始人当日拍板):L1 的证据构成升级——机械门降位为「未见明显死」预筛,独立模型对真玩证据的玩法判定升为阻断,合称 L1 双证据口径(裁定三,§3)。依据是当日五路 harness 审计坐实的三处病根:机械门的玩法语义已空心化(现存五份 verdict 仅凭 score 单调上升即 pass、终态闭环降 advisory)、判卷合约失败被误标为玩法失败、链路真相层缺失(诊断档 = docs/brainstorms/2026-07-09-生成线harness方向性诊断与换轴方向.md)。修订面 = §2 表格与权力宪法第一条、§3 裁定三、§9 防 Goodhart 第二条;L2L4 分数一律非阻塞的纪律不变——升级的是 L1 自身的证据,不是把丰富度分数变成门。

2026-07-15 修订(W-AXIS-V3,工程门已绿、模型校准阻断):playtest/3 将便宜档 L1 收敛为“四门地板 ∧ 品类闭环硬证 ∧ 双 Judge 保守共识 ∧ finalPostguard”。Actor 只从 VisualTargetSet/1 选择目标runner 解析坐标并用受控虚拟时间封存动作后画面与 game/* 业务事件Judge A/B 在独立会话中只读同一证据包,分歧只能得到 inconclusive 或 tester_error不能单槽降级。结果固定为 accept/reject/inconclusive/tester_error,只有双槽一致硬证证明的 reject 可自动修一次;证据不足、矛盾或仪器错误不修游戏。四类确定性 harness 假阴已修,但最新真模型仍为 Actor 3/5、Judge A 5/6、Judge B 4/6同一 M3 的相关偏置尚未消除。playtest/2 冻结只读,生产回滚只能退到冻结发布的 v3_shadow;未过专项门不能放量。

2026-07-22 修订(四类资产与金标消费口径,创始人拍板):生成与评测链中可复用的校准/参照资产按消费角色拆成四类——harness_fixture(验收夹具)/prompt_eval_gold(校准正反例)/generation_exemplar(生成范例)/game_content_gold(游戏内容金标)。它们分别校工具、校裁判、引导生成器、提供完整内容参照,不得混用。一次性生成 run 另进样本账,不属于四类。四类都不是生成成功率的独立真实样本,一律不进分母;只有 game_content_gold 承担完整游戏内容金标身份,内容契约=产品域 canonical《游戏内容金标》(GameContentGold/1 九维)。依据是 2026-07 五款 Match-3 校准夹具被误当金标候选:工程合规过门≠游戏内容金标。分类与分母口径见 §11,内容契约与资产分类账见产品域《游戏内容金标》。

质量不是一个分,是四层递进的塔:机器门保「能玩」(L1,质量分层内唯一拒发权),LLM 评「有料」(L2),结构要求保「想再玩」(L3)与「想传出去」(L4)的前提;玩家真实数据是 L3/L4 的最终裁判,并回流校准 L2L4 评分与 D11 权重。本档立标准、判定归属与数值档位,是 W-GENRE 品类件 rubric、tier2 富三门反馈契约、数据飞轮留存口径的共同上位标准。它不重定义九门/富三门/首局门的具体判据(判据 SoT 仍是验收门,本档只裁消费口径),不建留存/传播数据的采集管道(归 telemetry 线与数据飞轮回流环),不替 agent 调平衡数值,不写各品类的完整 rubric(归 W-GENRE 品类件),不造统一「质量总分/爆火分」或任何自动爆火门,也不改开闸六门的治理设计(仅接管其中 D11 就绪分的权重管辖)。

1 命题与实证:为什么「过九门」不够

命题来自创始人两条既有裁定:「轻量≠简单——便宜档是低成本生成相对不复杂、又不易同质化的高质小游戏,不是产没人会玩的简单玩具」(agentic运行时架构图说 §4.1);「便宜 = LLM 低参与度,不是游戏低质量,游戏底线 = 2D 丰富游戏(进货/解锁/成长/音乐/丰富玩法)」(创始人纠正,记于 docs/agent-specs/2026-06-29-便宜档降AI参与-减摩擦与扩模板覆盖-设计.md §6)。这不只是生成线的事:feed 分发的游戏若普遍单薄,推荐、广告、remix 同款这三条变现与增长线全部失去弹药——爆火能力是平台命题。

分层的必要性有三个实证。第一,「过九门 ≠ 好玩」已被现网数据坐实:M1 达标 bake-off 三品类 15/15 全过九门,但丰富度评分(旧 8 条口径,满分 8)均分只有 whack-mole 2.4、click-score 3.4、shop-serve 4.2。机器门保「能玩、玩得通」,对「有料、耐玩」不设防,也不该设防——判「有料」超出确定性信号的能力边界;缺的不是把九门加严,而是九门之上的分层标准。第二,质量概念此前散落、无上位标准:D11 就绪评分的权重自标占位待校准;丰富度清单已实装但只观测;GP12 王蓝莓黄金标尺、GP2 首局 30 秒、「完玩率 + 次日留存」散在产品域各处;W-GENRE 品类件的 rubric 明文一直在等上位标准,先批产会返工。第三,平衡门判法此前双写悬而未裁:判「平衡」一静一动两套(静态数值可达检查 advisory、真玩经济门 enforced),该谁说了算、失败后反馈里该有什么,tier2 n=5 收敛环 runbook(docs/plans/2026-06-28-002-feat-tier2-n5收敛环-go-no-go-plan.md,工单 F-4)明文挂到本模型一并裁定(§8)。

2 四层总览与权力分配

回答 判定者 量纲 权力 消费者
L1 机制可玩 能玩、玩得通吗 双证据:机器预筛(便宜档 = 契约无关四门投影 A_boot/B_uncaught/C_frame/D_render;tier2 = 九门 + 富游戏三门) 玩法地板判定(便宜档 = playtest/3 结构化视觉操作 + 硬证 + 双 Judge 共识 + finalPostguard校准阻断tier2 现 = 富三门双路) accept/reject/inconclusive/tester_error;仅 accept 通过 质量分层内唯一拒发权 生成环放行、生产复验
L2 内容丰富 有料、耐玩吗 LLM 验证 agent 按品类 rubric,非阻塞 逐条 0/1 + 分组小计 观测 + 批次验收线,不拦单款 品类件验收、批次观测、回流分析
L3 留存结构 想再玩的结构前提在吗 生成时 rubric 留存组;上线后玩家真数据 rubric 分;运营 0100 观测;真数据经 quality_score 影响分发 feed 排序、数据飞轮
L4 传播钩子 想让别人看的结构前提在吗 生成时 rubric 传播组;上线后 share/remix 漏斗 rubric 分;漏斗率 观测;爆款筛选归运营 remix 网络效应、爆款签约(P-IPX-06)

层间纪律三条,是整个模型的权力宪法。

质量侧的发布权只在 L1。 一款游戏能不能进 feed,质量分层内由 L1 说了算,L2L4 任何分数都不拦发布。L1 自身的证据构成 2026-07-09 起为双份:机械真玩预筛是地板(挡明显死:起不来、抛异常、不渲染、不掌帧),独立模型对真玩证据的玩法判定是裁决(能玩到终局吗、核心操作有真决策吗、切 brief 的题吗)。这样改的原因写在裁定三:机械断言曾被当成「可玩」的完整证据,实测它只证得了「有东西在涨」,秒死、刷分、死锁、永不结束的游戏都能空心过门——把发布权全押在它上面,恰好造出了另一种 Goodhart(游戏围着盲驱动器的盲区设计)。原防 Goodhart 红线本身不动:LLM 的丰富度/留存/传播评分仍是软信号、永不拿拒发权;玩法判定不是评分——它裁的是地板的有无(玩得通吗/有决策层吗/切题吗),不是程度的高低(丰富、耐玩、好玩到什么程度——那些永远归 L2 软信号),与机械预筛同属 L1,受金标校准与人工抽检约束。发布链上另有治理拒发权(GP9 合规、D12 控制平面),在本模型之外、不受本档约束。

推荐权在真数据。 玩家行为聚合成运营质量分(0100)回灌 feed 决定「值不值得推」;生成侧 rubric 分只影响批次改进与回流分析,不直接改 feed 排序。

「好玩」的终审归人。 审核台人工终审保留,自动分只辅助排序与抽样。

另有一条贯穿 L3/L4 的诚实边界:设计侧 rubric 只测「结构存在性」(钩子在不在),它与真实留存/传播效果的相关性要到放量后校准(§10)才被验证;验证之前,L3/L4 分不得当作效果预测使用。

一处必须消歧:仓内有两套「门」。真玩九门(A_boot…I_control,harness 真玩判)是验收面;开闸六门(D12 控制平面/GP9 合规/9d trace/D11 就绪分/D9 反同质化/首局体验)是放量治理面。本模型的 L1 指前者加富游戏三门与首局门(便宜档 v2 机械取值收敛为契约无关四门投影,见裁定一 2026-07-10 追补——已裁定,随 W-AXIS-V2 波 1/2 兑现);开闸六门不属质量分层,其中与质量相关的观测件 D11 就绪分,权重管辖自本档定稿起归质量轨(§9)。

3 L1 机制可玩:唯一拒发权与两条口径裁定

判据本体在验收门,本档不重抄:九门 = 客观健康门 A_boot/B_uncaught/C_frame/D_render/E_live 加 driver 依赖门 F_wiring/G_input/H_progress/I_control,真玩驱动、CDP 探针、零 LLM(便宜档 v2 消费取值收敛为契约无关四门投影,见裁定一 2026-07-10 追补——已裁定,随 W-AXIS-V2 波 1/2 兑现);富游戏三门 = tier2 多系统档专属(三联动/经济/latch);首局门 = H 门的 additive 派生超集(可玩 ≤2s/首反馈即时/60s 品类闭环),FAIL 不推翻 H。定稿时点的现状:便宜档 M1 三品类 15/15 达标;tier2 收敛环 conditional,卡在经济门与 H_progress——判法与反馈的解法见 §8。

裁定一(消费口径):driven 时九门全量 AND 为机械层取值口径,「收窄 AE」历史化;2026-07-09 起该口径的通过 = 预筛通过,不再单独构成 L1 通过(见裁定三)。 验收门 §2.4 曾记「生成环消费从九门全过收窄成只认 AE,G/H/I 降参考,F_wiring 改 VLM 判」——那是 gamedef 时代 driver 缺失、G/H/I 不可靠时的消费策略。现行便宜档在门跑前自动生成 play-spec 使 driven=true、九门全部致命,cheap 与 tier2 的判据代码都认九门全量与富门,M1 达标 15/15 正是这个口径。据此裁定:driven 时九门全量 AND 为机械层现行取值口径(自裁定三起它构成 L1 的预筛半,另一半 = 独立模型玩法判定);undriven 时 E_live/H_progress 自动降 advisory 的分级保留在 harness(已实装);「收窄 AE」条款自本档定稿起历史化,消除文档-代码漂移,存量引用面随收口逐一改注,此后再发现的引用面一律改该处引用、不回改本裁定。F_wiring 保持机器硬门;VLM 视觉效果评分归 L3 视觉软检,永远软——它与裁定三的玩法判定(布尔裁决、阻断)是两物,别混。2026-07-10 起『driven 时九门全量 AND』口径仅存于 tier2 与历史复跑;便宜档机械取值 = 从 verdict.guards 显式抽取的契约无关四门投影(G/I 在 undriven 下恒 skip-pass、E/H 降 advisory、F 期望集随 play-spec 退役,均不进取值)——四门投影是消费层函数,不等于也不改写 harness 原生 verdict.pass(见裁定三 2026-07-10 修订;已裁定,随 W-AXIS-V2 波 1/2 兑现)。

裁定二(富三门档位适用):富游戏三门只随「多系统富游戏」档位走(现为 tier2 经营类)。便宜档经营品类的进度判定曾 = occupied 反应族驱动 + score 递增断言(历史口径:2026-07-10 起该判定手段随取证契约退役,进度证据改由测试员转写承担——已裁定,随 W-AXIS-V2 波 1/2 兑现),且不引入 tier2 经济平衡门(盈利/破产双路判)——单循环游戏没有「经济死局」问题,把它强推到便宜档,是给 L1 加不属于该档位的判据。这里要分清「门」与「断言」两个层次:play-spec 里经 H 门校验的 per-game 真玩断言(score 递增,以及游戏含消费扣减时的 currency 扣减断言)是便宜档 L1 的正当判据,照常使用;本裁定挡的是门级判据跨档,不是禁用某类断言(断言与 rubric 的分界见 §4 规范五)。两档判据差异是档位事实,不是待统一的债。

裁定三(2026-07-09,L1 双证据口径):机械门降位为预筛,独立模型玩法判定升为阻断,两者相与才是 L1 通过。 依据是当日五路 harness 审计:九门里唯一带玩法语义的 H_progress 实测退化成「score 单调上升」,终态闭环 latch 在「有进展」时一律降 advisory,现存五份 pass verdict(hard-heritage/hard-trpg/hard-idle-sim/c2v-1/c2v-3)全部仅凭 score↑ 过门——机械断言证得了「有东西在涨」,证不了「人能玩通」;而系统提示为让盲驱动器能跑,曾教模型把计分结构围着验收器的盲区设计(「两层奖励」条款),机械门独裁的后果正是它自己被 Goodhart。据此裁定四条:其一,机械真玩链(九门/富三门/首局门)语义降位为「未见明显死」的预筛地板,driven 时仍按裁定一全量 AND 取值,但其通过不再单独构成 L1 通过,verdict 的对外语义随之改名(预筛通过 ≠ 验收通过)。2026-07-10 再修订(W-AXIS-V2):便宜档机械预筛收敛为契约无关四门投影(A_boot/B_uncaught/C_frame/D_render,消费层从 guards 显式抽取,权威字段 floor,不复用 harness 原生 verdict.pass);F_wiring 的期望前缀集源自 play-spec,随契约退役降观测,『真接线』关切移交 check 静态层与测试员观察;E_live/G_input/H_progress/I_control 退出便宜档验收取值(判据代码保留、降观测)。依据是 2026-07-10 基线逐局破案:取证契约实现缺陷在 25 局里坑杀 2 局好游戏、误导续修每局烧 ¥10+,契约面最大的品类失败最集中(执行与证据 = W-AXIS-V2 plan;已裁定,随其波 1/2 兑现);其二,新增独立模型玩法判定,输入 = brief 加真玩证据链;v2 起证据由测试 agent 亲手真玩产生(视觉引导逐步操作的全程截图序列、行动转写、运行日志),取证状态时间线随 _forensicsView 契约退役不再作判定输入——判定与真玩合一于测试 agent,其裁决即玩法判定半,三类拒绝与『判有无不判多好』分界不变(已裁定,随 W-AXIS-V2 波 1/2 兑现)。产出 = 布尔裁决加逐条理由,阻断放行,理由原文回喂续修——出题≠被考的实质 = 判定只吃运行证据、不吃生成 agent 的自报,且测试员与写手会话隔离;判定模型允许与生成同源(2026-07-10 创始人拍板切 MiniMax-M3)——地板布尔判『有无』使同源盲区风险最小,同源模型抓自家缺陷已有实证(spike 考卷 8undefine 案);残余风险由金标正反例复验与创始人抽玩兜底,动因:glm-5.2 唯一供给通道为二手中转,图像支持按池轮换、2026-07-09 整日全盲,判定层可用性不押注二手供给。玩法判定只裁地板布尔,分界钉死:它的三类拒绝 = broken(真人玩不通/到不了终局)、hollow(空壳——核心循环不存在决策层,判「有没有」、不判「做得多好」)、off-brief(不切题);凡「多丰富/多耐玩/多好玩」的程度问题一律归 L2 rubric 非阻塞——同一维度在两层各管一半:L1 判定裁「有无」(如:决策层存在吗),L2 rubric 评「高低」(如:rubric 第 12 条评决策做得多有层次),谁想把某条 rubric 升成门,仍须回本档改 SoT 并过创始人,近义措辞不构成升门依据;其三,判定失败或评不出一律 fail-closed:不放行、标 degraded、入人工复核队列,人可放行——绝不静默降级成自动通过;其四,判定的校准纪律与 rubric 同构:每品类金标正反例复验、漂移超线先复采样再回退,创始人抽玩是最终校准锚,判定阻断带配置开关可整体回退到修订前口径。落地范围:模型判定先在便宜档生效(执行 = W-AXIS 换轴 plan 波 2);tier2 的玩法地板现由富三门双路真玩承担——其经济双路(赢得了且输得了且都到终态)正是「地板布尔」的机械对位物——tier2 是否叠加模型判定,随便宜档校准结果另议,在此之前 §2 表行的「模型判定」对 tier2 读作「富三门双路」。失败归因随本裁定分三层——判卷驱动器合约失败(取证不完整;v2 起该层随契约退役自然消亡,存量归因保留历史语义,新增 tester_degraded = 测试员评不出、fail-closed 待人工)、机械门失败(代码/运行缺陷)、玩法判定失败(设计缺陷)——回喂反馈必须按真实层次措辞,不得再把合约缺口说成「玩法坏死」。

裁定三补充(2026-07-13,W-AXIS-V3):“独立模型玩法判定”拆成 Actor、Judge、finalPostguard 三席。 Actor 不再持裁决权,其推理与 why 不进入事实历史;runner 只按动作因果窗口保存 post screenshot 与完整 game/* delta;Judge 会话、提示、上下文投影与生成/Actor 物理隔离,只做语义判读;rollGuard 产单掷结果,merge 只产候选,finalPostguard 唯一写最终结果和兼容字段。reject 只用于硬证已证明的可复现产物缺陷,可自动修一次;合法证据不足或矛盾为 inconclusive,验收器/图像/环境错误为 tester_error,二者都不修游戏。任何非 accept 结果即使 D11 观测分较高也不得发布。

4 L2 内容丰富:rubric 体系

rubric 计分制与 F-4 平衡门五裁定

质量模型有两条「怎么判」的主线,这张图把它们并排摊开。左半是 L2L4 内容质量的 rubric 计分制:每条 rubric 记 0/1 加一句理由,一次评分同时产 L2 丰富、L3 留存、L4 传播三个分组小计,不合成单一总分(单一总分会诱导 Goodhart),通用底座 12 条与品类扩展 ≥4 条两个分母分开、不混合平均;评分纯 LLM、非阻塞,失败即降级为「本次未评出」、绝不拦游戏。底下高亮的复采样纪律是这套软评分的确定性锚——金标正反例复验,单款分组小计漂移超 ±1 才回退,而回退前先对同一输入复采样 ≥3 次取中位,免得把 LLM 固有的采样噪声误判成漂移。右半是 L1 经济平衡的 F-4 五裁定:agent 写完数值先过毫秒级的静态 economyConsistent 自检(只作提示、永不放行),真正说了算的是把游戏真玩到终态的动态门;门一旦失败,反馈必须带上实测终值、游戏内赢线与验收外生线三个数,而不是只丢一个门名。两条主线一软一硬——rubric 是软信号只供观测,平衡门是真玩硬证据、握 L1 唯一拒发权;共同的纪律都是用确定性锚点把 Goodhart 与评分漂移封死。§8 正文的平衡门流程与本图右半同源,判法细节以那五条裁定为准。

丰富有一条结构底线,便宜档也必须有,这是创始人「2D 丰富游戏」裁定的工程化:成长轴(数值或等级)、解锁阶梯(≥3 级,任意时刻可见下一个)、收集/装饰或等价第二动机音反馈。这四件是生成 agent 在设计阶段的交付物(品类设计 skill 的职责),不是九门判据——丰富的「生成」归生成 agent,丰富的「校验」归 LLM 验证 agent,两边都不落项目代码。

计分制先立住:每条 rubric 记 0/1(成立/不成立),逐条给一句理由;条目按层标注(L2/L3/L4),一次 LLM 评分同时产出三个分组小计(L2 丰富小计/L3 留存结构小计/L4 传播结构小计),不另起三套评分,也不设单一总分——单一总分好看,但会诱导 Goodhart;分组小计才对得上三层各自的消费点。通用底座与品类扩展分母分开,不混合平均。每条 rubric 的最小形状 = 编号/层标/一句可判定的判据/一对正反例;品类件照这个形状产条目,评分 agent 照它出「逐条判定 + 理由 + 三组小计」。

规范六条,W-GENRE 品类件照此产 rubric:

规范一:通用底座 v2 = 11 条,已实装为现网评分尺。 原 8 条(即时反馈/可见成长/下一个解锁/30 秒爽点/数值滚雪球/情感锚/放置回归/音反馈,与 .agents/skills/sim-business-game-design.md §10 同源)加新增 3 条:L3「首 3 分钟脚本成立:010s 零阅读上手/1060s 首次升级/13min 露出 23 个后续锁」、L4「炫耀时刻:有可截图分享的结算/成就画面,不是打完就黑屏」、L4「同款钩子:品类原型 + 主题标签元数据可供 remix 预填」。分组归属:L2 = 即时反馈/可见成长/30 秒爽点/数值滚雪球/情感锚/音反馈共 6 条,L3 = 下一个解锁/放置回归/首 3 分钟脚本共 3 条,L4 = 炫耀时刻/同款钩子共 2 条。这 11 条已随 cheap-worker/cheap_verify.py 的 RICHNESS_CHECKLIST(commit ba82e63c)实装为便宜档丰富度验证 agent 的评分尺并落库三分组小计;实装遵守锚定纪律——原 8 条判据文本与顺序一字不改,新增 3 条追加于末尾,层标只是聚合归属、不改原条目的判据本身。新增 3 条的判据文本仍标草案,随首个品类件落地验证后确认或修订(修订须金标复验)。

2026-07-03 增补第 12 条,通用底座随之为 12 条口径:「核心操作非无脑」,层标 L2。判据:每次主操作含真实决策或技巧含量、判错有真代价,不是点了就自动结算;正例 = 顾客上门先看要什么再决定补哪种货,补错压库存;反例 = 点哪里都加分、无判断成分的挂机点击。该条源自便宜档主 prompt 自检第 ⑨ 条(策划知识包 v2 的否决项判定句式),升为评分尺条目;创始人 2026-07-03 授权按默认项拍板采纳。分组归属随之 L2 = 7 条、通用底座满分 12;档位观测线(§7)的百分比线不变,分母随升。实装遵守锚定纪律:追加于清单末尾、既有 11 条一字不动;落 RICHNESS_CHECKLIST 与金标复验同批执行,复验漂移超线按规范三处置。

规范二:品类扩展 ≥4 条。 每品类另加品类特有维度(经营范例:进货补货循环成立/客流节奏有紧张感/双货币分工明确/卡点「差一点」不卡死;其余品类由各品类件提出),同一字段形状、同样标层,分母独立小计。

规范三:锚定纪律。 每品类 ≥1 金标正例 + ≥1 薄反例;rubric 文本或评分 prompt 变更必须金标复验,单款分组小计漂移超 ±1 即回退。LLM 裁判的漂移用确定性锚点治,不用另一个 LLM 治。复采样定性补一条(2026-07-03,rubric 挂点归一单实测沉淀):复验遇漂移超 ±1,先同输入复采样 ≥3 次取中位再判——LLM 裁判对逐字节相同的输入,单次采样命中数差可达 3,属固有噪声;prompt 逐字节未变可机器证明时,不据单样本判回退,中位仍超线才回退。另一条实测教训同录:薄反例锚必须先验证「真的薄」——模板可能天然品类饱和(解谜模板曾在品类条目上拿满分),此时用合成薄壳作反例,不用模板。

规范四:判定形态。 纯 LLM、非阻塞、逐条给理由;绝不写成代码校验、不进九门、不进脚手架(创始人红线)。评分调用失败/超时/解析失败一律降级为「本次未评出」,不抛、不阻断生成、不进达标判定——非阻塞语义自带降级,也把错杀面封为零(评分再错也不拦游戏)。每款一次评分调用,成本占比可忽略(便宜档 <¥0.1 量级)。

规范五:与 L1 断言的分界。 sim-business-game-design skill §10 曾注「4 条可机检」,这四条不同质,分两类处置:纯 code-presence 类(即时反馈/下一个解锁/音反馈——代码里存在调用 ≠ 体验成立)按红线软化为 LLM 评分维度,不落项目代码;经 H 门 assertAfterPlay 校验的 per-game 真玩断言(可见成长的 score/资源递增断言、经营的 currency 扣减断言)属 L1 机制可玩,保留为硬断言、不软化——把真玩硬证据降成软评分会削 L1 的拒发权,方向恰好反了。同名两物并存且分工明确:L1 断言判「机制上真发生」,L2 rubric 判「体验上成立、有层次」;skill §10 注记照此改口。(v2 注记:play-spec 这一断言载体随取证契约退役——已裁定,随 W-AXIS-V2 波 2 兑现;分界原则本身保留:机械可判的归地板与测试员转写,程度评价归 rubric。)2026-07-09 起这套分类学加入第三员——L1 模型玩法判定,判「作为游戏成立的地板有无」(broken/hollow/off-brief 三类拒绝,见裁定三):同一维度可以同时出现在 L1 判定与 L2 rubric,前者裁有无、后者评高低(例:决策层——L1 判定裁「有没有真决策」,rubric 第 12 条评「决策做得多好」),近义措辞不使 rubric 条目获得门权。

规范六:消费点。 分组小计消费于品类件验收与批次观测(档位观测线,§7)和回流分析(§10);逐条理由消费于品类件迭代——哪条维度长期不成立,就是品类设计 skill 或脚手架的改进信号。

5 L3 留存结构

设计侧三要素,进品类设计 skill 与 rubric、生成时交付:目标梯度(任意时刻「下一个目标」可见:解锁阶梯、任务清单)、难度节奏(爽点与平台期交替;成长曲线 ×1.15/级为默认锚;卡点造「差一点」的张力、不卡死)、回归钩子(每日首登奖励、离线收益、限时目标,便宜档至少一种)。首 3 分钟脚本是三要素在开局的浓缩,rubric v2 单列一条。

真判在上线后,口径立到可建字段的程度:D1 留存 = 同一 game_id 下、同一稳定玩家标识(登录取 userId,未登录取匿名设备标识)在首玩自然日(平台时区)之后的第 1 个自然日内发生 ≥1 次开局事件,按「玩家 × 游戏 × 日」去重;完玩率 = play_end 事件中 completed 占比。现状缺口:遥测聚合表没有次留字段(数据飞轮已挂账),字段或旁路的落地设计归数据飞轮回流环设计与 telemetry 线;字段落地前,用「完玩率 + 互动率(点赞收藏 ÷ 播放)」作代理,该缺口不阻塞品类批产与反馈契约两线。运营质量分(0100)回灌 feed 的既有机制不动,本档不碰其算法。

三个「首 X 时间」口径就此对齐,免得下游各按各的:GP2「玩家首局 30 秒体验」是产品域体验命题,本模型不收编;首局门三断言(可玩 ≤2s/首反馈即时/60s 品类闭环)是它在 L1 的机器可判子集(便宜档 v2 起断言语义迁移至测试员转写 firstPlay 三字段、独立门名退役——已裁定,随 W-AXIS-V2 波 1 兑现,见 W-AXIS-V2 plan §5);rubric「首 3 分钟脚本」是它在设计侧的结构化前奏。三者消费场景不同,时间锚不强行统一;体验效果的真判(如前 30 秒流失率)留给放量后校准。

6 L4 传播钩子

三件结构要求,生成时交付:炫耀时刻(结算/成就画面可截图、可分享——游戏必须有结算展示场景,不是打完就黑屏)、分享点位(结算处一键分享,自愿不打断,与广告点位同一条体验原则)、同款可复刻(游戏页 remix 入口可用,是 GP10「爆款做同款」网络效应的供给侧前提;生成侧交付品类原型与主题标签元数据,供 remix 预填)。

真判 = share 事件与 remix_click/remix_submit 漏斗。本模型不改契约:share 是 telemetry 既有事件,remix 漏斗按数据飞轮已规划的增量契约落地;品类件或产品面若需新增事件,走契约变更流程(护城河与跨端契约终审)。红线一条:传播钩子是结构要求(有没有),不是效果承诺(火不火)。本模型保证「具备被传播的结构」;爆款是概率事件,筛选与签约(P-IPX-06)归运营,不做自动「爆火分」。

7 丰富度预算档位(生效值)

档位 成本红线(创始人 2026-06-25 拍) 实测基线 丰富结构下限 rubric 观测线(生效值,区间待锁)
便宜档(AI 低参与) per-gen < ¥10(图/音另线) ¥0.250.9/款 底线四件(成长轴/解锁阶梯 ≥3 级/第二动机/音反馈)+ 1 主循环 ≤2 主机制 + 首 3 分钟脚本;四件为默认底线,品类件须逐条确认可映射,映射不动的申报品类替代轴 品类小批(n=35):L2 组均分 ≥60% 组满分(区间 5565% 待锁)且无恒 0 条目;L3 组 ≥2/3 成立;L4 组 ≥1/2 成立
tier2(AI 深参与) per-gen < ¥50,目标 ≤¥3/成功款 ¥1.29/款 档位通用项:≥3 个耦合子系统 + 阶段目标长线;品类结构项(现行经营件 = 资源/合成/订单三系统、双终态真可达,即富三门)由品类件承载,扩品类时由对应品类件重定义 品类 rubric(通用 + 品类扩展,两分母)均分 ≥70% 满分(区间 6575% 待锁),品类扩展组无恒 0 条目

消费纪律三条,防误用。

其一,档位线消费于品类资产验收(W-GENRE 各件 n=35 小批)与批次观测,不消费于单款放行——单款放行只看 L1。线拍高最坏也只是某品类件多一轮申报,不错杀单款、不阻塞主线。

其二,观测线是拉升目标,不是现状描述。 现网 8 条无分组口径下 shop-serve 4.2/8、click-score 3.4/8、whack-mole 2.4/8,全部低于线;线的意义是品类件(设计 skill + few-shot 到位后)必须把分布抬上来,区间值由首批品类件回填分布后锁成单值。品类件对观测线或结构下限的品类适配走申报机制:附理由申报、创始人批;反应类等天然薄品类须同时给出替代丰富轴(连击深度、模式变体等),纯叙事/非遗类可申报以章节推进、工艺步骤解锁等替代成长轴——不许裸降。首批申报已批两件(2026-07-03,创始人授权默认项拍板):非遗类的「情感锚/放置回归」两条按替代轴判——作品集养成为情感锚的等价物,工序晾晒/窑烧类工艺周期节点为回归钩的等价物;解谜类按收集图鉴/伙伴系统为情感锚等价物,每日一题为回归钩等价物。替代轴落评分 prompt 的品类注解,通用条目文本不动,随下一轮金标复验一并验证。

其三,预算余量优先买丰富、不买省钱。 软脚手架数据点显示,富化把单款成本从约 ¥0.7 抬到 ¥0.85(+21%),行数 892≈890 持平——多花的钱买到的是 combo/VIP 这类玩法富化,不是代码量;绝对值距 ¥10 红线余量巨大,这笔钱该花。reskin 锁循环省成本的路线已被创始人否为越线,不回潮。

8 平衡门判法:五条裁定

背景:tier2 收敛环 conditional 的失败集中在「盈利路赢不了」(经济门 profitPathWin 子检查)与「进度不成立」(H_progress),而判「平衡」这件事此前双写——静态 economyConsistent 从已落盘数据表算「数值可达」(开局金币 + 订单奖励之和 ≥ 赢线,advisory),真玩经济门把游戏真玩到 coins ≥ 阈值且 phase 为 win 且到终态(enforced)。该谁说了算、失败后反馈里该有什么,裁定五条如下(即 n=5 收敛环 runbook 的工单 F-4;下文 F-1 = 该 runbook 的富三门反馈补厚工单,F-2 = 干净复跑工单):

flowchart LR
  A["agent 写玩法数值/数据表"] --> S["静态自检 economyConsistent<br/>毫秒级 · advisory · 自检工具"]
  S -->|"数值差额即时提示"| A
  A --> P["真玩动态门(权威)<br/>经济门 win/lose 双路 + H_progress"]
  P -->|"失败:数值证据反馈(F-1)<br/>实测值 vs 期望值 + 为什么"| A
  P -->|"全绿"| OK["L1 放行"]

其一,平衡判定的权威 = 真玩动态门,不回退静态判。 静态「数值可达」证明不了「真玩得到」——顾客耐心、时序、操作节奏只在真玩里存在;n=5 实测的失败全部发生在静态检查之后的真玩层。真玩是生成验收阶段的权威硬证据(§9 双硬证据口径的生成侧一半),这条与防 Goodhart 红线同源。

其二,静态判据定位 = agent 自检工具 + 反馈素材,保持 advisory,不升门。 它确定性可算、毫秒级,适合 agent 写完数值后即时自查(省一轮约十分钟的真玩往返),也适合折进失败反馈,但永远不是放行判据。静态与真玩结论组合是诊断信号,处置固定:真玩过、静态挂 → 放行,静态差额记 warning 进观测(复核静态判据模型);真玩挂、静态过 → 失败,反馈以真玩数值为主并注明「静态认为数值可达」——问题大概率在耐心/时序/操作节奏,不在数值总量;双挂 → 失败,两组证据并喂;真玩无有效观测(探针读不到 state、驱动不到终态)→ 走 harness/driver 故障路径(E/H 门失败处理),绝不以静态判替代放行。

其三,反馈契约:平衡门失败必须喂回数值证据,不只喂门名。 此前 tier2 富游戏门反馈只给失败子检查名(如 profitPathWin),把 harness 已算出的具体数值(coins 终值 vs 赢线、phase、是否到终态)丢弃;便宜档九门反馈反而带 before/after/why 细节。裁定:tier2 富三门反馈对齐便宜档厚度——每个失败子检查给「实测值 vs 期望值 + 一句为什么」,静态 economyConsistent 的差额一并折进。这是收敛环 conditional 的解法(agent 层)在判法侧的落点。两级验收别混:F-1 的「自修通过 ≥2 例」证的是反馈契约生效;tier2 的 go/no-go 仍以 F-2 干净复跑与收敛环判定为准,前者不替代后者。

其四,平衡的「调」永远是 agent 的玩法职责,工具层不代调。 不做数值模板、不补平衡骨架(创始人 2026-06-29 裁定);工具层的全部义务 = 把「为什么不平衡」讲清(其三)。判法不变、反馈变厚。

其五,赢线双源分工,agent 只调自己那一半。 「赢」有两个数:游戏内赢条件(agent 数据表里的目标值)是玩法设计职责,agent 可调;验收外生赢线(品类金标 play-spec 里的门槛)是验收基准,由品类件与档位表锚定,agent 不可调、也不该看着它反向凑数。真玩经济门要求两者同时成立(真玩到游戏内赢态、且量级过验收线),因此失败反馈必须同时暴露三个数——实测终值、游戏内赢线、验收外生线;agent 若把游戏内赢线设得低于验收地板,反馈应直接指出这个结构性错配,而不是让它对着改不动的阈值空转。

9 分数量纲与防 Goodhart 纪律

flowchart LR
  R["rubric 分 0N<br/>生成侧局部量纲"] --> C1["品类件验收 · 批次观测 · 回流分析"]
  G["生成质量分 01<br/>aigc 域"] --> C2["生成域内部"]
  Q["运营质量分 0100<br/>telemetry→feed"] --> C3["feed 排序"]
  D["D11 就绪分 0100<br/>治理观测件"] --> C4["开闸治理看板"]
  R -.禁止换算互灌.- G
  G -.禁止换算互灌.- Q

量纲纪律:既有双量纲锁死不动——生成质量分(01,aigc 域)与运营质量分(0100,telemetry→feed)不可互相回灌(contracts/README.md 双量纲红线);rubric 分(0N)是生成侧局部量纲,只在品类验收、批次观测、回流分析消费,禁止换算回灌进前两者;不新造统一「质量总分/爆火分」。D11 就绪分(0100,开闸治理观测件)的权重(playability 0.5/firstPlay 0.25/stability 0.15/efficiency 0.1)自本档起归质量轨管辖:放量前的起步值仍由生产 cutover plan 落定(其部署步已在修 efficiency 维 BUDGET_RMB 与便宜档实际成本的错配,该项列为质量轨接管后的首个复核件);放量后第一轮校准见 §10。

防 Goodhart 三条,贯穿全模型:L2L4 分数一律非阻塞——任何丰富/留存/传播分都不得升为拒发门,升门动议须回本档改 SoT 并过创始人;真玩与真实玩家数据是仅有的两种「硬」证据,且真玩证据必须被判读——设计侧一切 LLM 评分都是软信号;机械断言对真玩证据的解读同样会空心(2026-07-09 实证:score-only pass 五案),所以 L1 的判读自裁定三起是「机械预筛 ∧ 独立模型判定」双份,单独哪一份都不许自称完整硬证据;「好玩」的终审归人(审核台与创始人抽玩)。rubric 被 Goodhart 或评分漂移的兜底与此同构:非阻塞设计把错杀面封为零,金标锚定 ±1 回退管住漂移,放量后真数据校准是最终纠偏——若 rubric 分与留存相关性为零或负,重审 rubric 维度,回滚面只在 rubric 文本与评分 prompt,不伤门与代码。

10 生效、校准与升级路径

生效态分三层:四层定义与权力分配、两条 L1 口径裁定、五条平衡门裁定即日生效;档位观测线以草案值生效(便宜档 L2 组均分 ≥60%、tier2 均分 ≥70%),区间(5565%/6575%)由首批品类件回填分布后锁成单值;rubric 通用底座 v2 的新增 3 条判据文本标草案,随首个品类件落地验证后确认或修订。

放量后第一轮校准归质量轨:回流环设计产校准单、opus 执行;输入 = 放量后足量样本(起步 ≥100 款)的 rubric 分组小计 × 留存真数据,含 D11 efficiency 维错配复核;判定 = 相关性方向为正,样本不足或回归不显著则维持占位值再观测一期;D11 权重变更整体可回退上一版(D11 只观测不拦,回退零风险)。此后一切档位线、rubric 维度、D11 权重的修订都走同一条路:质量轨提案,即数据飞轮回流环的校准单机制——不在现场拍脑袋改阈值;L2L4 任何升门动议同样须回本档改 SoT 并过创始人。

11 四类资产与金标消费口径

「金标」一词此前在本档只指校准用的正反例(规范三锚定纪律、裁定三校准纪律),但仓内它被混用——校工具的 fixture、校裁判的正反例、喂生成器的 few-shot/黄金模板、完整内容参照四种角色互相串名。2026-07 五款 Match-3 候选即因此被误当游戏金标候选,而它们只是同一套验收夹具的五次换皮、并无游戏内容设计。混用是这次失焦的直接成因。现只对跨 run 复用的校准与参照资产按消费角色拆成四类,钉死各自去向与「何者进生成成功率分母」,消除文档与消费的漂移。fresh25 等独立生成 run 属样本账,不是第五类资产。

四分类以消费角色的 ReferenceAssetRecord/1 注册记录为互斥单位,不以物理目录为单位。同一份冻结产物若既作为完整内容参照、又要喂给生成器,必须建立两条独立记录:原记录保持 game_content_gold,另建 generation_exemplar 记录并指向同一版本与 hash;单条记录只能有一个类别。记录字段、生命周期和消费入口见产品域《游戏内容金标》§7。这样复用资产不等于混用身份。

类别 它是什么 分母口径 定义/契约去处
harness_fixture(验收夹具) 校准 runner、schema、动画/音频探针、证据闭包的确定性样本(如 Match-3 确定性 fixture、_shared Node 回归) 不进生成成功率分母,不得称金标 本档 §11
prompt_eval_gold(校准正反例) 校准 Actor/Judge/rubric 是否判对的金标正反例——即本档规范三、裁定三所言「金标正反例」 不进生成成功率分母 本档 §4 规范三/裁定三
generation_exemplar(生成范例) 以冻结版本喂给生成器、示范结构与表达方式的 few-shot/模板资产;历史俗称「黄金模板」不赋予金标身份 不进生成成功率分母,不得自动称内容金标 本档 §11;消费约束见 prompt治理 §3
game_content_gold(游戏内容金标) 主题驱动、内容完整、经人工验玩签认的完整参照游戏 参照上限,本身非生成样本,不计入分母 内容契约=产品域 canonical 游戏内容金标(GameContentGold/1 九维)

分母口径(本档权威):生成成功率的分母只统计生成线产出的独立真实游戏样本;harness_fixture、prompt_eval_gold、generation_exemplar 一律不进分母,game_content_gold 是参照系而非生成样本、同样不计入。活账此前已自述 W-AXIS-V3 工程证据「只证明工程边界,不计入生成成功率」,本裁定把这条纪律升为 SoT 口径,不再依赖活账逐处声明。

不得自动晋级(本档权威):harness 通过、专项门(AudioAudit/Filmstrip 等)通过、机器证据全绿,都不构成 game_content_gold;generation_exemplar 被反复消费或来自一款好游戏,也不会自动晋级。内容金标的签认归人工(产品域《游戏内容金标》§6)。这条同时封死「夹具跑通即金标」与「喂过模型即金标」两条复发路径。

既有措辞归位:本档 §4 规范三、裁定三与 prompt 治理中的「Golden 样本集」归 prompt_eval_gold;_fewshot-*_template-* 等被生成器读取的范例归 generation_exemplar;历史「黄金模板」只是旧称,不构成 game_content_gold。谁想把夹具、校准锚或生成范例当内容金标消费,须先回本档与产品域《游戏内容金标》改 SoT 并过创始人。四分类的内容契约、主题先行纪律与现存资产分类账,统一记在产品域《游戏内容金标》,本档不重抄。

下游三线从本档直接开工,不再各自发明标准:W-GENRE 品类件照 §4 规范产 rubric、按 §7 档位观测线验收;tier2 富三门反馈契约照 §8 补厚(裁定即可执行,不依赖档位数值);数据飞轮与 telemetry 线照 §5 口径立留存字段。