games-development-ai/docs/architecture/架构/生成引擎/游戏质量与爆火能力.md

151 lines
27 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
topic: 游戏质量与爆火能力
canonical: true
date: 2026-07-02
---
# 游戏质量与爆火能力:四层质量模型
![四层质量塔](assets/quality-01-四层质量塔.svg)
> **生效状态**:本模型经 Codex + Opus 双评审后,由创始人 2026-07-02 以决策包⑦一次拍定生效——四层定义与权力分配、档位观测线、rubric 计分制、平衡门判法五裁定、「收窄 AE」历史化、富三门档位适用与断言分界、D11 权重管辖移交,七项俱批;档内数值草案即生效值,观测线区间待首批品类件回填分布后锁成单值(§10)。2026-07-03 通用底座增补第 12 条口径(「核心操作非无脑」,L2 满分升至 12),图 1 底部明细带按 L2 7 / L3 3 / L4 2 分组列全。设计留痕 = `docs/agent-specs/2026-07-02-游戏质量与爆火能力-设计.md`。
质量不是一个分,是四层递进的塔:机器门保「能玩」(L1,质量分层内唯一拒发权),LLM 评「有料」(L2),结构要求保「想再玩」(L3)与「想传出去」(L4)的前提;玩家真实数据是 L3/L4 的最终裁判,并回流校准 L2L4 评分与 D11 权重。本档立标准、判定归属与数值档位,是 W-GENRE 品类件 rubric、tier2 富三门反馈契约、数据飞轮留存口径的共同上位标准。它不重定义九门/富三门/首局门的具体判据(判据 SoT 仍是[验收门](验收门.md),本档只裁消费口径),不建留存/传播数据的采集管道(归 telemetry 线与[数据飞轮](数据飞轮.md)回流环),不替 agent 调平衡数值,不写各品类的完整 rubric(归 W-GENRE 品类件),不造统一「质量总分/爆火分」或任何自动爆火门,也不改开闸六门的治理设计(仅接管其中 D11 就绪分的权重管辖)。
## 1 命题与实证:为什么「过九门」不够
命题来自创始人两条既有裁定:「轻量≠简单——便宜档是低成本生成相对不复杂、又不易同质化的高质小游戏,不是产没人会玩的简单玩具」([agentic运行时架构图说](agentic运行时架构图说.md) §4.1);「便宜 = LLM 低参与度,不是游戏低质量,游戏底线 = 2D 丰富游戏(进货/解锁/成长/音乐/丰富玩法)」(创始人纠正,记于 `docs/agent-specs/2026-06-29-便宜档降AI参与-减摩擦与扩模板覆盖-设计.md` §6)。这不只是生成线的事:feed 分发的游戏若普遍单薄,推荐、广告、remix 同款这三条变现与增长线全部失去弹药——爆火能力是平台命题。
分层的必要性有三个实证。第一,**「过九门 ≠ 好玩」已被现网数据坐实**:M1 达标 bake-off 三品类 15/15 全过九门,但丰富度评分(旧 8 条口径,满分 8)均分只有 whack-mole 2.4、click-score 3.4、shop-serve 4.2。机器门保「能玩、玩得通」,对「有料、耐玩」不设防,也不该设防——判「有料」超出确定性信号的能力边界;缺的不是把九门加严,而是九门之上的分层标准。第二,**质量概念此前散落、无上位标准**:D11 就绪评分的权重自标占位待校准;丰富度清单已实装但只观测;GP12 王蓝莓黄金标尺、GP2 首局 30 秒、「完玩率 + 次日留存」散在产品域各处;W-GENRE 品类件的 rubric 明文一直在等上位标准,先批产会返工。第三,**平衡门判法此前双写悬而未裁**:判「平衡」一静一动两套(静态数值可达检查 advisory、真玩经济门 enforced),该谁说了算、失败后反馈里该有什么,tier2 n=5 收敛环 runbook(`docs/plans/2026-06-28-002-feat-tier2-n5收敛环-go-no-go-plan.md`,工单 F-4)明文挂到本模型一并裁定(§8)。
## 2 四层总览与权力分配
| 层 | 回答 | 判定者 | 量纲 | 权力 | 消费者 |
|---|---|---|---|---|---|
| **L1 机制可玩** | 能玩、玩得通吗 | 机器真玩(九门 + 富游戏三门 + 首局门),零 LLM | 布尔(过/不过) | **质量分层内唯一拒发权** | 生成环放行、生产复验 |
| **L2 内容丰富** | 有料、耐玩吗 | LLM 验证 agent 按品类 rubric,非阻塞 | 逐条 0/1 + 分组小计 | 观测 + 批次验收线,不拦单款 | 品类件验收、批次观测、回流分析 |
| **L3 留存结构** | 想再玩的结构前提在吗 | 生成时 rubric 留存组;上线后玩家真数据 | rubric 分;运营 0100 | 观测;真数据经 quality_score 影响分发 | feed 排序、数据飞轮 |
| **L4 传播钩子** | 想让别人看的结构前提在吗 | 生成时 rubric 传播组;上线后 share/remix 漏斗 | rubric 分;漏斗率 | 观测;爆款筛选归运营 | remix 网络效应、爆款签约(P-IPX-06) |
层间纪律三条,是整个模型的权力宪法。
**质量侧的发布权只在 L1。** 一款游戏能不能进 feed,质量分层内由确定性证据说了算,L2L4 任何分数都不拦发布。这是既有防 Goodhart 红线(效果层「绝不放行也绝不拒发」)在整个模型上的推广:LLM 评分与结构评分都是软信号,软信号一旦拿到拒发权,评分尺立刻变成被优化的目标。发布链上另有治理拒发权(GP9 合规、D12 控制平面),在本模型之外、不受本档约束。
**推荐权在真数据。** 玩家行为聚合成运营质量分(0100)回灌 feed 决定「值不值得推」;生成侧 rubric 分只影响批次改进与回流分析,不直接改 feed 排序。
**「好玩」的终审归人。** 审核台人工终审保留,自动分只辅助排序与抽样。
另有一条贯穿 L3/L4 的诚实边界:设计侧 rubric 只测「结构存在性」(钩子在不在),它与真实留存/传播效果的相关性要到放量后校准(§10)才被验证;验证之前,L3/L4 分不得当作效果预测使用。
一处必须消歧:仓内有两套「门」。真玩九门(A_boot…I_control,harness 真玩判)是**验收面**;开闸六门(D12 控制平面/GP9 合规/9d trace/D11 就绪分/D9 反同质化/首局体验)是**放量治理面**。本模型的 L1 指前者加富游戏三门与首局门;开闸六门不属质量分层,其中与质量相关的观测件 D11 就绪分,权重管辖自本档定稿起归质量轨(§9)。
## 3 L1 机制可玩:唯一拒发权与两条口径裁定
判据本体在[验收门](验收门.md),本档不重抄:九门 = 客观健康门 A_boot/B_uncaught/C_frame/D_render/E_live 加 driver 依赖门 F_wiring/G_input/H_progress/I_control,真玩驱动、CDP 探针、零 LLM;富游戏三门 = tier2 多系统档专属(三联动/经济/latch);首局门 = H 门的 additive 派生超集(可玩 ≤2s/首反馈即时/60s 品类闭环),FAIL 不推翻 H。定稿时点的现状:便宜档 M1 三品类 15/15 达标;tier2 收敛环 conditional,卡在经济门与 H_progress——判法与反馈的解法见 §8。
**裁定一(消费口径):driven 时九门全量 AND 为现行 L1 口径,「收窄 AE」历史化。** 验收门 §2.4 曾记「生成环消费从九门全过收窄成只认 AE,G/H/I 降参考,F_wiring 改 VLM 判」——那是 gamedef 时代 driver 缺失、G/H/I 不可靠时的消费策略。现行便宜档在门跑前自动生成 play-spec 使 driven=true、九门全部致命,cheap 与 tier2 的判据代码都认九门全量与富门,M1 达标 15/15 正是这个口径。据此裁定:driven 时九门全量 AND 为现行 L1 口径;undriven 时 E_live/H_progress 自动降 advisory 的分级保留在 harness(已实装);「收窄 AE」条款自本档定稿起历史化,消除文档-代码漂移,存量引用面随收口逐一改注,此后再发现的引用面一律改该处引用、不回改本裁定。F_wiring 保持机器硬门;VLM 视觉判定归 L3 视觉软检,永远软。
**裁定二(富三门档位适用):富游戏三门只随「多系统富游戏」档位走**(现为 tier2 经营类)。便宜档经营品类的进度判定 = occupied 反应族驱动 + score 递增断言,不引入 tier2 经济平衡门(盈利/破产双路判)——单循环游戏没有「经济死局」问题,把它强推到便宜档,是给 L1 加不属于该档位的判据。这里要分清「门」与「断言」两个层次:play-spec 里经 H 门校验的 per-game 真玩断言(score 递增,以及游戏含消费扣减时的 currency 扣减断言)是便宜档 L1 的正当判据,照常使用;本裁定挡的是门级判据跨档,不是禁用某类断言(断言与 rubric 的分界见 §4 规范五)。两档判据差异是档位事实,不是待统一的债。
## 4 L2 内容丰富:rubric 体系
![rubric 计分制与 F-4 平衡门五裁定](assets/quality-02-rubric计分与平衡门.svg)
质量模型有两条「怎么判」的主线,这张图把它们并排摊开。左半是 L2L4 内容质量的 rubric 计分制:每条 rubric 记 0/1 加一句理由,一次评分同时产 L2 丰富、L3 留存、L4 传播三个分组小计,不合成单一总分(单一总分会诱导 Goodhart),通用底座 12 条与品类扩展 ≥4 条两个分母分开、不混合平均;评分纯 LLM、非阻塞,失败即降级为「本次未评出」、绝不拦游戏。底下高亮的复采样纪律是这套软评分的确定性锚——金标正反例复验,单款分组小计漂移超 ±1 才回退,而回退前先对同一输入复采样 ≥3 次取中位,免得把 LLM 固有的采样噪声误判成漂移。右半是 L1 经济平衡的 F-4 五裁定:agent 写完数值先过毫秒级的静态 economyConsistent 自检(只作提示、永不放行),真正说了算的是把游戏真玩到终态的动态门;门一旦失败,反馈必须带上实测终值、游戏内赢线与验收外生线三个数,而不是只丢一个门名。两条主线一软一硬——rubric 是软信号只供观测,平衡门是真玩硬证据、握 L1 唯一拒发权;共同的纪律都是用确定性锚点把 Goodhart 与评分漂移封死。§8 正文的平衡门流程与本图右半同源,判法细节以那五条裁定为准。
丰富有一条结构底线,便宜档也必须有,这是创始人「2D 丰富游戏」裁定的工程化:**成长轴**(数值或等级)、**解锁阶梯**(≥3 级,任意时刻可见下一个)、**收集/装饰或等价第二动机**、**音反馈**。这四件是生成 agent 在设计阶段的交付物(品类设计 skill 的职责),不是九门判据——丰富的「生成」归生成 agent,丰富的「校验」归 LLM 验证 agent,两边都不落项目代码。
计分制先立住:每条 rubric 记 0/1(成立/不成立),逐条给一句理由;条目按层标注(L2/L3/L4),一次 LLM 评分同时产出**三个分组小计**(L2 丰富小计/L3 留存结构小计/L4 传播结构小计),不另起三套评分,也**不设单一总分**——单一总分好看,但会诱导 Goodhart;分组小计才对得上三层各自的消费点。通用底座与品类扩展**分母分开**,不混合平均。每条 rubric 的最小形状 = 编号/层标/一句可判定的判据/一对正反例;品类件照这个形状产条目,评分 agent 照它出「逐条判定 + 理由 + 三组小计」。
规范六条,W-GENRE 品类件照此产 rubric:
**规范一:通用底座 v2 = 11 条,已实装为现网评分尺。** 原 8 条(即时反馈/可见成长/下一个解锁/30 秒爽点/数值滚雪球/情感锚/放置回归/音反馈,与 `.agents/skills/sim-business-game-design.md` §10 同源)加新增 3 条:L3「首 3 分钟脚本成立:010s 零阅读上手/1060s 首次升级/13min 露出 23 个后续锁」、L4「炫耀时刻:有可截图分享的结算/成就画面,不是打完就黑屏」、L4「同款钩子:品类原型 + 主题标签元数据可供 remix 预填」。分组归属:L2 = 即时反馈/可见成长/30 秒爽点/数值滚雪球/情感锚/音反馈共 6 条,L3 = 下一个解锁/放置回归/首 3 分钟脚本共 3 条,L4 = 炫耀时刻/同款钩子共 2 条。这 11 条已随 `cheap-worker/cheap_verify.py` 的 RICHNESS_CHECKLIST(commit ba82e63c)实装为便宜档丰富度验证 agent 的评分尺并落库三分组小计;实装遵守锚定纪律——原 8 条判据文本与顺序一字不改,新增 3 条追加于末尾,层标只是聚合归属、不改原条目的判据本身。新增 3 条的判据文本仍标草案,随首个品类件落地验证后确认或修订(修订须金标复验)。
2026-07-03 增补第 12 条,通用底座随之为 12 条口径:**「核心操作非无脑」**,层标 L2。判据:每次主操作含真实决策或技巧含量、判错有真代价,不是点了就自动结算;正例 = 顾客上门先看要什么再决定补哪种货,补错压库存;反例 = 点哪里都加分、无判断成分的挂机点击。该条源自便宜档主 prompt 自检第 ⑨ 条(策划知识包 v2 的否决项判定句式),升为评分尺条目;创始人 2026-07-03 授权按默认项拍板采纳。分组归属随之 L2 = 7 条、通用底座满分 12;档位观测线(§7)的百分比线不变,分母随升。实装遵守锚定纪律:追加于清单末尾、既有 11 条一字不动;落 `RICHNESS_CHECKLIST` 与金标复验同批执行,复验漂移超线按规范三处置。
**规范二:品类扩展 ≥4 条。** 每品类另加品类特有维度(经营范例:进货补货循环成立/客流节奏有紧张感/双货币分工明确/卡点「差一点」不卡死;其余品类由各品类件提出),同一字段形状、同样标层,分母独立小计。
**规范三:锚定纪律。** 每品类 ≥1 金标正例 + ≥1 薄反例;rubric 文本或评分 prompt 变更必须金标复验,单款分组小计漂移超 ±1 即回退。LLM 裁判的漂移用确定性锚点治,不用另一个 LLM 治。复采样定性补一条(2026-07-03,rubric 挂点归一单实测沉淀):复验遇漂移超 ±1,先同输入复采样 ≥3 次取中位再判——LLM 裁判对逐字节相同的输入,单次采样命中数差可达 3,属固有噪声;prompt 逐字节未变可机器证明时,不据单样本判回退,中位仍超线才回退。另一条实测教训同录:薄反例锚必须先验证「真的薄」——模板可能天然品类饱和(解谜模板曾在品类条目上拿满分),此时用合成薄壳作反例,不用模板。
**规范四:判定形态。** 纯 LLM、非阻塞、逐条给理由;绝不写成代码校验、不进九门、不进脚手架(创始人红线)。评分调用失败/超时/解析失败一律降级为「本次未评出」,不抛、不阻断生成、不进达标判定——非阻塞语义自带降级,也把错杀面封为零(评分再错也不拦游戏)。每款一次评分调用,成本占比可忽略(便宜档 <¥0.1 量级)。
**规范五:与 L1 断言的分界。** `sim-business-game-design` skill §10 曾注「4 条可机检」,这四条不同质,分两类处置:纯 code-presence 类(即时反馈/下一个解锁/音反馈——代码里存在调用 ≠ 体验成立)按红线软化为 LLM 评分维度,不落项目代码;经 H 门 assertAfterPlay 校验的 per-game 真玩断言(可见成长的 score/资源递增断言、经营的 currency 扣减断言)属 L1 机制可玩,保留为硬断言、不软化——把真玩硬证据降成软评分会削 L1 的拒发权,方向恰好反了。同名两物并存且分工明确:L1 断言判「机制上真发生」,L2 rubric 判「体验上成立、有层次」;skill §10 注记照此改口。
**规范六:消费点。** 分组小计消费于品类件验收与批次观测(档位观测线,§7)和回流分析(§10);逐条理由消费于品类件迭代——哪条维度长期不成立,就是品类设计 skill 或脚手架的改进信号。
## 5 L3 留存结构
设计侧三要素,进品类设计 skill 与 rubric、生成时交付:**目标梯度**(任意时刻「下一个目标」可见:解锁阶梯、任务清单)、**难度节奏**(爽点与平台期交替;成长曲线 ×1.15/级为默认锚;卡点造「差一点」的张力、不卡死)、**回归钩子**(每日首登奖励、离线收益、限时目标,便宜档至少一种)。首 3 分钟脚本是三要素在开局的浓缩,rubric v2 单列一条。
真判在上线后,口径立到可建字段的程度:**D1 留存** = 同一 game_id 下、同一稳定玩家标识(登录取 userId,未登录取匿名设备标识)在首玩自然日(平台时区)之后的第 1 个自然日内发生 ≥1 次开局事件,按「玩家 × 游戏 × 日」去重;**完玩率** = play_end 事件中 completed 占比。现状缺口:遥测聚合表没有次留字段(数据飞轮已挂账),字段或旁路的落地设计归数据飞轮回流环设计与 telemetry 线;字段落地前,用「完玩率 + 互动率(点赞收藏 ÷ 播放)」作代理,该缺口不阻塞品类批产与反馈契约两线。运营质量分(0100)回灌 feed 的既有机制不动,本档不碰其算法。
三个「首 X 时间」口径就此对齐,免得下游各按各的:GP2「玩家首局 30 秒体验」是产品域体验命题,本模型不收编;首局门三断言(可玩 ≤2s/首反馈即时/60s 品类闭环)是它在 L1 的机器可判子集;rubric「首 3 分钟脚本」是它在设计侧的结构化前奏。三者消费场景不同,时间锚不强行统一;体验效果的真判(如前 30 秒流失率)留给放量后校准。
## 6 L4 传播钩子
三件结构要求,生成时交付:**炫耀时刻**(结算/成就画面可截图、可分享——游戏必须有结算展示场景,不是打完就黑屏)、**分享点位**(结算处一键分享,自愿不打断,与广告点位同一条体验原则)、**同款可复刻**(游戏页 remix 入口可用,是 GP10「爆款做同款」网络效应的供给侧前提;生成侧交付品类原型与主题标签元数据,供 remix 预填)。
真判 = share 事件与 remix_click/remix_submit 漏斗。本模型不改契约:share 是 telemetry 既有事件,remix 漏斗按数据飞轮已规划的增量契约落地;品类件或产品面若需新增事件,走契约变更流程(护城河与跨端契约终审)。红线一条:传播钩子是**结构要求(有没有),不是效果承诺(火不火)**。本模型保证「具备被传播的结构」;爆款是概率事件,筛选与签约(P-IPX-06)归运营,不做自动「爆火分」。
## 7 丰富度预算档位(生效值)
| 档位 | 成本红线(创始人 2026-06-25 拍) | 实测基线 | 丰富结构下限 | rubric 观测线(生效值,区间待锁) |
|---|---|---|---|---|
| **便宜档**(AI 低参与) | per-gen < ¥10(图/音另线) | ¥0.250.9/款 | 底线四件(成长轴/解锁阶梯 ≥3 级/第二动机/音反馈)+ 1 主循环 ≤2 主机制 + 首 3 分钟脚本;四件为默认底线,品类件须逐条确认可映射,映射不动的申报品类替代轴 | 品类小批(n=35):**L2 组均分 ≥60% 组满分**(区间 5565% 待锁)且无恒 0 条目;L3 组 ≥2/3 成立;L4 组 ≥1/2 成立 |
| **tier2**(AI 深参与) | per-gen < ¥50,目标 ≤¥3/成功款 | ¥1.29/款 | 档位通用项:≥3 个耦合子系统 + 阶段目标长线;品类结构项(现行经营件 = 资源/合成/订单三系统、双终态真可达,即富三门)由品类件承载,扩品类时由对应品类件重定义 | 品类 rubric(通用 + 品类扩展,两分母)**均分 ≥70% 满分**(区间 6575% 待锁),品类扩展组无恒 0 条目 |
消费纪律三条,防误用。
**其一,档位线消费于品类资产验收(W-GENRE 各件 n=35 小批)与批次观测,不消费于单款放行**——单款放行只看 L1。线拍高最坏也只是某品类件多一轮申报,不错杀单款、不阻塞主线。
**其二,观测线是拉升目标,不是现状描述。** 现网 8 条无分组口径下 shop-serve 4.2/8、click-score 3.4/8、whack-mole 2.4/8,全部低于线;线的意义是品类件(设计 skill + few-shot 到位后)必须把分布抬上来,区间值由首批品类件回填分布后锁成单值。品类件对观测线或结构下限的品类适配走申报机制:附理由申报、创始人批;反应类等天然薄品类须同时给出替代丰富轴(连击深度、模式变体等),纯叙事/非遗类可申报以章节推进、工艺步骤解锁等替代成长轴——不许裸降。首批申报已批两件(2026-07-03,创始人授权默认项拍板):非遗类的「情感锚/放置回归」两条按替代轴判——作品集养成为情感锚的等价物,工序晾晒/窑烧类工艺周期节点为回归钩的等价物;解谜类按收集图鉴/伙伴系统为情感锚等价物,每日一题为回归钩等价物。替代轴落评分 prompt 的品类注解,通用条目文本不动,随下一轮金标复验一并验证。
**其三,预算余量优先买丰富、不买省钱。** 软脚手架数据点显示,富化把单款成本从约 ¥0.7 抬到 ¥0.85(+21%),行数 892≈890 持平——多花的钱买到的是 combo/VIP 这类玩法富化,不是代码量;绝对值距 ¥10 红线余量巨大,这笔钱该花。reskin 锁循环省成本的路线已被创始人否为越线,不回潮。
## 8 平衡门判法:五条裁定
背景:tier2 收敛环 conditional 的失败集中在「盈利路赢不了」(经济门 profitPathWin 子检查)与「进度不成立」(H_progress),而判「平衡」这件事此前双写——静态 economyConsistent 从已落盘数据表算「数值可达」(开局金币 + 订单奖励之和 ≥ 赢线,advisory),真玩经济门把游戏真玩到 coins ≥ 阈值且 phase 为 win 且到终态(enforced)。该谁说了算、失败后反馈里该有什么,裁定五条如下(即 n=5 收敛环 runbook 的工单 F-4;下文 F-1 = 该 runbook 的富三门反馈补厚工单,F-2 = 干净复跑工单):
```mermaid
flowchart LR
A["agent 写玩法数值/数据表"] --> S["静态自检 economyConsistent<br/>毫秒级 · advisory · 自检工具"]
S -->|"数值差额即时提示"| A
A --> P["真玩动态门(权威)<br/>经济门 win/lose 双路 + H_progress"]
P -->|"失败:数值证据反馈(F-1)<br/>实测值 vs 期望值 + 为什么"| A
P -->|"全绿"| OK["L1 放行"]
```
**其一,平衡判定的权威 = 真玩动态门,不回退静态判。** 静态「数值可达」证明不了「真玩得到」——顾客耐心、时序、操作节奏只在真玩里存在;n=5 实测的失败全部发生在静态检查之后的真玩层。真玩是生成验收阶段的权威硬证据(§9 双硬证据口径的生成侧一半),这条与防 Goodhart 红线同源。
**其二,静态判据定位 = agent 自检工具 + 反馈素材,保持 advisory,不升门。** 它确定性可算、毫秒级,适合 agent 写完数值后即时自查(省一轮约十分钟的真玩往返),也适合折进失败反馈,但永远不是放行判据。静态与真玩结论组合是诊断信号,处置固定:真玩过、静态挂 → 放行,静态差额记 warning 进观测(复核静态判据模型);真玩挂、静态过 → 失败,反馈以真玩数值为主并注明「静态认为数值可达」——问题大概率在耐心/时序/操作节奏,不在数值总量;双挂 → 失败,两组证据并喂;真玩无有效观测(探针读不到 state、驱动不到终态)→ 走 harness/driver 故障路径(E/H 门失败处理),绝不以静态判替代放行。
**其三,反馈契约:平衡门失败必须喂回数值证据,不只喂门名。** 此前 tier2 富游戏门反馈只给失败子检查名(如 profitPathWin),把 harness 已算出的具体数值(coins 终值 vs 赢线、phase、是否到终态)丢弃;便宜档九门反馈反而带 before/after/why 细节。裁定:tier2 富三门反馈对齐便宜档厚度——每个失败子检查给「实测值 vs 期望值 + 一句为什么」,静态 economyConsistent 的差额一并折进。这是收敛环 conditional 的解法(agent 层)在判法侧的落点。两级验收别混:F-1 的「自修通过 ≥2 例」证的是反馈契约生效;tier2 的 go/no-go 仍以 F-2 干净复跑与收敛环判定为准,前者不替代后者。
**其四,平衡的「调」永远是 agent 的玩法职责,工具层不代调。** 不做数值模板、不补平衡骨架(创始人 2026-06-29 裁定);工具层的全部义务 = 把「为什么不平衡」讲清(其三)。判法不变、反馈变厚。
**其五,赢线双源分工,agent 只调自己那一半。** 「赢」有两个数:游戏内赢条件(agent 数据表里的目标值)是玩法设计职责,agent 可调;验收外生赢线(品类金标 play-spec 里的门槛)是验收基准,由品类件与档位表锚定,agent 不可调、也不该看着它反向凑数。真玩经济门要求两者同时成立(真玩到游戏内赢态、且量级过验收线),因此失败反馈必须同时暴露三个数——实测终值、游戏内赢线、验收外生线;agent 若把游戏内赢线设得低于验收地板,反馈应直接指出这个结构性错配,而不是让它对着改不动的阈值空转。
## 9 分数量纲与防 Goodhart 纪律
```mermaid
flowchart LR
R["rubric 分 0N<br/>生成侧局部量纲"] --> C1["品类件验收 · 批次观测 · 回流分析"]
G["生成质量分 01<br/>aigc 域"] --> C2["生成域内部"]
Q["运营质量分 0100<br/>telemetry→feed"] --> C3["feed 排序"]
D["D11 就绪分 0100<br/>治理观测件"] --> C4["开闸治理看板"]
R -.禁止换算互灌.- G
G -.禁止换算互灌.- Q
```
量纲纪律:既有双量纲锁死不动——生成质量分(01,aigc 域)与运营质量分(0100,telemetry→feed)不可互相回灌(`contracts/README.md` 双量纲红线);rubric 分(0N)是生成侧局部量纲,只在品类验收、批次观测、回流分析消费,禁止换算回灌进前两者;**不新造统一「质量总分/爆火分」**。D11 就绪分(0100,开闸治理观测件)的权重(playability 0.5/firstPlay 0.25/stability 0.15/efficiency 0.1)自本档起归质量轨管辖:放量前的起步值仍由生产 cutover plan 落定(其部署步已在修 efficiency 维 BUDGET_RMB 与便宜档实际成本的错配,该项列为质量轨接管后的首个复核件);放量后第一轮校准见 §10。
防 Goodhart 三条,贯穿全模型:**L2L4 分数一律非阻塞**——任何丰富/留存/传播分都不得升为拒发门,升门动议须回本档改 SoT 并过创始人;**真玩与真实玩家数据是仅有的两种「硬」证据**——设计侧一切 LLM 评分都是软信号;**「好玩」的终审归人**(审核台)。rubric 被 Goodhart 或评分漂移的兜底与此同构:非阻塞设计把错杀面封为零,金标锚定 ±1 回退管住漂移,放量后真数据校准是最终纠偏——若 rubric 分与留存相关性为零或负,重审 rubric 维度,回滚面只在 rubric 文本与评分 prompt,不伤门与代码。
## 10 生效、校准与升级路径
生效态分三层:四层定义与权力分配、两条 L1 口径裁定、五条平衡门裁定即日生效;档位观测线以草案值生效(便宜档 L2 组均分 ≥60%、tier2 均分 ≥70%),区间(5565%/6575%)由首批品类件回填分布后锁成单值;rubric 通用底座 v2 的新增 3 条判据文本标草案,随首个品类件落地验证后确认或修订。
放量后第一轮校准归质量轨:回流环设计产校准单、opus 执行;输入 = 放量后足量样本(起步 ≥100 款)的 rubric 分组小计 × 留存真数据,含 D11 efficiency 维错配复核;判定 = 相关性方向为正,样本不足或回归不显著则维持占位值再观测一期;D11 权重变更整体可回退上一版(D11 只观测不拦,回退零风险)。此后一切档位线、rubric 维度、D11 权重的修订都走同一条路:质量轨提案,即[数据飞轮](数据飞轮.md)回流环的校准单机制——不在现场拍脑袋改阈值;L2L4 任何升门动议同样须回本档改 SoT 并过创始人。
下游三线从本档直接开工,不再各自发明标准:W-GENRE 品类件照 §4 规范产 rubric、按 §7 档位观测线验收;tier2 富三门反馈契约照 §8 补厚(裁定即可执行,不依赖档位数值);数据飞轮与 telemetry 线照 §5 口径立留存字段。