创始人:「n>30 这个设计不希望再看到了。n=5,有错误再追加一次 5」。续 SoT① 后把 tier2 验证语境的 n≥30 统计批跑全改成 n=5 收敛环(并发跑 5、有错读日志/分析/修复、再并发追加 一次 5、收敛即 go、不收敛按收敛失败模式走退路 R1/R2/R3/KEEP): - 003 plan:Summary/执行现状/KTD B门/mermaid/R11/U7/Open Questions 全 reframe; 退路树由「过门率<40%/<20% 统计阈值」改「收敛失败模式分流」(opus 代理执行、已核验) - 01-产品图说:6 处「n≥30 统计待跑」→「收敛环 n=5」;§188 内外口径同改(不写已可对外背书) - spike-runbook:status/§0 banner/G3 样本量(5×6=30→n=5)/G4/G5 退路树/跑序 全 reframe; svg(n≥30/5×6/过门率阈值)经 banner 标为旧法历史、以 003·SoT① 为准 - origin brainstorm:加 supersede banner(留痕保留、标 B门 n≥30 已被 n=5 取代) 范围:只改 tier2;廉价线 SAA gamedef「≥80% n≥30」基线未碰(测成功率本身需统计样本,待创始人定)。 门:全仓死链 0。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
25 KiB
date, topic, status, 设计 SoT
| date | topic | status | 设计 SoT |
|---|---|---|---|
| 2026-06-23 | 0号 spike runbook(建设五步 / 靶子 / 模型矩阵 / 过门 / 退路)— tier2 执行 runbook(图集) | 执行 runbook(非设计 SoT) · 配套 plan `docs/plans/2026-06-22-003-feat-tier2-富游戏自治生成线-plan.md`(其 0 号 spike 视图)· 0 号 spike 已跑 feie-005=accept(2026-06-24,go);本 runbook 现作 n=5 收敛环的执行指南(原 n≥30 统计方法已被创始人 2026-06-25 取代) | docs/architecture/架构/生成引擎/agentic运行时架构图说.md(原《tier2 实现详设》《自治富游戏引擎》已并入;本 runbook 是其 spike 执行视图,t2-G-* svg 在此 home) |
tier2 细节图说 · G 族 —— 0号 spike runbook
本篇是绘境AI 架构图集 生成引擎子树 下的 tier2 细节图说,只覆盖 G 族(0号 spike 的可执行 runbook) 五张图。生成引擎主干、tier2 总览、agentic 运行时各有自己的图说;这里专门把「tier2 整轨值不值得投、怎么便宜地先验一次」这件事画清楚。
0 阅读约定与同步纪律
G 族画的是 0号 spike 这一道生死门——tier2 富游戏自治生成线最深的赌注在被铺开成一整套引擎生态之前,先用一个最小、可丢弃的 spike 把它便宜地验一遍。整条线押的那一半是:便宜或中等模型的自治 agent,在经营骨架、玩法模板、资产池、RAG、L1 确定性门兜底这套约束下,能不能稳定写出占一款经营富游戏 56% 的表现层并过确定性门。已经证到的只是产物形态——王蓝莓那款 12 文件、180KB 的多系统经营游戏真做出来过、过了真输入 harness,Phaser 这条路能过确定性门也有 2026-06-11 的五门证据;但这两次都是最贵的模型加重人工编排做到的,不是便宜模型自治。架构论证替代不了实测,所以要跑这个 spike。
五张图映射两份属主设计档。建设五步与 spike 插点、隐藏硬工作出自《tier2 实现详设》的「建设五步与 0号 spike 生死门」一节;靶子游戏的施工规格出自同档「靶子游戏 mini-肥鹅」一节;模型矩阵、样本量与跑序出自「模型矩阵与样本量」一节;过门阈值与采集字段出自「过门判据与精确阈值」「采集指标字段表」两节;两段实施与退路树出自「两段实施步骤」「退路树」两节。56% 这个占比数、约束自治(O2)范式、最深赌注的来龙去脉出自《自治富游戏引擎》的「三层拆分」与「现在证到哪,赌注在哪」两节。frontmatter 记了这两份的当前 commit hash 作为防漂移门——其中任一份动了 spike 口径、靶子规格、阈值或退路触发线,本图说与对应 SVG 必须同步改。
【2026-06-24 更新】0 号 spike 已跑、feie-005 = decision=accept(go,留观微调);下文与 svg 虚线是 spike 前视角,其中「待 spike 验证才落」的元素多数已落(核心生成线 / Phaser 探针 / 九门 + 富游戏三门 / 四道收敛契约门 / 观测成本 / 收敛环批跑底座(n=5)/ 服务化@8200——见 SoT① §5 与 tier2/HANDOFF.md),本 runbook 现作 n=5 收敛环的执行指南(并发跑 5、有错误就读日志/分析/修复、再并发追加一次 5、收敛即 go;原 n≥30 统计方法、及下文 G3「5×6=30」/ G4 过门率统计阈值 / G5 退路树「<40%·<20%」均为旧法历史记录,已被创始人 2026-06-25 取代,以 003 与 SoT① 为准;svg 同此)、不是「待跑」。下文 spike 前描述保留作方法论参考。 spike 前的状态是:整条 tier2 富游戏线整体待建,0号 spike 还没跑、引擎没建。所以 G 族里几乎所有元素都是设计已出、尚未落地的状态(虚线),包括 spike 门本身、五步建设路径、两段实施、退路分流、阈值与采集字段。有承袭、不全是新建的部分用实线画,但要分清承袭的是什么:deepseek 两档便宜模型是现行 Tier0/1 廉价线在产的模型、mini-desktop 是已有的权威构建与 e2e 门机、L1 确定性门(九门)和 new-api 计费平面是现行已落的底座、W-CH-α 渠道路已实证到 P0——这些是真承袭,用实线。spike 要在它们之上新做的全是虚线。另有一档颜色单列:远期紫标的是 Cocos 这条不进自治循环、放到 Phaser 证成之后才铺的另一条轴,它远期不押核心赌注。看图时记住:实线 = 承袭现行已落;虚线(短划线)= tier2 专属待 spike 验证后才落代码的新机制;远期紫 = 远期不投核心循环。
G 族是《agentic 运行时架构图说》的放大层。那份总览给的是整轨的生命周期、对象结构与系统全景,其中「建设 / spike 判据」只点到为止;G 族把那一面逐项放大——五步的先后、spike 插在哪、隐藏硬工作有哪些、靶子砍成什么样、跑哪几档模型、过门的数字阈值、采集哪些字段、崩了往哪条退路走。deepen 不 duplicate:总览负责让人建立全局轮廓,G 族负责让一个工程师能照着把 spike 跑起来、据数字裁 go/no-go。
1 全图通用图例
G 族用一套统一的徽章和线型,先在这里讲清,后面每张图不再重复。
状态码四个,贯穿生成引擎子树:现 = 现行已建在跑;接 = 设计已出、代码待接线;建 = tier2 立项后要新建、当前待 spike;缓 = 收窄后缓做。G 族绝大多数元素是「建」,deepseek 两档 / mini-desktop / L1 九门 / new-api 计费是「现」,Cocos 生态与 Phaser 渠道 adapter 是「缓」。
线型承担状态语义,与状态码对齐。实线框 / 实线箭头 = 承袭现行已落(deepseek 两档在产模型、mini-desktop 权威构建机、L1 九门、new-api quota 折¥、W-CH-α 渠道路);虚线框 / 虚线箭头(短划线 6 4)= tier2 专属待建(spike 门、五步路径、两段实施、退路分流、阈值与采集字段);远期紫实线 = 远期不投核心循环的 Cocos 轴与作为天花板基线的强模型档。go/no-go 的分流用绿(过 / go)和红(不过 / no-go)两色箭头区分。
生产维度徽章标的是某个元素服务哪个目标:质量(绿)= spike 验「便宜模型能否自治写出那 56% 表现层」这个最深赌注、过门率与收敛步数;成本(绿)= 单款¥与 ¥3/款 成本闸;安全(红)= 第二段 Goodhart 防线(自产 driver 三层隔离,写者不判自己的卷);可观测(蓝)= 第三步要早建的 TracingMiddleware 与成本台账、spike 调试当下就要;数据(灰)= run 级采集字段是 go/no-go 的可对比底料。
阈值上还有一个记号要先讲清:凡标 ★ 的数字是建议值、需创始人和实测校准(如 ¥3/款 premium 预算、50%/70% 过门率门、单系统 8 轮 / 整局 40 轮的收敛上限);不带 ★ 的是承袭现行线的硬约束(factory 路 60% / cutover 门 80% / L1≤¥0.15 / L2≤¥5 / new-api quota 折¥口径)。
2 图集
图 G1 · 建设五步 + 0号 spike 生死门
tier2 的建设按创始人给的五步纵向走,真正的设计取舍是在第二步和第三步之间硬插一道便宜的 spike 门。原来的自然顺序是先把 AgentScope 底座搭好、再以 Phaser 搭出一整套生成引擎(大投入),最后才让它自治生成一款肥鹅级游戏过人审——可那一刻才第一次验「便宜模型到底写不写得出富游戏」,而这恰恰是整轨最深、最没证过的风险。把这个验证推迟到引擎都搭漂亮之后,等于把最贵的赌注押在最后揭晓。spike 门就是把这个顺序倒过来:最深的赌注要在最便宜的时候验。它不必等第一二步全做完——一个最小的 AgentScope 加一坨硬编码配置就能先验,过了(go)才进第三步铺引擎,不过(no-go)直接走退路树,绝不滑成无限调参。这张图让人一眼看出的就是这个插点的位置和它背后的逻辑:先证赌注、再投生态。
这张图第二个该让人看清的,是「搭引擎」和「过人审」这两步表面之下藏着的硬工作。第三步表面是以 Phaser 为范例搭生成引擎,底下藏着五块不补就埋雷、必须显式排进去的工作:把现行 L1 确定性门泛化到 Phaser 并为经营品类补 driver 和跨表语义门(验收地板),自产取证 driver 必须过平台白名单加独立评审(Goodhart 安全),官方软刹叠自建硬熔断防自治多轮烧钱(成本强制),真 Phaser 工程的源项目契约这步真接上,以及用官方 TracingMiddleware 把每步推理动作观察吐成 typed event 流进 Studio 加成本台账(可观测早建)。这五块现状都还只是 best-effort,规模化前必须落地;其中可观测是复利中台里唯一该在这个阶段就建的部分,因为 spike 调试和对账当下就用得上。第四步表面是自治生成一款过人审的游戏,藏着的是把「人审」做实而不是创始人亲玩一票:要把「好玩」拆成可复核的几条来压个人品味方差(终审判据),要有一个终审吞吐模型免得 premium 量一上来人审变瓶颈或橡皮图章,还要让 player panel 去判可达性和空内容这类确定性可逼近的明显劣化信号给人门减负。把这两步的隐藏工作单独画出来,是为了不让它们在「搭引擎」「过人审」这种轻描淡写的步骤名底下被漏掉。
第五步把 Cocos 放在 Phaser 证成之后是有意为之,这是这张图唯一的远期紫:Cocos 是另一条正交的轴(编辑器、人在环,服务 3D、复杂场景、渠道导出),它进不了无人值守的自治循环,不该和 Phaser 并级、更不该在核心赌注证成前就铺。渠道 adapter 走仓内 W-CH-α 已实证到 P0 的「轻 H5 引擎加自研 adapter」路,待补的是 P1 真机门,卡在创始人三件套那道日历闸门上,不是技术阻断。最该据这张图 review 的设计缝在 spike 门那一格的阈值:它标了 ★,意味着 go/no-go 的判线本身还需要创始人和实测校准——门焊得太松会放进一个其实不该投的赌注,焊得太紧会把一个本可成立的范式误杀,这条线怎么定,是这张图把决定权显式交还给创始人的地方。
图 G2 · mini-肥鹅 靶子规格
spike 的第一段是个对照实验,对照组是「人工预建骨架加人工预建 driver」——要预建,就得先有一个确切的靶子游戏。这张图把这个靶子钉死成 mini-肥鹅:一个砍到能证、又保住三个本质难点的最小经营游戏。三个本质难点是多系统耦合、重 UI 表现层、数值经济闭环,它们正是现有廉价线做不出富游戏的原因,也正是 spike 要考的东西。砍法是相对仓内 wanglanmei-ref(那款 12 文件约 180KB、赢输双路径已证的多系统经营游戏)做减法:砍掉任务弹窗、背包深度、上百物品,但一根不少地保留三个联动系统和它们之间的确切耦合点。砍内容量是为了让 spike 本身别变重,保耦合点是因为耦合点才是考题——如果砍到三个系统互不相干,这个 spike 就白跑了,因为它考的就是 agent 能不能把系统正确接起来。
图中央把资源系统画成读写交汇点,是这张图最该让人看懂的结构。三个系统不是三座孤岛:合成系统(3×3 棋盘,点两个相同物品合成上一级,6 条合成链覆盖 12 个物品)的产出进资源库存、消耗时调资源系统扣食材;订单系统(面板列 3~5 个带耐心的顾客订单,要物品给金币)完成订单时调资源系统扣物品加金币、耐心耗尽即流失;资源系统反过来用金币门控解锁第 4、5 摊位和更高合成链。所有读写都汇到资源系统那张极小的状态表上,它是耦合枢纽。图上方那条横跨的弧线标的是这个 spike 真正的核心考点——跨表可达性:订单的 requires 必须能被合成系统产出的物品满足,这是一次从 mergeChains 静态推到 orders 的检查,如果 agent 填的数据表里有订单要的物品根本合不出来,这游戏就是死局。把这条考点单独用一条跨越全图的弧画出来,是因为它最容易被忽略、又最能区分「三个系统摆在一起」和「三个系统真接上了」。
图下半部分把胜负条件画成两条都必须能被 harness 真输入驱动跑到终态并 latch 的路径,这是 spike 能确定性验收的前提。赢是金币从开局 20 经「合成→凑齐订单物品→交单→收金币」的正循环攒到 100,输是连续 3 个订单流失(只合成不交单或经济崩盘)。关键约束是这两条路都得能被 driver 的真输入序列驱动到终态、再 latch 成不可逆的终局——能在数据表里算出来和能被真玩到是两回事,latch 成可轮询的终态则是因为游戏没有 emit 通道、宿主只能轮询去读,这条承接的是现行宿主装载已经验过的约束。内容量定在 12 物品、6 链、5 订单模板、2 种货币,数据表留空给 LLM 填、骨架按三系统加耦合点预建为平台代码先天过 boot。要分清这张图的边界:它是靶子本身的施工规格(对照组预建什么),不是验收门的定义——加在这靶子上的三联动门、经济门、latch 门是 D 族的事,这里只画这把「卷子」长什么样,不画怎么判卷。
图 G3 · 模型矩阵 + 跑序
「便宜模型」是个集合不是一个值,这张图最该让人记住的就是这件事:过门率、成本、收敛步数这三个产出数必须各有归属对象,否则「60% 是哪个模型的 60%」根本答不上来。所以 spike 不是笼统地拿「便宜模型」跑,而是跑一张点名到具体模型的矩阵——主力便宜档 deepseek-v4-flash(现行 Tier0/1 打底模型、tier2 自治的主力候选,spike 真正要回答的「便宜到什么程度还守得住」就是看它),强便宜档 deepseek-v4-pro(现行救场档,测贵一档便宜模型是否显著抬过门率,退路树第一条触发线直接读它),中等 agentic 档 MiniMax-M3(这批最能打,先用它证路),强模型基线 Opus/Fable(只跑 1~2 款作路通不通的上限基线、不进成本评估)。前两档是现行在产模型(实线),后两档里 M3 的原生接法和自治产物判定待建(虚线),Opus/Fable 是远期不押的天花板基线(紫)。
样本量这一格承接的是一条踩过的硬教训——别拿单次跑数当基线。每个便宜或中等档跑 n=5 收敛环:题面用 5 个一句话变体(美食、水果、咖啡、面包、糖水店)各 1 凑够 5,有错误(>1)就读日志、分析、修复、再并发追加一次 5——不做 n≥30 统计批跑;强基线 Opus/Fable 只验上限、各 1~2 即可。这张图把跑在哪也画死了:mini-desktop——权威构建加 e2e 门加 x86 同构,禁本机 6c6g 跑 chrome(exit 144 / OOM 红线)。这条不是随手提的运维细节,而是 spike 数据可信的前提:在非同构机器上跑出来的过门率,作不得正式依据。
跑序那一块是创始人 2026-06-21 定的,它的设计取舍是「别一上来把整张矩阵批量全铺开」。先用 M3 证路:让它全流程自治产一款 mini-肥鹅,创始人亲玩判有没有「肥鹅味」——这一步是软门、是人锚,证的是「便宜模型自治这条路到底走不走得通」,而且它是亲玩判定不是统计,所以 M3 这一步先单独走、不先铺批量。路走不通,就别在更便宜的模型上空耗。证通之后再用 v4-flash 和 v4-pro 各跑一轮 n=5 收敛环比成本,看把模型降到主力便宜档、收敛率和单款成本各掉多少——这一步证的是「便宜到什么程度还守得住」。这个先证路再比成本的顺序,把最贵的失败(在便宜模型上空耗到发现路根本不通)挡在了最前面。M3 的具体接法(走官方 AnthropicChatModel 对 new-api 的 /v1/messages 端点、吃原生 Anthropic 协议加 agentic 工具循环)在 C 族放大,这张图不重画,只标它走原生接法、待建。
图 G4 · 过门阈值 + 采集字段
没有数字阈值,go/no-go 必然滑成「再调一轮」,退路树也跟着悬空。这张图把过门判据钉成五维带精确阈值的硬门加一道软门,左半部分就是这五维。前四维是数字硬门、全绿才 go:过门率(L1 确定性门加三联动门加经济门全绿加 latch,★≥50% 起评、≥70% 算强信号,对照现行 factory 路 60% / cutover 门 80% 而 tier2 富游戏更难,spike 阶段先看是否显著大于 0、能否随模型档升),单款成本(★≤¥3/成功款,取现行 L2≤¥5 偏下、留自治多轮的空间,撞上限即触发退路),收敛步数(≤max_iters,★ 单系统 8 轮 / 整局 40 轮,防靠运气擦边、超即判不收敛),长程一致性(12+ 文件工程过程无 checkpoint 丢失、半轮副作用幂等无脏)。第五维是人锚软门——创始人试玩判一句「是不是个有肥鹅味的可玩雏形」,它不可被任何确定性指标替代,但单它也不构成 go:四维过了人锚却没味,仍按退路树分流,不强行放行。这张图最该让人看清的就是这种「数字硬门加人锚软门」的双重结构——既不让冷冰冰的指标全权裁定一款游戏好不好,也不让一票主观品味绕过客观地板。
右半部分是 run 级采集字段,每款一行。这一块存在的理由很硬:没有字段定义,跑完拿不到可对比的数。字段按用途分组——标识(run_id / model / stage / brief_variant),过门核心(pass 取 verdict.pass、repairs 取 studio 的 attempt 计数即自治循环轮数),失败定位(fail_stage 落在 extract / validate / build / seven_gate / 三联动门 / 经济门哪一段、fail_system 落在 resource / merge / order / 表现层哪个系统),成本与墙钟(cost_rmb 与 tokens_by_model 取 new-api quota 口径经 cost.py 折¥、wall_s 端到端耗时),长程一致性三字段(file_count / total_loc 加 ctx_compressed / checkpoint_recovered / idempotency_clean,直接喂判据④)。fail_system 这一列是经营品类特有的、也是退路树分流的关键依据——它能区分「整轨范式不行」和「某个系统的骨架缺口」,这两者的退路完全不同。
图里有一个字段块特意标了「仅第二段」,这是这张图埋的一条设计线。自产 driver 安全三字段(driver_authored / driver_rejected_by_review / driver_edits)只在第二段开放自产 driver 时采,第一段不采——因为第一段的 driver 是人预建的、不让 agent 碰,根本不存在「写者判自己卷子」的风险。这条字段块对应的是 Goodhart 防线:防 agent 用改 driver 来逃避卡死探测、防它把判卷的 driver 写成只读不暴露真实力的字段。底部那条汇总带把这些 run 级字段卷成矩阵级三张图(过门率 = pass 款数 / n、¥/成功款 = Σcost / pass 款数、收敛中位数、fail_system 分布),它们就是 go/no-go 的直接输入,对照左半的阈值和退路树触发线判。最该 review 的缝同样是那些 ★ 阈值——50%/70% 的过门率门和 ¥3/款 的成本闸都是建议值,需要创始人和实测校准,这张图把它们标出来而不是假装它们已经定死,正是为了不让一个还没校准的数字悄悄变成生死线。
图 G5 · 两段实施 + 退路树
这张图是 spike「怎么验、崩了往哪退」的可执行 runbook,核心设计是变量隔离的两段。第一段是纯模型变量:driver 是人预建的、冻结的,不让 agent 碰,只测「填差异」这一个变量。它先预建(人投入,Opus 或人写,靠现行件)——固定的 mini-肥鹅 经营骨架工程(三系统加耦合点、先天过 boot)、人工 driver(点合成 / 凑单 / 交单的确定性序列)、数据表 schema(留空给 LLM 填)、共用资产池占位图;再跑(便宜模型自治填那 56%)——便宜模型在骨架上填数据表加写表现层,跑的是 Agent 内 ReAct 多轮(max_iters 放开,不是 studio 现行那种 max_iters=1 加外层 repair 的形态),循环是「写源→build→headless 快检→L1 门→读 verdict→改」,spike 最小版直接最小 AgentScope 加硬编码配置、不上 service 也不上 Agent Team 和配置外置;最后采集加第一段 gate(过门率 / 成本 / 收敛是否达阈值)。把 driver 冻死在第一段,是为了让这一段的结果干净——过门率高低只反映模型填得好不好,不掺杂 driver 写得好不好。
第一段证通才进第二段开放自产 driver,这一段测自治上限加 Goodhart 安全,整段待建。它放开让 agent 自产或扩 harness 的 driver,但必须走三层隔离:agent 提议 driver(写者提交取证脚本但不许直接当判据),平台按 schema 和白名单编译(越界即拒),独立 adversarial 评审(一个不向着被评对象、专找漏洞的评审,查它是否覆盖真实玩家路径、是否读了作弊字段),三层全过才入验收。这三层隔离的要点就是图底那条红线铁律——写者不能写判自己游戏的那张卷子。两段之间的 gate 卡得很清,这是这张图第二个该让人看清的逻辑:第一段崩(纯模型变量就崩)直接进退路树、不开第二段,因为连固定 driver 都填不出来,放开让 agent 自产 driver 的开放自治只会更糟;第一段过、第二段挂在 driver 安全,判的是 Goodhart 防线的设计问题而不是模型问题——模型能写出来,是隔离防线没拦住作弊,该回去补防线、不该怪模型。把「模型问题」和「防线问题」用这道 gate 分开,是为了不让一次作弊翻车被误读成范式失败。
退路树是这张图的下半部分,它存在的全部意义是让 no-go 之后有确定的去处、绝不滑成无限调参。据 fail_system 分布(哪个系统 / 哪类错在收敛环里反复不收敛),按收敛失败模式分流出五个出口:Q1 问最强便宜档 v4-pro 在收敛环里能不能收敛,能就 GO 转第三步铺引擎(人锚仍须过);不能,再问 Q2 失败是否集中表现层,是就 R1 退向更模板化(判 56% 自治承重太重,改成更多预制表现模板、少 LLM 写);否则问 Q3 是否某系统装不出而其余能过,是就 R2 补骨架再试(判骨架 / driver 缺口、不是范式问题);否则问 Q4 是否便宜档全线都不收敛而强基线 Opus/Fable 能过,是就 R3 判便宜模型天花板(换更贵模型重估经济性、撞 ¥3/款 缓行,或整轨缓行),否则 KEEP 留观(既非全线崩也非天花板,据失败模式微调前置物再跑一轮 n=5)。这五个出口每一个都是「据收敛失败模式裁定一步」,退路树真能被触发、不悬空,这正是「绝不滑成无限调参」这条铁律在图上的落地。自产 driver 三层隔离的更细展开在 D 族(D4),这张图只画到三层的形状,不重画。
3 图清单与状态表
| # | 图名 | 形式 | 状态 | 覆盖内容 |
|---|---|---|---|---|
| G1 | 建设五步 + 0号 spike 生死门 | SVG · 纵向五步 + 旁路框 | 建(tier2 待建 · 五步 + spike 生死门)/ 缓(Cocos 轴 = 远期紫) | 五步纵列(搭 AgentScope / 配置外置 / 搭 Phaser 引擎 / 自治过人审 / Cocos 加渠道 adapter);spike 插在二三步间、过 go / 不过 no-go;第三步五块隐藏硬工作(验收地板 / Goodhart 安全 / 成本强制 / 源项目契约 / 可观测早建)+ 第四步三块(终审判据 / 终审吞吐 / player panel 减负) |
| G2 | mini-肥鹅 靶子规格 | SVG · 三系统拓扑 + 胜负 latch | 建(tier2 待建 · spike 靶子施工图) | 合成 / 资源 / 订单三系统的数据表与确切耦合点(资源 = 读写交汇、跨表可达性 = 核心考点);赢(金币达 100)与输(连续 3 单流失)双路径 latch;内容量 12 物品 / 6 链 / 5 订单 / 2 货币;相对 wanglanmei-ref 的砍法 |
| G3 | 模型矩阵 + 跑序 | SVG · 矩阵表 + 跑序流程 | 现(deepseek 两档 / mini-desktop 已有)/ 建(tier2 spike 矩阵)/ 缓(Opus·Fable 仅基线) | 四角色档(v4-flash 主力 / v4-pro 强便宜 / M3 中等 agentic / Opus·Fable 上限基线)各自模型与样本量;5 题面变体各 1 = n=5(有错追加 5)、跑在 mini-desktop;跑序(先 M3 证路 → 便宜档比成本,2026-06-21 创始人定) |
| G4 | 过门阈值 + 采集字段 | SVG · 五维判据 + 字段分组 | 建(tier2 待建 · spike 阈值 + 采集字段;★ 需创始人和实测校准) | 五维过门(过门率 ★≥50%/70% / 单款成本 ★≤¥3 / 收敛步数 ★8·40 轮 / 长程一致性 / 人锚软门);run 级采集字段(标识 / pass·repairs / fail_stage·fail_system / cost·tokens·wall / 长程三字段 / 自产 driver 安全仅第二段);汇成矩阵级三张图当 go/no-go 直接输入 |
| G5 | 两段实施 + 退路树 | SVG · 两段泳道 + 退路决策树 | 建(tier2 待 0号 spike 验证) | 第一段纯模型变量(预建 / 跑 / 采集 gate,driver 冻结)、第二段开放自产 driver(三层隔离 + 两项采集);两段间 gate 铁律(第一段崩不开第二段、第二段挂 driver 判防线问题);退路树五出口(GO / R1 退模板化 / R2 补骨架 / R3 天花板 / KEEP 留观)据三条数字触发线分流 |