games-development-ai/docs/brainstorms/2026-06-22-tier2-整体实现方案-requirements.md
zizi 4f2239ac57 docs(tier2): 整体实现方案 brainstorm——顺序软/判据硬·先集成再用 M3+mmx 迭代
按图说整条架构组织的 tier2 实现主轴:先 AgentScope 集成+环境(单写起步·不上 Service)→ M3(代码/逻辑)+mmx(资产)连续迭代;0号 spike 软化为顺序、判据保持离散(A门 M3 证路软 / B门便宜档 n≥30 硬 / 退路树沿用实现详设数字触发线)。

纳入 Codex+Opus 双评审修订:R1 拆 pre/post-spike·种子 studio.py 2.0.1→2.0.3 迁移·CDP 对 Phaser 是重写且为 spike 前置阻断项·两道证据门+硬区分历史证据(Tier0/1 声明壳≠Phaser 富游戏自治)·mmx 最简形态·阈值引实现详设不复列·forbidden-import 升 pre-spike CI。

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-22 19:05:16 +00:00

19 KiB
Raw Blame History

date, topic, status
date topic status
2026-06-22 tier2-整体实现方案 草案 · 已纳入 Codex+Opus 双评审并修订

tier2 富游戏自治生成线 · 整体实现方案

Summary

为 tier2 富游戏自治生成线立一份整体实现方案:按《agentic 运行时架构图说》整条运行时架构组织(两阶段 / 四层地基 / 三层校验 / 共用控制面 / 建设五步),执行顺序定为先完成 AgentScope 集成与环境的设计和初始化,再用 M3写代码与逻辑+ mmx产美术与音乐资产连续迭代优化生成引擎。关键是顺序软、判据硬迭代是连续的但生成证据的判据保持离散可判定——M3 证路为软门、便宜档 n≥30 为硬门、退路树沿用《tier2 实现详设》的数字触发线,只有硬门通过才转入重型组件投入。本方案的实质增量集中在"起步集成 + 生成迭代的排序与判据""重机器"阶段为指向属主档的收口指针,不在本方案展开实现决策。

Problem Frame

tier2 这条线的"要造什么"已经想透并经 2026-06-20 对抗审查拍板用约束自治O2的单写 ReAct agent在一圈确定性验收门里把现有廉价流水线做不出的多系统富游戏合成、经营、挂机逼出来引擎选 Phaser/Pixi过无头硬筛、按 AI 作者视角取生态厚度);底座锁 AgentScope 2.0.3;验收按创始人定义的三层校验走。这些结论分别落在《自治富游戏引擎》《tier2 四层工程架构》《tier2 实现详设》《agentic 集成架构》和图说五份档里。

还没解决的是整体实现方案本身。它现在散在五份档里,各自把自己那片讲深,却没有一条把"先做什么、后做什么、什么时候才值得投重型组件"串起来的主轴;《自治富游戏引擎》还停在旧的"双层校验 / 九门"措辞,落后图说与实现详设一个版本;四层档 §11 还挂着六条跨档对齐 TODO 没收口。

更要紧的是这条线最深、也最没被证过的赌注——便宜或中等模型的自治 agent 能不能稳定写出那约 56% 的表现层。这里有一处必须硬区分、不能混2026-06-18 已证的是便宜模型能产 Tier0/1 的声明式数据壳gameDefinition并过九门;而 tier2 要验的是完全不同、也更难的一档——便宜模型自治写真 Phaser 引擎工程的 56% 表现层,后者零证据。同理,王蓝莓那款 12 文件经营游戏与 2026-06-11 的 Phaser 五门 spike 证的都只是"形态"真引擎工程装得下富游戏、Phaser 能过门),两次都是最贵模型 Fable 加重人工编排做到的,不是便宜模型自治。这份方案要做的,就是在尊重这个赌注现实的前提下,给出一条可照着动手、又不在未验证的机器上过度投入的实现主轴。

Key Decisions

  • 执行顺序 = 先集成与环境,再连续迭代;但顺序软、判据硬。 不把 0 号 spike 当成建设前必须先过的离散生死门,而先把 AgentScope 集成与生成环境的设计和初始化做扎实(这部分无论 spike 结论如何都绕不过),随后直接用 M3 和 mmx 在真实环境里连续迭代生成质量。但"连续迭代"绝不等于没有退出条件生成证据的判据保持离散可判定——M3 证路、便宜档 n≥30、退路树数字触发线见 R11/R12与《实现详设》的两段 gate 对齐。把顺序软化与判据软化解耦,是这次评审最要紧的一条纠正。

  • 起步只跑单写实现(阶段 2工作室 Agent Team阶段 1后置这是范围裁剪、不是永久颠倒。 早期迭代先把单个写者 agent 的 ReAct 多轮循环 + L1 校验跑通,最快拿到"M3+mmx 能不能产出过门的 mini-肥鹅"这个真信号。生产态正式流程仍是阶段 1 工作室设计 → 阶段 2 单写实现;起步只跑阶段 2是 spike / 早期证路对范围的裁剪,证据出来后恢复阶段 1。

  • 集成方法论 = 用 agentscope-skill 逐条源码核对"复用 vs 自建",并含一项版本迁移。 集成阶段不靠记忆里的 API 印象动手,而是用 .claude/skills/agentscope-skill:读已 clone 的源码(/root/oss/agentscope2.0.3)、查真实签名、浏览 examples/ 的装配样例。要特别认一项工作:种子 studio.py 现依赖 agentscope==2.0.1fork 起步包含一项从 2.0.1 迁到 2.0.3 的 API 适配(参照四层档 §验证状态已列的纠偏清单),不是纯拷贝放开 max_iters 就能跑。

  • 沙箱用自带 Workspace浏览器探针对 Phaser 是重写、且是 spike 前置阻断项。 2.0.3 自带 WorkspaceLocal/Docker/E2B代码、构建、shell 隔离开箱即用不是阻断项。L1 确定性门要的"浏览器真跑 + 低层探针"不在内置里,接仓内现成 CDP harnessplay.cdp.cjs)——但其探针硬编码 LittleJS 专属选择器与帧源,对 Phaser 是重写适配层、不是参数化;这条路径可行性(含 BrowserSandbox 是否够用、不够则自建薄沙箱)是属主标记的 spike 前置阻断项,须在迭代开跑前出结论。

  • 先出硬证据,再建重机器。 即便采用"先集成再迭代"的顺序,仍把"便宜档 n≥30 的硬门通过"摆在投入重型组件完整配置外置、控制面、第二装载分支、ReMe、工作室 Agent Team之前。M3 单款跑通只是软门(证路),不等于便宜模型自治可投——这是把"最深赌注在最便宜时验"保留为可判定的硬约束,而非口头信心。

  • 这份方案是收口型实现主轴,不另立第六份正典。 它指向五份属主档spike 可跑 runbook 归实现详设、控制面治理归集成架构),把分散决策串成主轴并开列正典对齐动作,而不复制其内容。对齐动作此刻只执行确定不与在飞会话冲突的几处(如把《自治富游戏引擎》升到三层校验口径),其余与 §11 六条跨档 TODO 一并开列、留作 follow-up。

实现主轴(按图说架构组织 · 顺序软 / 判据硬)

flowchart TB
  A["起步 · AgentScope 集成 + 环境设计/初始化<br/>单写(阶段2) · Agent+ReActConfig+Workspace 本地 runner(不上 Service)<br/>CDP harness 为 Phaser 重写(前置阻断验证) · mini-肥鹅 fixture<br/>mmx 作 agent 可调资产工具 · L1 门重写 · 成本计量接 new-api"]
  A --> B["生成迭代 · M3 写代码/逻辑 + mmx 产美术/音乐<br/>单写 ReAct 多轮 · 三层校验(初期只 L1) · 四熔断"]
  B --> GA{"A 门 · M3 证路(软)<br/>M3 跑通一款 + 创始人试玩判'有肥鹅味的可玩雏形'"}
  GA -->|过| GB{"B 门 · 便宜档 n≥30(硬)<br/>过门率/¥/收敛 达《实现详设》阈值?"}
  GA -->|不过| R["退路树(沿用《实现详设》数字触发线)<br/>更模板化 / 补骨架 / 便宜模型天花板换档"]
  GB -->|过 · 硬证据| H["建重机器(此前不投)<br/>工作室 Agent Team(阶段1) · 第二装载分支+源项目契约<br/>完整配置外置 · 控制面接入 · 引擎能力包接口 · ReMe"]
  GB -->|达退路触发线| R
  H --> I["Phaser 自治产一款 · 过确定性地板 + 人工终审(对标肥鹅美食街)"]
  I --> J["Cocos 生态 + Phaser 渠道 adapter(正交轴 · 后续)"]

这条主轴是图说"建设五步"的重排:把旧"建设前先过离散 spike 生死门"改为"顺序连续、判据离散",把旧第二步"配置外置"从 spike 之前挪进硬门之后的重机器(与四层档 §9"spike-grade 地基 vs 完整地基"一致),其余步骤次序不变。

Requirements

起步 · 集成与环境(无论生成证据如何都要做)

  • R1. AgentScope 集成pre-spike 档):起步只用 Agent + ReActConfig + Workspace 跑本地/脚本 runner不上官方 Agent Service / Agent Team / 配置外置承《实现详设》spike 最小版"先不上 service"。Agent ServiceREST + SSE + durable session移到硬门通过后的生产接入阶段。
  • R2. 单写循环演进 + 版本迁移:以种子 studio.py(现 agentscope==2.0.1ReActConfig(max_iters=1) + 外层 repairfork 起步,含一项 2.0.1→2.0.3 API 适配,并把多轮自治从外层 repair 搬进 Agent 内 ReAct放开 max_iters);运行期零依赖现有 worker。
  • R3. Phaser 浏览器探针路径pre-spike 阻断验证Workspace 自带沙箱解决代码/构建/shellL1 门要的浏览器真跑低层探针接现成 CDP harnessplay.cdp.cjs),其探针为 LittleJS 专属(#game-enginewindow.__engine.snapshot().frame、帧判据、像素阈值),对 Phaser 是重写适配层。此路径可行性(含 BrowserSandbox 是否够用、不够则自建薄沙箱 + Phaser driver 重写工作包)是属主标记的 spike 前置阻断项,须在迭代开跑前出结论。
  • R4. mini-肥鹅 fixture迭代靶子 + spike 产物目录范本):按《实现详设》规格预建经营骨架工程(三系统 + 耦合点、先天过 boot12 物品 / 6 合成链 / 5 订单 / 2 货币。spike 产物以 Workspace.workdir 本地多文件工程形态存在、由 harness 直接在该目录构建 + 真跑,不走正式源项目契约 / 落库(落库取回随重机器后置)。
  • R5. mmx 资产管线(最简形态):起步把 mmx-cli 接成单写 agent 可调的资产工具(进 Toolkit、有 tool schema、与 M3 同在一个 ReAct 回路)产美术与音乐;用量计入成本台账。
  • R6. L1 门抽象重写:现九门为 LittleJS 单文件壳而建、带病灶tier2 抽象重写进 L1多数引擎无关确定性门+ L2设计符合补富游戏专属的跨表联动门与经济门修 latch 病灶(胜利/弃守分流)。
  • R7. 成本计量 + 轨迹最小版:接 new-api quotaper-model 折¥,复用 cost.py),落一个最小版轨迹仓;调试与对账当下就要。

生成迭代 · M3 + mmx · 判据离散

  • R8. M3 走 Anthropic 原生端点 + smoke gateAnthropicChatModel(不传 formatter 即自动配对 AnthropicChatFormatter+ AnthropicCredential.base_url 指 new-api /v1/messages + 开 thinking 分离。启动前校验 max_tokens 严格大于 thinking_budget;首个 M3 smoke 必须证明 thinking 分离 / 工具调用 / new-api quota 计费三者都通。模型统一从 new-api 出口走(baseUrl + NEWAPI_KEY),协议/SDK 不锁。
  • R9. 三层校验初期只焊死 L1编译/启动/运行错误必须解决、循环L2设计符合尽量、L3M3 视觉软检只评分L3 绝不阻塞、绝不拒发,绝不让 LLM 给自己打分。
  • R10. 四道熔断(步数硬顶 / 预算闸 / 卡死探测 / 双层超时),任一先触发即优雅收尾、每轮 checkpoint。早期迭代预算闸只需时间盒上限token cap / deadline强制 fail-closed 预算闸是规模化前项、非起步项。
  • R11. 生成证据判据离散决定能否转重机器A 门 = M3 证路M3 自治跑通一款 mini-肥鹅、创始人试玩判"有肥鹅味的可玩雏形",软门,证"这条路走不走得通"B 门 = 便宜 / 强便宜档deepseek-v4-flash / pro按《实现详设》模型矩阵跑 n≥30,过门率 / ¥-per-成功款 / 收敛步数 / 失败分布达《实现详设》§过门判据阈值(硬门)。只有 B 门通过才允许转重机器或规模化投入。
  • R12. 退路树离散触发沿用《实现详设》§退路树的数字触发线——v4-pro <40% 且失败集中表现层 → 更模板化;某系统反复装不出、其余能过 → 补骨架再试;便宜档全线 <20% 而强模型基线能过 → 便宜模型天花板、换档重估或缓行。达任一触发线即转退路、不再调参。

重机器 · B 门通过后才投

  • R13. 阶段 1 工作室Agent Team 星形leader + AgentCreate 设计 worker + TeamSay 收敛,设计 worker 只读(PermissionMode.EXPLORE)已有工程代码与工程内设计文档、与用户跨 session 多轮对话,设计结论写成工程内文档供下次迭代只读。
  • R14. tier2 自己的源项目契约(类型标记 / 文件树 manifest / 入口 / 构建 profile / 依赖锁 / 内容哈希 / 落库寻址七要素)与第二装载分支,与 Tier0/1 的 ECS-lite 装载契约解耦并存、绝不回归现有产线finish 工具的参数 schema 与该契约共用一份定义。
  • R15. 完整配置外置prompt / 编排 / 模型可配不发版认领并引用《生成主线架构演进路线》线A阶段 2-3不另立分期。
  • R16. 接入共用控制面tier2 入口接 D12 运行治理门(现仅覆盖 SAA、需补 tier2 入口与预算扣减 / 并发释放 / 失败补偿),轨迹按统一 trace 契约(contracts/trace/ additive 立位)写入,观测走官方 TracingMiddleware→OTel→Studio。
  • R17. 引擎能力包第一版薄做Phaser 硬编码 + 一个 manifest 做 facet 归因与版本锁真正的能力包接口等第二个引擎Pixi落地、有两个实现做依据再抽。
  • R18. 长期记忆 / 经验召回按官方记忆框架接入ReMe vs 树内 mem0 二选一,待起步前小验证 + 创始人定)。

收口 · 对齐(文档操作,与生成线需求分列)

  • R19. 现在执行确定无冲突的正典档对齐:把《自治富游戏引擎》从旧"双层 / 九门"升到三层校验L1/L2/L3口径——机器判 = L1 + L2 确定性、人判含 L3M3 视觉软检)为输入,与图说和实现详设拉平;只动与 gamedef 废除、与在飞会话无关的措辞。
  • R20. 开列 §11 六条跨档 TODO 及其余漂移studio.py "演进 vs fork"措辞统一、trace 契约立位时机、SAA 线 player 软门是否与 tier2 同步收紧等)作 follow-up doc-sync留待统一安排时机执行。
  • R21. forbidden-import 守门升为 pre-spike CI 静态检查验收项= 四层档 §11 T4禁运行期 import SAA 配置 / 现有 studio.py 运行态 / L2 模型路由表;只许种子拷贝 + 显式传参复用 cost.py / _client.py

Success Criteria

生成证据是否值得转入重机器,由 R11 的两道门定,阈值沿用《tier2 实现详设》§过门判据表与§退路树本处不复列、以免一题两源漂移A 门软M3 证路 + 创始人试玩B 门硬(便宜档 n≥30 的过门率 / 单款成本 / 收敛步数 / 长程一致性达阈值)。阈值里标 ★ 的¥3/款、50%/70% 过门率)为建议值、待实测与创始人校准;校准须通过显式变更,不是迭代中口头调整。

Scope Boundaries

早期不做(硬门通过后才投)

  • 工作室 Agent Team 多 agent 设计(阶段 1、官方 Agent Service 服务化、第二装载分支与完整源项目契约、完整配置外置线A 阶段 2-3、控制面 / 管理面 UI 完整化、引擎能力包接口抽象、ReMe 长期记忆治理、强制 fail-closed 预算闸——这些都排在 B 门硬证据之后。

本方案不做(属主在别处或别线 / 别会话)

  • 不重排已有的 0 号 spike 可跑 runbook归实现详设与控制面治理细节归集成架构——只指向、只收口口径。
  • 不碰 gamedef 废除(另一会话在做);不碰 SAA 廉价线运行态(运行期零耦合)。
  • 不做 Cocos / Tier3 / 3D / 渠道导出——它们在另一条正交轴(编辑器、人在环),放在 Phaser 证成之后,不进 tier2 的无人值守自治循环。
  • 不在本方案里拍实测类阈值¥3/款、过门率、ReMe vs mem0交迭代校准。

Dependencies / Assumptions

  • 模型出口依赖 new-api 网关(baseUrl + NEWAPI_KEY,凭据见 docs/内网凭据与端点.mdM3 走其 Anthropic 端点便宜档走各自端点all roads 收口到一个计费平面。
  • 依赖 mmx-cli美术 / 音乐资产管线,创始人已亲验拍板)、仓内现成 CDP harnessplay.cdp.cjs)、已 clone 的 AgentScope 2.0.3 源码(/root/oss/agentscope)。种子 studio.py 现钉 agentscope==2.0.1,迁移成本计入起步。
  • 真跑与 e2e 在 mini-desktop权威构建、x86 同构6c6g 本机禁 chrome不在本机跑浏览器。
  • 假设 Workspace 自带沙箱 + 重写后的 Phaser CDP 探针足够覆盖 L1 确定性探针——这是 spike 前置阻断验证R3要先证的。
  • 假设便宜 / 中等模型自治可达——这是全线最大的未验证假设,正是迭代要证的赌注。务必把它与"2026-06-18 已证便宜模型产 Tier0/1 声明式数据壳过门"硬区分后者已证、是另一档tier2 的 Phaser 富游戏自治零证据,历史 Fable+Phaser 只证形态。

Outstanding Questions

Resolve Before Planning排执行前要定

  • R3 的 Phaser 浏览器探针路径可行性BrowserSandbox 够不够、不够则自建薄沙箱 + driver 重写工作包)——属主标记的 spike 前置阻断项,迭代开跑前必须出结论。
  • ReMe vs 树内 mem0 的长期记忆后端选型——起步前跑一个小验证 + 创始人定。

Deferred to Planning排执行 / 迭代时再定)

  • 过门率与成本阈值¥3/款、50%/70%)的最终校准值,以及 B 门"n≥30"在 M3 证路后对各便宜档的具体分配。
  • CDP 探针对 Phaser 重写的具体接口帧源、canvas 注入、活动 hash 取法)。
  • 第二装载分支与源项目契约的字段级细节、与 finish 工具 schema 的共用落点。

Sources / Research

  • 属主设计档:docs/architecture/架构/生成引擎/ 下《自治富游戏引擎》《tier2 四层工程架构》《tier2 实现详设》《agentic 集成架构》《agentic 运行时架构图说》(含 9 图)与《生成引擎图说》总入口。
  • 框架实证AgentScope 2.0.3 源码 /root/oss/agentscope;速查 .agents/knowledge/agentscope-2.0.3-facts.md;集成方法论 .claude/skills/agentscope-skill。仓内实证:种子依赖 wg1/gen-worker/requirements-l2.txtagentscope==2.0.1)、wg1/gen-worker/worker/agent_loop/studio.py:159ReActConfig(max_iters=1)、CDP 探针 play.cdp.cjsLittleJS 专属硬编码)。
  • 廉价线对照:引擎与运行时.md(装载契约 / CDP harness 门坑)、固定游戏架构.md设计合理性裁决.mdtier2 另起一轨的判决理由)。
  • 关键记忆:saa-agentic-infra-decisionm3-agentic-anthropic-protocolgeneration-lifecycle-project-modeltrue-structured-foundation-provenTier0/1 声明式数据壳已证、与 tier2 硬区分)、mmx-asset-pipelinetiered-engine-cocos-decision