按图说整条架构组织的 tier2 实现主轴:先 AgentScope 集成+环境(单写起步·不上 Service)→ M3(代码/逻辑)+mmx(资产)连续迭代;0号 spike 软化为顺序、判据保持离散(A门 M3 证路软 / B门便宜档 n≥30 硬 / 退路树沿用实现详设数字触发线)。 纳入 Codex+Opus 双评审修订:R1 拆 pre/post-spike·种子 studio.py 2.0.1→2.0.3 迁移·CDP 对 Phaser 是重写且为 spike 前置阻断项·两道证据门+硬区分历史证据(Tier0/1 声明壳≠Phaser 富游戏自治)·mmx 最简形态·阈值引实现详设不复列·forbidden-import 升 pre-spike CI。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
19 KiB
date, topic, status
| date | topic | status |
|---|---|---|
| 2026-06-22 | tier2-整体实现方案 | 草案 · 已纳入 Codex+Opus 双评审并修订 |
tier2 富游戏自治生成线 · 整体实现方案
Summary
为 tier2 富游戏自治生成线立一份整体实现方案:按《agentic 运行时架构图说》整条运行时架构组织(两阶段 / 四层地基 / 三层校验 / 共用控制面 / 建设五步),执行顺序定为先完成 AgentScope 集成与环境的设计和初始化,再用 M3(写代码与逻辑)+ mmx(产美术与音乐资产)连续迭代优化生成引擎。关键是顺序软、判据硬:迭代是连续的,但生成证据的判据保持离散可判定——M3 证路为软门、便宜档 n≥30 为硬门、退路树沿用《tier2 实现详设》的数字触发线,只有硬门通过才转入重型组件投入。本方案的实质增量集中在"起步集成 + 生成迭代的排序与判据";"重机器"阶段为指向属主档的收口指针,不在本方案展开实现决策。
Problem Frame
tier2 这条线的"要造什么"已经想透并经 2026-06-20 对抗审查拍板:用约束自治(O2)的单写 ReAct agent,在一圈确定性验收门里把现有廉价流水线做不出的多系统富游戏(合成、经营、挂机)逼出来;引擎选 Phaser/Pixi(过无头硬筛、按 AI 作者视角取生态厚度);底座锁 AgentScope 2.0.3;验收按创始人定义的三层校验走。这些结论分别落在《自治富游戏引擎》《tier2 四层工程架构》《tier2 实现详设》《agentic 集成架构》和图说五份档里。
还没解决的是整体实现方案本身。它现在散在五份档里,各自把自己那片讲深,却没有一条把"先做什么、后做什么、什么时候才值得投重型组件"串起来的主轴;《自治富游戏引擎》还停在旧的"双层校验 / 九门"措辞,落后图说与实现详设一个版本;四层档 §11 还挂着六条跨档对齐 TODO 没收口。
更要紧的是这条线最深、也最没被证过的赌注——便宜或中等模型的自治 agent 能不能稳定写出那约 56% 的表现层。这里有一处必须硬区分、不能混:2026-06-18 已证的是便宜模型能产 Tier0/1 的声明式数据壳(gameDefinition)并过九门;而 tier2 要验的是完全不同、也更难的一档——便宜模型自治写真 Phaser 引擎工程的 56% 表现层,后者零证据。同理,王蓝莓那款 12 文件经营游戏与 2026-06-11 的 Phaser 五门 spike 证的都只是"形态"(真引擎工程装得下富游戏、Phaser 能过门),两次都是最贵模型 Fable 加重人工编排做到的,不是便宜模型自治。这份方案要做的,就是在尊重这个赌注现实的前提下,给出一条可照着动手、又不在未验证的机器上过度投入的实现主轴。
Key Decisions
-
执行顺序 = 先集成与环境,再连续迭代;但顺序软、判据硬。 不把 0 号 spike 当成建设前必须先过的离散生死门,而先把 AgentScope 集成与生成环境的设计和初始化做扎实(这部分无论 spike 结论如何都绕不过),随后直接用 M3 和 mmx 在真实环境里连续迭代生成质量。但"连续迭代"绝不等于没有退出条件:生成证据的判据保持离散可判定——M3 证路、便宜档 n≥30、退路树数字触发线(见 R11/R12),与《实现详设》的两段 gate 对齐。把顺序软化与判据软化解耦,是这次评审最要紧的一条纠正。
-
起步只跑单写实现(阶段 2),工作室 Agent Team(阶段 1)后置;这是范围裁剪、不是永久颠倒。 早期迭代先把单个写者 agent 的 ReAct 多轮循环 + L1 校验跑通,最快拿到"M3+mmx 能不能产出过门的 mini-肥鹅"这个真信号。生产态正式流程仍是阶段 1 工作室设计 → 阶段 2 单写实现;起步只跑阶段 2,是 spike / 早期证路对范围的裁剪,证据出来后恢复阶段 1。
-
集成方法论 = 用 agentscope-skill 逐条源码核对"复用 vs 自建",并含一项版本迁移。 集成阶段不靠记忆里的 API 印象动手,而是用
.claude/skills/agentscope-skill:读已 clone 的源码(/root/oss/agentscope,2.0.3)、查真实签名、浏览examples/的装配样例。要特别认一项工作:种子studio.py现依赖agentscope==2.0.1,fork 起步包含一项从 2.0.1 迁到 2.0.3 的 API 适配(参照四层档 §验证状态已列的纠偏清单),不是纯拷贝放开 max_iters 就能跑。 -
沙箱用自带 Workspace;浏览器探针对 Phaser 是重写、且是 spike 前置阻断项。 2.0.3 自带
Workspace(Local/Docker/E2B),代码、构建、shell 隔离开箱即用,不是阻断项。L1 确定性门要的"浏览器真跑 + 低层探针"不在内置里,接仓内现成 CDP harness(play.cdp.cjs)——但其探针硬编码 LittleJS 专属选择器与帧源,对 Phaser 是重写适配层、不是参数化;这条路径可行性(含 BrowserSandbox 是否够用、不够则自建薄沙箱)是属主标记的 spike 前置阻断项,须在迭代开跑前出结论。 -
先出硬证据,再建重机器。 即便采用"先集成再迭代"的顺序,仍把"便宜档 n≥30 的硬门通过"摆在投入重型组件(完整配置外置、控制面、第二装载分支、ReMe、工作室 Agent Team)之前。M3 单款跑通只是软门(证路),不等于便宜模型自治可投——这是把"最深赌注在最便宜时验"保留为可判定的硬约束,而非口头信心。
-
这份方案是收口型实现主轴,不另立第六份正典。 它指向五份属主档(spike 可跑 runbook 归实现详设、控制面治理归集成架构),把分散决策串成主轴并开列正典对齐动作,而不复制其内容。对齐动作此刻只执行确定不与在飞会话冲突的几处(如把《自治富游戏引擎》升到三层校验口径),其余与 §11 六条跨档 TODO 一并开列、留作 follow-up。
实现主轴(按图说架构组织 · 顺序软 / 判据硬)
flowchart TB
A["起步 · AgentScope 集成 + 环境设计/初始化<br/>单写(阶段2) · Agent+ReActConfig+Workspace 本地 runner(不上 Service)<br/>CDP harness 为 Phaser 重写(前置阻断验证) · mini-肥鹅 fixture<br/>mmx 作 agent 可调资产工具 · L1 门重写 · 成本计量接 new-api"]
A --> B["生成迭代 · M3 写代码/逻辑 + mmx 产美术/音乐<br/>单写 ReAct 多轮 · 三层校验(初期只 L1) · 四熔断"]
B --> GA{"A 门 · M3 证路(软)<br/>M3 跑通一款 + 创始人试玩判'有肥鹅味的可玩雏形'"}
GA -->|过| GB{"B 门 · 便宜档 n≥30(硬)<br/>过门率/¥/收敛 达《实现详设》阈值?"}
GA -->|不过| R["退路树(沿用《实现详设》数字触发线)<br/>更模板化 / 补骨架 / 便宜模型天花板换档"]
GB -->|过 · 硬证据| H["建重机器(此前不投)<br/>工作室 Agent Team(阶段1) · 第二装载分支+源项目契约<br/>完整配置外置 · 控制面接入 · 引擎能力包接口 · ReMe"]
GB -->|达退路触发线| R
H --> I["Phaser 自治产一款 · 过确定性地板 + 人工终审(对标肥鹅美食街)"]
I --> J["Cocos 生态 + Phaser 渠道 adapter(正交轴 · 后续)"]
这条主轴是图说"建设五步"的重排:把旧"建设前先过离散 spike 生死门"改为"顺序连续、判据离散",把旧第二步"配置外置"从 spike 之前挪进硬门之后的重机器(与四层档 §9"spike-grade 地基 vs 完整地基"一致),其余步骤次序不变。
Requirements
起步 · 集成与环境(无论生成证据如何都要做)
- R1. AgentScope 集成(pre-spike 档):起步只用
Agent+ReActConfig+Workspace跑本地/脚本 runner,不上官方 Agent Service / Agent Team / 配置外置(承《实现详设》spike 最小版"先不上 service")。Agent Service(REST + SSE + durable session)移到硬门通过后的生产接入阶段。 - R2. 单写循环演进 + 版本迁移:以种子
studio.py(现agentscope==2.0.1、ReActConfig(max_iters=1)+ 外层 repair)fork 起步,含一项 2.0.1→2.0.3 API 适配,并把多轮自治从外层 repair 搬进 Agent 内 ReAct(放开max_iters);运行期零依赖现有 worker。 - R3. Phaser 浏览器探针路径(pre-spike 阻断验证):Workspace 自带沙箱解决代码/构建/shell;L1 门要的浏览器真跑低层探针接现成 CDP harness(
play.cdp.cjs),其探针为 LittleJS 专属(#game-engine、window.__engine.snapshot().frame、帧判据、像素阈值),对 Phaser 是重写适配层。此路径可行性(含 BrowserSandbox 是否够用、不够则自建薄沙箱 + Phaser driver 重写工作包)是属主标记的 spike 前置阻断项,须在迭代开跑前出结论。 - R4. mini-肥鹅 fixture(迭代靶子 + spike 产物目录范本):按《实现详设》规格预建经营骨架工程(三系统 + 耦合点、先天过 boot,12 物品 / 6 合成链 / 5 订单 / 2 货币)。spike 产物以
Workspace.workdir本地多文件工程形态存在、由 harness 直接在该目录构建 + 真跑,不走正式源项目契约 / 落库(落库取回随重机器后置)。 - R5. mmx 资产管线(最简形态):起步把 mmx-cli 接成单写 agent 可调的资产工具(进 Toolkit、有 tool schema、与 M3 同在一个 ReAct 回路)产美术与音乐;用量计入成本台账。
- R6. L1 门抽象重写:现九门为 LittleJS 单文件壳而建、带病灶,tier2 抽象重写进 L1(多数引擎无关确定性门)+ L2(设计符合),补富游戏专属的跨表联动门与经济门,修 latch 病灶(胜利/弃守分流)。
- R7. 成本计量 + 轨迹最小版:接 new-api quota(per-model 折¥,复用
cost.py),落一个最小版轨迹仓;调试与对账当下就要。
生成迭代 · M3 + mmx · 判据离散
- R8. M3 走 Anthropic 原生端点 + smoke gate:用
AnthropicChatModel(不传 formatter 即自动配对AnthropicChatFormatter)+AnthropicCredential.base_url指 new-api/v1/messages+ 开 thinking 分离。启动前校验max_tokens严格大于thinking_budget;首个 M3 smoke 必须证明 thinking 分离 / 工具调用 / new-api quota 计费三者都通。模型统一从 new-api 出口走(baseUrl+NEWAPI_KEY),协议/SDK 不锁。 - R9. 三层校验初期只焊死 L1(编译/启动/运行错误,必须解决、循环),L2(设计符合)尽量、L3(M3 视觉软检)只评分;L3 绝不阻塞、绝不拒发,绝不让 LLM 给自己打分。
- R10. 四道熔断(步数硬顶 / 预算闸 / 卡死探测 / 双层超时),任一先触发即优雅收尾、每轮 checkpoint。早期迭代预算闸只需时间盒上限(token cap / deadline);强制 fail-closed 预算闸是规模化前项、非起步项。
- R11. 生成证据判据(离散,决定能否转重机器):A 门 = M3 证路(M3 自治跑通一款 mini-肥鹅、创始人试玩判"有肥鹅味的可玩雏形",软门,证"这条路走不走得通");B 门 = 便宜 / 强便宜档(deepseek-v4-flash / pro)按《实现详设》模型矩阵跑 n≥30,过门率 / ¥-per-成功款 / 收敛步数 / 失败分布达《实现详设》§过门判据阈值(硬门)。只有 B 门通过才允许转重机器或规模化投入。
- R12. 退路树(离散触发):沿用《实现详设》§退路树的数字触发线——v4-pro <40% 且失败集中表现层 → 更模板化;某系统反复装不出、其余能过 → 补骨架再试;便宜档全线 <20% 而强模型基线能过 → 便宜模型天花板、换档重估或缓行。达任一触发线即转退路、不再调参。
重机器 · B 门通过后才投
- R13. 阶段 1 工作室(Agent Team 星形):leader +
AgentCreate设计 worker +TeamSay收敛,设计 worker 只读(PermissionMode.EXPLORE)已有工程代码与工程内设计文档、与用户跨 session 多轮对话,设计结论写成工程内文档供下次迭代只读。 - R14. tier2 自己的源项目契约(类型标记 / 文件树 manifest / 入口 / 构建 profile / 依赖锁 / 内容哈希 / 落库寻址七要素)与第二装载分支,与 Tier0/1 的 ECS-lite 装载契约解耦并存、绝不回归现有产线;finish 工具的参数 schema 与该契约共用一份定义。
- R15. 完整配置外置(prompt / 编排 / 模型可配不发版)认领并引用《生成主线架构演进路线》(线A)阶段 2-3,不另立分期。
- R16. 接入共用控制面:tier2 入口接 D12 运行治理门(现仅覆盖 SAA、需补 tier2 入口与预算扣减 / 并发释放 / 失败补偿),轨迹按统一 trace 契约(
contracts/trace/additive 立位)写入,观测走官方TracingMiddleware→OTel→Studio。 - R17. 引擎能力包第一版薄做(Phaser 硬编码 + 一个 manifest 做 facet 归因与版本锁),真正的能力包接口等第二个引擎(Pixi)落地、有两个实现做依据再抽。
- R18. 长期记忆 / 经验召回按官方记忆框架接入(ReMe vs 树内 mem0 二选一,待起步前小验证 + 创始人定)。
收口 · 对齐(文档操作,与生成线需求分列)
- R19. 现在执行确定无冲突的正典档对齐:把《自治富游戏引擎》从旧"双层 / 九门"升到三层校验(L1/L2/L3)口径——机器判 = L1 + L2 确定性、人判含 L3(M3 视觉软检)为输入,与图说和实现详设拉平;只动与 gamedef 废除、与在飞会话无关的措辞。
- R20. 开列 §11 六条跨档 TODO 及其余漂移(studio.py "演进 vs fork"措辞统一、trace 契约立位时机、SAA 线 player 软门是否与 tier2 同步收紧等)作 follow-up doc-sync,留待统一安排时机执行。
- R21. forbidden-import 守门升为 pre-spike CI 静态检查验收项(= 四层档 §11 T4):禁运行期 import SAA 配置 / 现有
studio.py运行态 / L2 模型路由表;只许种子拷贝 + 显式传参复用cost.py/_client.py。
Success Criteria
生成证据是否值得转入重机器,由 R11 的两道门定,阈值沿用《tier2 实现详设》§过门判据表与§退路树(本处不复列、以免一题两源漂移):A 门软(M3 证路 + 创始人试玩),B 门硬(便宜档 n≥30 的过门率 / 单款成本 / 收敛步数 / 长程一致性达阈值)。阈值里标 ★ 的(¥3/款、50%/70% 过门率)为建议值、待实测与创始人校准;校准须通过显式变更,不是迭代中口头调整。
Scope Boundaries
早期不做(硬门通过后才投)
- 工作室 Agent Team 多 agent 设计(阶段 1)、官方 Agent Service 服务化、第二装载分支与完整源项目契约、完整配置外置(线A 阶段 2-3)、控制面 / 管理面 UI 完整化、引擎能力包接口抽象、ReMe 长期记忆治理、强制 fail-closed 预算闸——这些都排在 B 门硬证据之后。
本方案不做(属主在别处或别线 / 别会话)
- 不重排已有的 0 号 spike 可跑 runbook(归实现详设)与控制面治理细节(归集成架构)——只指向、只收口口径。
- 不碰 gamedef 废除(另一会话在做);不碰 SAA 廉价线运行态(运行期零耦合)。
- 不做 Cocos / Tier3 / 3D / 渠道导出——它们在另一条正交轴(编辑器、人在环),放在 Phaser 证成之后,不进 tier2 的无人值守自治循环。
- 不在本方案里拍实测类阈值(¥3/款、过门率、ReMe vs mem0),交迭代校准。
Dependencies / Assumptions
- 模型出口依赖 new-api 网关(
baseUrl+NEWAPI_KEY,凭据见docs/内网凭据与端点.md);M3 走其 Anthropic 端点,便宜档走各自端点,all roads 收口到一个计费平面。 - 依赖 mmx-cli(美术 / 音乐资产管线,创始人已亲验拍板)、仓内现成 CDP harness(
play.cdp.cjs)、已 clone 的 AgentScope 2.0.3 源码(/root/oss/agentscope)。种子studio.py现钉agentscope==2.0.1,迁移成本计入起步。 - 真跑与 e2e 在 mini-desktop(权威构建、x86 同构);6c6g 本机禁 chrome,不在本机跑浏览器。
- 假设 Workspace 自带沙箱 + 重写后的 Phaser CDP 探针足够覆盖 L1 确定性探针——这是 spike 前置阻断验证(R3)要先证的。
- 假设便宜 / 中等模型自治可达——这是全线最大的未验证假设,正是迭代要证的赌注。务必把它与"2026-06-18 已证便宜模型产 Tier0/1 声明式数据壳过门"硬区分:后者已证、是另一档;tier2 的 Phaser 富游戏自治零证据,历史 Fable+Phaser 只证形态。
Outstanding Questions
Resolve Before Planning(排执行前要定)
- R3 的 Phaser 浏览器探针路径可行性(BrowserSandbox 够不够、不够则自建薄沙箱 + driver 重写工作包)——属主标记的 spike 前置阻断项,迭代开跑前必须出结论。
- ReMe vs 树内 mem0 的长期记忆后端选型——起步前跑一个小验证 + 创始人定。
Deferred to Planning(排执行 / 迭代时再定)
- 过门率与成本阈值(¥3/款、50%/70%)的最终校准值,以及 B 门"n≥30"在 M3 证路后对各便宜档的具体分配。
- CDP 探针对 Phaser 重写的具体接口(帧源、canvas 注入、活动 hash 取法)。
- 第二装载分支与源项目契约的字段级细节、与 finish 工具 schema 的共用落点。
Sources / Research
- 属主设计档:
docs/architecture/架构/生成引擎/下《自治富游戏引擎》《tier2 四层工程架构》《tier2 实现详设》《agentic 集成架构》《agentic 运行时架构图说》(含 9 图)与《生成引擎图说》总入口。 - 框架实证:AgentScope 2.0.3 源码
/root/oss/agentscope;速查.agents/knowledge/agentscope-2.0.3-facts.md;集成方法论.claude/skills/agentscope-skill。仓内实证:种子依赖wg1/gen-worker/requirements-l2.txt(agentscope==2.0.1)、wg1/gen-worker/worker/agent_loop/studio.py:159(ReActConfig(max_iters=1))、CDP 探针play.cdp.cjs(LittleJS 专属硬编码)。 - 廉价线对照:
引擎与运行时.md(装载契约 / CDP harness 门坑)、固定游戏架构.md、设计合理性裁决.md(tier2 另起一轨的判决理由)。 - 关键记忆:
saa-agentic-infra-decision、m3-agentic-anthropic-protocol、generation-lifecycle-project-model、true-structured-foundation-proven(Tier0/1 声明式数据壳已证、与 tier2 硬区分)、mmx-asset-pipeline、tiered-engine-cocos-decision。