承接目录治理:上轮只压缩内容未减文件数,闭线工作记录仍平铺致目录看着仍一堆(创始人指出)。本次执行 B2 归档。 64 个 ≤06-15 闭线档(25 压缩桩 + 闭线 review/report/纪要/edit-plan)git mv 入 docs/agent-specs/_archive/(文件名不变、仍 git 跟踪可查)。热目录 ≤06-15 仅留 13 活档(决策/纲领/SoT/活spike)+13 个 06-16 在飞。 活资产 20 处旧路径引用(.agents/docs/memory/_index)同步改 _archive/,引用断裂复测=0;_index 活地图 + 治理档状态收口。约束:0 个 06-16 被移、orchestrator 等未跟踪在飞档零误纳。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
17 KiB
17 KiB
《W-G1 · 便宜模型生成能力天花板 + Claude-free 评估门》设计稿(review 版)
状态:review 版 · 2026-06-14 · 顶层走查稿(未改任何运行时代码)。 定位:在创始人 WG1-20 经典轻游戏基准 review(能力覆盖矩阵)之上,叠加获奖款压测批,把"便宜模型(DS-V4/M3/M2.7)+ 当前引擎/插件库"的生成能力天花板测出来;并一次性建成不依赖 Claude 的好玩/完整度评估门(Opus 仅作脚手架/校准器,生产退场),产出引擎/插件库缺口修复清单。 本 lane:分支
wg1/gen-worker。代码落wg1/gen-worker/(Python worker)+game-runtime/games/_wg1-gen/(生成产物+harness);零修改冻结契约(game-host.d.ts / boot-game-host.js / 6 受控面 / __GameBundle / bootGameHost,只消费)。 关联:七门真玩 harness 见wg1/gen-worker/REPORT.md;好玩基线 v2 见W-T1b review;agent-loop-v1 judge 决策表 E1–E6 与 generation-spike pilot 三 agent 闭环为本设计直接前身。
结论先行(三句话)
- review/可玩性验证已是生产 agent 职责,且有成体系设计——只是载体从「Claude review」换成「确定性 harness 门 + 便宜模型自评/互评 + 数据回路」。最大缺口是"好玩/完整度的可机判 rubric 尚未定稿"。本设计就补这块。
- 天花板 = 两条断崖:① 便宜模型生成过门率断崖;② 便宜模型 judge 与 Opus 金标准一致率断崖。按 4 档难度梯(冒烟/主力/经典压测/获奖压测)各自定位,顺带暴露插件库硬边界。
- Opus 只在"建门/校门"在场,建好即退:把好玩基线 v2 五要素蒸馏成生产可跑、Claude-free 的 rubric+确定性断言+校准过的便宜模型 judge。生产由 harness 门 + 便宜模型 judge + quality_score 承接。
1. 背景(事实基,带出处)
- 谁生成(创始人 2026-06-12 裁定):Fable 只造引擎,生产生成 = 便宜模型(new-api 网关
100.64.0.8:3000,只有 DeepSeek/MiniMax,无 Claude)。 - 现有验证设计(五块成一线,护城河=harness+评估+数据):
- 意图层:XC6「质量门禁分层自动化(验收不能只看能运行)」/ XP5「商业化就绪评分」/ P2「永不交付坏游戏」+GP3 / C5-GC5「评估先行,通过率=放行条件」。
- 落地层:① prompt 治理四道闸;② agent-loop-v1 judge 决策表 E1–E6(
ledger.jsonl实证 accept/fix/kill/schema_retry);③ generation-spike pilot 三 agent 闭环(策划/对抗红队/玩家裁决);④ quality_score 数据回路(computeQualityScore=clamp(60×完玩+20×like+20×share)→feed 重排,已 e2e);⑤ 好玩基线 v2 五要素(手感/美术统一/音乐/结构深度/角色壳)。
- 已落地实证(本 lane):便宜档 deepseek-v4-flash 生成 Pong/Simon/打地鼠 三款七门全过,单款 ¥0.01–0.03(<¥0.15 闸门)。但这三款偏简单,证地板不证天花板——这正是本设计要解决的。
- 创始人并行:WG1-20 经典轻游戏基准 review 已盘点 20 款经典街机的能力覆盖(~12 款✅、4 类缺口:文本 HUD/网格/CCD/FSM、已规避 A*),给出 6/8/6 三批切分;自动 judge 评分门尚未建(自标"五要素精确判据需开工前从评估门 spec 取齐")。
2. 目标 / 非目标
目标(本期交付)
- 生成能力天花板画像:便宜模型(DS-V4-Pro/Flash、M3、M2.7)在 4 档难度梯上的过门率梯度曲线 + 断崖点 + 四模型横比(过门率/重试/¥每过门 vs ¥0.15)。
- Claude-free 好玩/完整度评估门:Opus 蒸馏出跨品类通用 rubric + 确定性行为断言集,并校准便宜模型 judge(一致率达标才放行进生产)。
- agentic 多步自修复 worker(L2):生成→七门真玩→失败回喂→便宜模型自修复→重试≤N;兼做 AgentScope shakedown(分布式/持久化/L1 开销;验不过切 LangGraph)。
- 引擎/插件库缺口修复清单:4 类经典缺口 + 获奖款暴露的新硬边界(3D/tilemap/像素手感),各拖垮多少款 → 补门面优先级,喂插件库扩展波 v2。
非目标(本期不做)
- 不改冻结契约、不碰主线、不推 dev/2.0.0。
- 不做素材生成(ComfyUI/图音)、不接 AigcGenerateExecutor 生产接线、不做 quality_score 的 MQ 异步化(M5 大头,创始人轨)。
- 不追求获奖压测批的高通过率(本档测上限,重在出缺口实证 + judge 断崖定位)。
- 美术真好看/音乐真好听/真机 60fps 手感等感知项不假装自动判——显式留创始人亲玩主判(≤3 轮)。Opus 不在生产环。
3. 推荐方案
3.1 四档难度梯靶集(下三档=创始人能力矩阵,第四档=真天花板)
graph LR
A["批1 冒烟·6款<br/>全✅易<br/>验管线打通"] --> B["批2 主力·8款<br/>✅为主·中<br/>量化文本HUD/网格/swipe出错率"]
B --> C["批3 经典压测·6款<br/>含❌难<br/>证CCD/网格状态机缺口"]
C --> D["批4 获奖压测·K款<br/>真·上线获奖showcase<br/>测好玩/完整度真天花板+插件库硬边界"]
style D fill:#3a2a4a,stroke:#a060c0,color:#fff
- 批1–3 = 创始人 WG1-20 的 6/8/6:便宜地验管线 + 系统量化 4 类经典缺口出错率。
- 批4 获奖压测(本设计新增,你拍板加)= 真天花板:从你给的 20 款获奖清单里按"映射到能力缺口 + 探硬边界"原则挑选(终选见 §7 待确认),候选映射:
| 获奖款 | 压什么 | 预判 |
|---|---|---|
| LittleJS Platformer | tilemap 网格 + 文本 HUD + 相机 | 🟡 网格无门面,边界探针 |
| Celeste Classic / 2 | 像素级动量手感(shougan 上限) + tilemap | 🟡 手感是 judge 一致率主战场 |
| Stolen Sword | 战斗 FSM + 多状态动作 | 🟡 FSM 自写 |
| Dank Tombs / Tiny Dungeons | 俯视网格地牢 + 氛围光照 | 🟡 网格 + palette-post |
| Invader Overload | 弹幕 + 粒子 + 高速碰撞 | 🟡 CCD 边界 |
| Q1K3(3D FPS) | 3D 渲染 | ❌ 硬边界实证(预期造不出) |
Q1K3 单列为"硬边界实证":插件库 6 受控面无 3D,预期 ❌——这是发现("哪些类型超出插件库"=W-G1 核心交付项),不是失败。
3.2 生产闭环:五层叠门(Claude-free)
flowchart TD
G["便宜模型生成 GameHostFactory"] --> L0
L0["① 可测性红线<br/>必导出取证清单·不可机测不许过门"] --> L1
L1["② 确定性 harness 七门<br/>CDP真玩·零LLM·命门(含G输入有效A/B对照)"] --> L2
L2["③ rubric派生确定性断言<br/>五要素→checklist机测字段·只判达没达阈"] --> L3
L3["④ 便宜模型自评/互评agent<br/>策划/对抗红队/玩家裁决(pilot三角色生产化)"] --> L4
L4["⑤ 好玩基线v2评估门<br/>均分≥4 + S锚点≤2s + B预算 + 合规"] --> ONLINE
ONLINE["上线 quality_score 反哺<br/>完玩/like/share→feed重排"]
L1 -. "任一门挂→回喂具体失败门+证据" .-> G
style L1 fill:#2a3a4a,stroke:#4090c0,color:#fff
style L2 fill:#2a3a4a,stroke:#4090c0,color:#fff
- ②③ 确定性、零 LLM;④ 便宜模型(经 Opus 校准过一致率);感知项留创始人亲玩。
- agentic 自修复 = 虚线回喂:七门里哪门挂了 + 证据(如 G 门:输入无效)→ 便宜模型针对性自修 → 重试 ≤N。这是 agent-loop-v1 E1–E6 思想 + 我七门 harness 的合并,迁到 AgentScope。
3.3 Opus 的三个且仅有职责(脚手架,生产退场)
graph TD
O["Opus(实验脚手架)"] --> R1["①产rubric+确定性断言<br/>五要素从单样例(暖阳小卖部checklist.json)<br/>抽象成跨品类通用门→进评估门spec"]
O --> R2["②校准便宜模型judge<br/>Opus金标准 vs 便宜judge一致率<br/>达标放行/分歧回退确定性断言或亲玩"]
O --> R3["③去LLM化优先<br/>能转确定性断言的(七门式A/B·字段阈值·闭环可达)<br/>优先转·最小化对任何LLM依赖"]
R1 & R2 & R3 --> EXIT["蒸馏完成→Opus退场<br/>生产=harness门+便宜judge+quality_score"]
style EXIT fill:#2a4a2a,stroke:#40a040,color:#fff
4. 关键设计决策与取舍
| 决策 | 选择 | 取舍/理由 |
|---|---|---|
| 基准轴 | 经典阶梯 + 获奖压测批叠加 | 经典阶梯便宜验管线+能力矩阵;获奖款探真天花板+暴露插件库硬边界。additive,不撞创始人并行轨。 |
| 生成模式 | L1 单发 → L2 agentic 自修复 | 获奖款单发必造不出,必须多步;同时兼做 AgentScope shakedown。代价:token/¥上升、编排复杂度↑,故重试设上限 N、成本仍对照 ¥0.15 闸。 |
| judge 门归属 | 我建(Opus 蒸馏) | 最大缺口、最高价值。风险:须与创始人并行 judge 工作契约对齐——我产的 rubric/断言要能并入评估门 spec,不另起炉灶(见 §6)。 |
| Opus 定位 | 仅脚手架/校准器 | 生产无 Claude;蒸馏产物必须确定性 or 便宜模型可执行,严禁偷偷依赖 Opus 在环。 |
| 感知项(美术/音乐/手感) | 不自动判,留亲玩 | 现无多模态评判器;诚实分层,不冒充"自动判好玩"。 |
| 框架 | agentic 闭环跑 AgentScope | 验分布式/持久化/L1 开销;若不抵其复杂度,换轨触发→LangGraph or 自研薄编排(遵框架选型 review)。 |
5. 验收标准
- 生成天花板:产出 4 档 × 4 模型的过门率梯度表 + 断崖点;¥每过门款全 ≤¥0.15(获奖压测档可超,需标注并解释)。
- judge 校准:产出便宜模型 judge vs Opus 金标准一致率表(按品类×难度);给出"哪些要素便宜模型够判 / 哪些必须留确定性断言 or 亲玩"的结论。
- 评估门资产:跨品类 rubric + 确定性断言集成文,且确定性占比最大化(可机判项 / 总项)。
- 缺口实证报告:4 类经典缺口 + 获奖款新边界,各拖垮款数 + 补门面优先级(预判:文本 HUD > 网格 > swipe/拖拽 > CCD swept;获奖档另出 3D/tilemap/手感 边界结论)。
- 诚实分层:每项结论标 【实测】/【推断】/【假设】,三层证据(结构/可运行真玩/可接受)互不顶替。
6. 影响面 / 风险 / 兼容性
- [兼容·低风险] 零修改冻结契约,只在 lane 新增;新建独立日期 review 文件,与创始人 WG1-20 review 不同文件 → 零合并冲突。共享
.agents/不碰(待你后续通知再蒸馏入库)。 - [已核实·无阻塞 · 2026-06-14] 探网关实测:11 模型,bake-off 四目标
deepseek-v4-flash/deepseek-v4-pro/MiniMax-M2.7/MiniMax-M3全部渠道活、可路由(各打 1 发 ping;flash/pro/M2.7 为 reasoning 模型 finish=length 属正常,M3 1-token 回'ok')。早前"DeepSeek key 未激活"(作战清单:32)已过时/或指厂商直连——经 new-api 网关四模型即时可用,全 20+ 款 bake-off 无人侧 blocker。(另:MiniMax 实有 M2/M2.1/M2.5/M2.7/M3 + highspeed 阶梯,横比可按需扩。) - [协调风险] judge 门 rubric 与创始人并行评估门 spec 可能口径漂移。缓解:我的 rubric/断言从第一天就按"可并入评估门 spec"设计,落地位置待 §7 拍(进
contracts/prompts//评估门 spec 需对齐,先留 lane 亦可)。 - [能力边界] 获奖款用完整 LittleJS(drawText/tilemap/camera/3D),我们受控子集表达不了的部分预期 ❌——这是设计内的发现,非失败。
- [假设] 好玩基线 v2 五要素的精确阈值/权重/硬软门至今未定义(意图清单 XP5 五维/XC6 八维只做了并集)。本设计产出这些阈值作为 Opus 蒸馏物,但意图清单已冻结,落点是 master spec(HJ-GEN-001)或评估门 spec,不改意图清单。
7. 待确认项(走查后拍)
- 获奖压测批 K 款终选:§3.1 候选映射够不够?Q1K3(3D)是否确定单列"硬边界实证"(预期 ❌)?其余 19 款里还想点名哪几款?
- judge 门 rubric 落地位置:进
contracts/prompts/(与创始人评估门 spec 同源)还是先留 lanewg1/gen-worker/,待创始人评估门 spec 定稿再合并?(关系到协调风险大小) - 重试上限 N(agentic 自修复)与过门率断崖判定阈值(如连续档过门率跌破 X% 即判天花板)。
- AgentScope 引入粒度:整条 agentic 编排上 AgentScope,还是先"裸 client + 薄编排"验自修复闭环、再判是否值得上 AgentScope?(影响 shakedown 结论口径)
风险与假设(诚实标注)
- [verified] 现有验证设计五块、quality_score 公式、七门 harness、创始人 WG1-20 能力矩阵——均带出处(见 §1 链接 + REPORT.md:38-54 + EventIngestServiceImpl.java:302-326)。
- [verified] 本 lane 三款冒烟七门全过、¥0.01–0.03,已实证(REPORT.md)。
- [inferred] "便宜模型能产出获奖款级可玩件"是待验天花板,本设计不预断;预期在某难度档出现过门率断崖。
- [inferred] Q1K3 等 3D 款预期 ❌——基于插件库 6 受控面无 3D 透出(源码证伪,见创始人 review A.2)。
- [assumption] 便宜模型够不够当 judge 判完整度,无直接数据;靠 Opus 校准一致率定论(本设计核心待验项之一)。
- [verified·2026-06-14] bake-off 四模型(flash/pro/M2.7/M3)经 new-api 网关探活全部可路由,无人侧 blocker;早前"key 未激活"系引旧 doc(作战清单:32)过时表述,已核实纠正。
8. 决策记录 + 战略扩展(2026-06-14 拍板,supersede §7 待确认)
§7 四项落定:
- 获奖压测批 = 全 20 款获奖清单入压测档(Witchcat / Penny the Pumpkin / 13th Floor / Killed By A Pixel / Celeste Classic·1k·2 / Q1K3 / Tiny Dungeons / Greeble·2 / LOSSST / LittleJS Platformer / Stolen Sword / MINIPUNK / Evil Glitch·2 / Dank Tombs / Invader Overload / Lost Beacons)。Q1K3 等 3D 仍按"预期 ❌ 硬边界实证"处理(发现而非失败)。
- judge 门 rubric 落地 = canonical
contracts/prompts/(第 8 契约 Registry,与创始人评估门 spec 同源)→ master spec 含"与创始人 eval 门契约对齐"步,降协调风险。 - agentic 自修复重试上限 N=5;过门率断崖阈值(我提默认,待确认):某难度档过门率跌破 50% 即判该档为便宜模型生成天花板边界。
- AgentScope 引入 = 整条 agentic 编排上 AgentScope(不走"裸 client+薄编排"过渡档)。
战略扩展(本次最重要):
- Agent(AgentScope / 我方 agent 层)= 核心资产(呼应 XC1/GC1「harness=复利核心资产」)。
- Opus 职责扩展:不止建 Claude-free judge 门,还要 debug / 改进 agent scope——使便宜模型在打磨过的 agent 框架内产出高质量任务。目标从"测便宜模型天花板"升级为"用更好的 agent harness 抬高天花板"(harness 复利:工程沉淀在 harness,单次生成是消耗品)。
- Fable 暂不可用 → 脚手架 / 教师 / 编排层统一降级用 Opus(生产 in-loop 仍是便宜模型)。
架构守护栏(working 解读,待创始人纠正):
- "改进 agent scope" = 改进我方 agent 层(任务协议 / 状态模型 / 工具接口 / 循环模板 / 门禁 / 自修复逻辑 / judge 校准——GC9 明列的"要固化"项),AgentScope 框架本身保持可替换(不 fork 其内核,保留换轨 LangGraph 选项,遵 XC3/GC9 框架可替换铁律)。
- 便宜模型仍是生产 in-loop 角色(生成 / 自修复 / judge);Opus = builder / teacher / calibrator,建好即退,不进生产环(否则"生产无 Claude"前提破)。
质量评估架构 reframe(2026-06-14 创始人亲玩校准后拍定):
- 确定性 gate-H = 可玩性真值 / 地板(Claude-free):九门(七门假绿守卫 + H 机制/latch + I 控制手感)+ 适配性真玩 driver(读 state 接球,解盲打假阴性)。手感尽量拆成确定性门(latch 终态驻留 / 控制跟手 / 碰撞穿透[门 J 规划]);拆得掉的全自动判。
- player panel = 主观层,消费 gate-H,有结构性天花板:便宜 player(M3 静态截图 + flash 数据)判不出物理/碰撞/控制的交互手感——实证创始人把碰撞有问题的件判 fix、两 player 均高估(fun=4),text 还漏控制 bug。故 player 只判拆不掉的主观好玩/美术/节奏,且须人锚校准(
calibrate.pyvs 创始人labels.json)。 - 创始人 / 人锚不可替代(现阶段):是 gate-H 假阴性(盲打)+ player 漂移的最终纠偏。Opus 退场后,生产 = 确定性门 + 便宜 player + 创始人抽检 三层,无 Claude。
- gate-H 推广 = design agent 自产 gate-spec(exportState / driver / controlCheck / assertAfterPlay / expectLatch)→ 确定性门适用任意游戏,不再手写 brief(已建:
roles.py产 spec、studio.py抽取合入;实证 design agent 能产合法 spec)。