lili 2f51439c55 feat(genre): 品类 rubric 喂 LLM 验证 agent 接线 + 解谜金标 play-spec(W-GENRE 品类件④)
cheap_verify 品类扩展接线(全 additive):load_genre_checklist 读 fixtures/genre-rubrics/<genre>.json(缺失/坏 JSON 退化为空,best-effort 绝不抛);同一次 judge 调用并入品类条目(规范四:每款一次评分),输出独立 genreHits/genreGroups 分组小计(规范二:分母与通用底座分开、不混合平均);genre=None 时 judge prompt 与解析输出与既有版本逐字节/逐键一致(锚定纪律,单测锁死)。run_studio 加 genre 透传(缺省 None=原行为);rubric 仍纯 LLM 非阻塞、不进 verdict/九门/达标判定;service driver 路不动(genre 路由进服务请求时再接)。

解谜金标 play-spec fixtures/golden-specs/puzzle.play-spec.json:tap-targets occupied 反应族 + score 递增断言 + expectLatch,只依赖 forensics 契约不绑定坐标(formalize p11b-tmpl 已验证过的 occupied spec);test_golden_specs 品类集同步加 puzzle(金标机器门)。

验证:test_genre_puzzle_assets 6 项全过(含 prompt 逐字节恒等/分组小计分母/漏答 genreChecks 兜底)、test_golden_specs 6/6、test_cheap_verify 14/14 零回归;test_roles 10/12 与 test_studio_smoke 0/4 为基线既有失败(主仓同状态,与本改动无关)。

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-02 22:36:15 -07:00
Description
No description provided
240 MiB
Languages
Java 38.3%
JavaScript 28.5%
Python 19.4%
Vue 6.2%
TypeScript 3.8%
Other 3.7%