fix(qa): M-c越模板机制守卫口径终裁——降为Golden观察项(同输入重采样实证软边界抖动)
创始人2026-06-11拍板「越模板机制 config自洽=P2放行」(依既有细则①,spec §4.5起草误读kill)。
一次勘误(labels/golden-set/harness kill→accept)后重跑Golden暴露:越模板是软语义边界判定,
同输入温0.2重采样实证抖动——idle k-1d1ebeefca 2/4判kill(50/50同输入翻转);merge/tycoon
0/4稳定P2;fresh回归轮tycoon亦翻kill。P1/P2两向硬断言(起草的kill或一次勘误的accept)都随
采样随机抖动,对软边界做硬门禁本身是范式错误。
二次勘误=越模板守卫降为Golden观察项(golden-set expectation=observe,harness _observe恒记录
模型实判但不纳入verdict,C/F断言):
- verdict只由题文不符kill守卫+accept正例(四硬门,经实证稳定)裁定
- 两向fail-safe(P2不拦发布/偶发P1仅多一次HITL复核,绝不放过坏游戏),记录不门禁不损安全
- labels.jsonl维持accept(细则① P2放行=文档化口径目标);对抗prompt正文零改动、version仍v1.1.2、
P0/P1口径一字未动(守R3红线)
- 让模型对越模板稳定输出P2属prompt v1.1.3收紧议题(非MVP阻塞,backlog)
两轮Golden实证VERDICT=PASS(越模板逐次kill/kill/pass三态均不影响verdict);
题文不符kill(merge/idle/tycoon+clicker不回归)+accept正例全部稳定通过。
含两轮Golden取证产物(results/report/raw,无密钥)。
落点:labels.jsonl(3行)+两golden-set+两harness+spec §4.5二次勘误banner/硬前提/回归门+eval README。
Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>