创始人2026-06-11拍板「越模板机制 config自洽=P2放行」(依既有细则①,spec §4.5起草误读kill)。 一次勘误(labels/golden-set/harness kill→accept)后重跑Golden暴露:越模板是软语义边界判定, 同输入温0.2重采样实证抖动——idle k-1d1ebeefca 2/4判kill(50/50同输入翻转);merge/tycoon 0/4稳定P2;fresh回归轮tycoon亦翻kill。P1/P2两向硬断言(起草的kill或一次勘误的accept)都随 采样随机抖动,对软边界做硬门禁本身是范式错误。 二次勘误=越模板守卫降为Golden观察项(golden-set expectation=observe,harness _observe恒记录 模型实判但不纳入verdict,C/F断言): - verdict只由题文不符kill守卫+accept正例(四硬门,经实证稳定)裁定 - 两向fail-safe(P2不拦发布/偶发P1仅多一次HITL复核,绝不放过坏游戏),记录不门禁不损安全 - labels.jsonl维持accept(细则① P2放行=文档化口径目标);对抗prompt正文零改动、version仍v1.1.2、 P0/P1口径一字未动(守R3红线) - 让模型对越模板稳定输出P2属prompt v1.1.3收紧议题(非MVP阻塞,backlog) 两轮Golden实证VERDICT=PASS(越模板逐次kill/kill/pass三态均不影响verdict); 题文不符kill(merge/idle/tycoon+clicker不回归)+accept正例全部稳定通过。 含两轮Golden取证产物(results/report/raw,无密钥)。 落点:labels.jsonl(3行)+两golden-set+两harness+spec §4.5二次勘误banner/硬前提/回归门+eval README。 Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
Description
No description provided
Languages
Java
38.3%
JavaScript
28.5%
Python
19.4%
Vue
6.2%
TypeScript
3.8%
Other
3.7%