zizi
abadaa15e9
框架: 正文评测链职责重构收口(writer/detector/judge 单一职责)+决策修复+加固门+探针刷新
- writer/detector/judge 按父仓专题-03/04 单一职责拆分:WriterDraft v2(仅 candidateBody)、CandidateEnvelope v2(adapter 确定性绑定)、SemanticDetection v3(quote 唯一匹配/unknown-gapReason)、blind judge v3(双盲第三评中位);预算两层(启动预留=Σ plannedCalls×cap,修正旧 maxCalls×cap 的 $2250 阻断 bug)。
- 决策修复:补第六类混淆项「场景选择偏差」(集合级、只标注不改终态);模型归属口径(planner/writer/judge 固定 opus,extractor/detector 可用它模型,拆书走 M3 不经角色派发);eval 评分尺改链接+一句话引用 quality-gate。
- 加固执行门:探针合同绑定(probe.executionProfileSha256 须等于 writer profile 身份哈希),陈旧探针被机械阻断 EXECUTE_PROBE_CONTRACT_MISMATCH。
- 新增探针刷新工具 refresh_runtime_probe.py(可注入 invoker+失败关闭+重签同源 canonical_sha256),并已按新合同真实重测探针(绑定 9d319ea0,成本 $0.155)。
- 逐行复核后修复:省略号被当路径穿越误杀(claude_runtime 共用精确判定 contains_path_traversal,盲评/检测统一引用);检测 failed 分支测试缺口;评委报告↔模型原始输出绑定恢复(reviewerStructuredOutputs,防一致篡改报告评分);上下文 purpose 词汇两层对齐;盲评死代码清理。
- 全量离线测试约 800+ 项全绿(continuation/detect/quality-gate/read-context/replay-eval/parse-book 572/llm),不连库不调模型。
2026-07-25 04:44:10 +08:00
..
2026-07-13 16:01:46 +08:00
2026-07-20 20:59:41 +08:00
2026-07-25 04:44:10 +08:00
2026-07-19 22:19:47 +08:00
2026-07-25 04:44:10 +08:00
2026-07-22 14:07:34 +08:00
2026-07-25 04:44:10 +08:00
2026-07-09 09:58:56 -07:00
2026-07-09 09:58:56 -07:00
2026-07-19 13:54:22 +08:00
2026-07-13 11:44:11 +08:00
2026-07-20 20:59:35 +08:00
2026-07-25 04:44:10 +08:00
2026-07-09 09:58:56 -07:00
2026-07-09 09:58:56 -07:00
2026-07-25 04:44:10 +08:00
2026-07-25 04:44:10 +08:00
2026-07-25 04:44:10 +08:00
2026-07-16 23:49:04 +08:00
2026-07-09 09:58:56 -07:00
2026-07-20 18:42:35 +08:00