3.8 KiB
Raw Blame History

name, description, disable-model-invocation
name description disable-model-invocation
adjudicate-quality-gate 从不可变逐层回执构建 Gate 输入,并按父仓专题-04 的固定顺序产出 Gate A/B 终态与可核验 receipt。回放评测收集完逐样本脱敏结果、需要一个不可协商的通过/不通过裁决时使用;不评分、不改样本、不放宽阈值。 true

Gate 裁决(scenario: writer_gate | 保护节点→裁决 | 上下文=逐样本脱敏结果)

评分与裁决是两件事:评分回答"这一章多好",裁决回答"这一组样本够不够放行"。评分口径(维度、锚点、达标线)归 score-content-quality,本 Skill 只消费它的结论做集合级判定,不重复定义任何维度。回放编排归 replay-writer-gate 与 evaluate-frozen-replay,它们只提交样本、不产生终态。

输入

模块 职责
scripts/gate_input_builder.py 从不可变逐层回执唯一构建 writer-gate-input;任一来源、身份或哈希无法闭合即失败关闭。
scripts/writer_gate.py Gate A/B 确定性唯一判定器:只读逐样本脱敏结果,可信边界内自算全部统计值,产出终态与 receipt。

只信任 gate-input.json.samples[] 的逐样本脱敏结果。有效样本数、作品数、场景覆盖、C 臂硬门统计、C-A 五维增量与退化比例全部由判定器内部重算;顶层传入的同名聚合值和聚合 confounds 一律不参与裁决——上游能伪造汇总,就能伪造终态。

预算、授权或执行合同不合法时不得生成 Gate 输入。

输出

Gate 终态加一份 receipt。receipt 经 record-run-evidence 的 FileCas 落盘,可被 verify_writer_gate_receipt 独立复核;复核只读 receipt 与 CAS,不需要重跑回放。

六类混淆项与终态一同报告:假阴、假阳、泄露、评委不稳定、新角色无卡、场景选择偏差。前五类逐样本汇总。场景选择偏差是集合级混淆项:评测集 workId 去重少于两个(单作品),或未覆盖全部预注册场景类型(只挑卡友好场景)时产出 finding,标记该样本集对"卡是否有效"不具代表性、不得据此得出普适结论。它只作报告标注,不改写任何 Gate 终态。

Gate B 必须分别报告五类场景的 C-A。任一已有稳定样本的场景平均退化超过 0.25 即失败,禁止用其他场景的增益抵消。

数据边界

Gate 报告与 receipt 经 FileCas 落盘(不经 PostgreSQL 存正文)。Gate 终态在 writer_gate.issue_gate_report_and_receipt 完成后调 record-run-evidence 的 propose_lesson_dedup 登记 example_lesson(绑定 runId 与 gateReportSha256);离线测试可传 persist_lesson=False 跳过。不读写创作目录其它表。

安全输出只允许标识符、枚举、数字、短摘要与 SHA-256。禁止把候选正文、引文、事实文本、prompt/response、raw 路径或供应商原始响应写进 Gate 输入、报告或 receipt。

复利合同

  • Gate B passed 登记 win;短路/未过登记 lesson,均幂等键为 run_id + 固定 title。
  • 升格判据与 score-content-quality 退化模式一并进入 example_lesson 评审链,不自动升格范式。

红线

  • 终态只由本 Skill 产生。回放编排层、评分层与人工都不得产生或改写 Gate 终态;命中较高优先级终态后不得用较低优先级条件回改。
  • 不放宽阈值。阈值是元数据(父仓专题-04 的质量策略族),本 Skill 只执行;策略变了改策略,不改判定器。
  • 不自算评分。维度定义、分数锚点与达标口径的单一来源是 score-content-quality/scripts/writer_rubric.py,本 Skill 导入而不复制。
  • 失败关闭:来源哈希不闭合、样本身份不可验证、必填统计缺失时不产终态,退出非零。