zizi c9f69d9d6d 治理: Skill 测试治理第一阶段——harness 控制平面 + 实现测试迁出运行时目录
范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):

1. 新增 harness/ 控制平面
   - skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
   - run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
     空跑与 skip-only 失败关闭、AST 测试形状门
   - manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
   - manifests/test-inventory.json:81 个测试资产登记
   - specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责

2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
   - 71 个测试文件迁移并修复项目根与临时目录运行导入
   - 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
   - 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
   - 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变

3. 运行时文档清理
   - 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
     只保留运行时合同;业务运行合同、额度、授权与离线模式均保留

4. SoT 同步
   - AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
   - 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
   - humanization 覆盖矩阵:活动测试路径同步迁移

验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。

已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
2026-08-19 01:50:20 +08:00

2.3 KiB
Raw Blame History

name, description, disable-model-invocation
name description disable-model-invocation
diagnose-ai-flavor 技能 3 诊断:对目标正文跑 active 规则库,产出带精确片段与证据的发现清单,检测完成自动落库。只查不改;没有本产物,revise-ai-flavor 拒绝启动。 true

诊断(scenario: deai_diagnose | purpose: detection | 槽位: 检测→detector)

何时用:每次生成后对候选正文跑一次;也可对既有正文回溯诊断。诊断是修订的唯一合法前置(专题-09 铁律:没诊断不能改)。

执行顺序

  1. scripts/diagnose_ai_flavor.py run --text-file <正文> --work-ref <作品引用> --output <产物.json>。
  2. 确定性层按五层合同执行:regex、handler、density 由代码运行;carrier scope 会屏蔽明确对白/场内载体;结构/语义层由模型或人产出 finding 后,用 --external-findings 注入。
  3. 外部 finding 必须绑定当前正文 hash、active 规则、规则版本和 layer;缺任一项直接拒绝。规则库指纹覆盖完整规则内容,触发器未升版本也会使旧诊断失效。
  4. 诊断建议保守:blocking mechanical 才可默认 repair,其它命中进入 ask/仲裁;carve-out 只作为候选,不自动删除。
  5. 产物头(text_hash、规则库版本、mode、发现清单)缺任何一项,下游视为诊断未发生。
  6. 检测完成即落库:example_run + example_quality_result(judge_kind=detection,绑正文 sha256);--offline 仅作显式离线回放。

输出合同

诊断产物 JSON:产物头 + findings[]。每条 finding 带 id / rule_id / spans / context_window / evidence / confidence / decision_proposal(确定性层产 ask,blocking 机械规则产 repair;语义层外部注入的 finding 可为 pending/ask/keep)。到这里一个字没改;作者可以只看报告不动手。

数据库读写合同

  • 读:无(规则与样例读 humanization/rules / humanization/samples 文件资产)。
  • 写:example_run(幂等 upsert,run_id=作品+文本哈希+规则库版本)、example_quality_result(append-only)。

红线

  • 诊断不得改正文、不得产 patch。
  • decision_proposal 只是机械层初步建议;候选/语义命中必须经过功能仲裁,不能当执行指令。
  • 命中不等于修改命令:发现清单是给仲裁的输入,不是执行指令。