zizi c9f69d9d6d 治理: Skill 测试治理第一阶段——harness 控制平面 + 实现测试迁出运行时目录
范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):

1. 新增 harness/ 控制平面
   - skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
   - run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
     空跑与 skip-only 失败关闭、AST 测试形状门
   - manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
   - manifests/test-inventory.json:81 个测试资产登记
   - specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责

2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
   - 71 个测试文件迁移并修复项目根与临时目录运行导入
   - 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
   - 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
   - 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变

3. 运行时文档清理
   - 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
     只保留运行时合同;业务运行合同、额度、授权与离线模式均保留

4. SoT 同步
   - AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
   - 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
   - humanization 覆盖矩阵:活动测试路径同步迁移

验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。

已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
2026-08-19 01:50:20 +08:00

3.9 KiB
Raw Blame History

agent-example Harness

项目开发、验证和行为评测支架的入口与索引。 这里的文档和工具服务开发者与评测编排,不会作为任何 Skill 的运行时提示词自动注入 Agent。

1. 作用

agent-example 同时包含三种不同性质的验证工作:

  • 运行时文档的静态卫生检查;
  • 确定性工具、数据库边界和 fake pipeline 的机械测试;
  • 将 Skill 交给 Agent 后的外部行为评测。

Harness 负责把这三类工作分开编排并保留证据,不能用其中一类的通过结果冒充另一类结论。

2. 目录索引

harness/
├── README.md                         # 本入口:项目 harness 介绍、边界和索引
├── specs/
│   └── skill-testing.md              # Skill 测试与评测规范(唯一规范正文)
├── skill_harness.py                  # 运行时 Skill 文档静态审计入口
├── run_selected.py                   # 按 manifest 选择性执行测试
├── test_skill_harness.py             # 静态审计器离线测试
├── test_run_selected.py              # 选择性执行器离线测试
├── manifests/
│   ├── skills.json                   # 运行时 Skill 责任方与协作领域清单
│   └── test-inventory.json           # 测试分类、依赖、副作用与证据等级
└── evals/<skill>/                    # Skill 行为评测夹具与适配器(尚未建立)

项目级实现测试位于 `../tests/skills/<skill>/`,不进入运行时 Skill 目录。

现有专项支架:

路径 责任 证据边界
humanization/eval/run_eval.py 去 AI 味规则合同和回归陷阱试跑 规则合同回放,不证明文学效果
.claude/skills/evaluate-frozen-replay/ 正文/细纲冻结回放、盲评和质量门 评测编排与质量证据,不是通用 Skill 单测入口
harness/ 跨 Skill 的开发验证与行为评测治理 只编排和裁决证据,不拥有业务合同

3. 权威关系

  • .claude/skills/*/SKILL.md:Skill 的运行时行为合同;不放开发测试说明。
  • .claude/skills/*/scripts/:Skill 使用的运行时确定性实现与机械门。
  • tests/skills/<skill>/:对应 Skill 的实现测试、集成测试和 fake pipeline 测试;测试性质由 harness 清单标注。
  • harness/specs/:测试和评测规范;不被业务 Skill 当作运行时指令读取。
  • harness/manifests/:测试/评测登记与执行配置;不复制业务字段合同。
  • harness/evals/:外部行为评测案例、适配器和报告生成逻辑。
  • .agent/docs/architecture/domains/:领域与数据权威 SoT;harness 只引用,不复制领域定义。
  • docs/:单次设计、运行证据和历史资料;不替代 harness 规范。

4. 当前状态

  • skill_harness.py 已实现运行时 Skill 文档与 skills.json 的只读静态审计。
  • test-inventory.json 已登记实现测试、集成测试、fake pipeline、领域评测和 harness 自测的依赖与证据等级。
  • run_selected.py 已实现显式选择、磁盘/manifest 对账、危险依赖阻断、超时和执行证据检查;它不提供默认全仓一键通过结论。
  • 项目运行时 Skill 的实现测试以 tests/skills/<skill>/ 为目标位置,物理现状以 test-inventory.json 为准。
  • skill_behavior_eval 当前登记数量为 0;没有外部 Agent/模型行为证据时,不声称 Skill 内容有效。
  • PostgreSQL、网络和真实模型证据未由离线结果替代,是否执行仍受授权和预算约束。

5. 运行边界

  • 默认只允许静态检查和明确标注的离线测试;
  • PostgreSQL、网络、真实模型和额度探针必须显式选择并满足授权、预算和环境前置条件;
  • 任何测试失败、依赖缺失或未发现测试都必须显式返回状态,不能静默跳过;
  • 报告必须区分已验证事实、推断和未验证假设。