zizi c9f69d9d6d 治理: Skill 测试治理第一阶段——harness 控制平面 + 实现测试迁出运行时目录
范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):

1. 新增 harness/ 控制平面
   - skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
   - run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
     空跑与 skip-only 失败关闭、AST 测试形状门
   - manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
   - manifests/test-inventory.json:81 个测试资产登记
   - specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责

2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
   - 71 个测试文件迁移并修复项目根与临时目录运行导入
   - 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
   - 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
   - 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变

3. 运行时文档清理
   - 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
     只保留运行时合同;业务运行合同、额度、授权与离线模式均保留

4. SoT 同步
   - AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
   - 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
   - humanization 覆盖矩阵:活动测试路径同步迁移

验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。

已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
2026-08-19 01:50:20 +08:00

69 lines
3.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# agent-example Harness
> 项目开发、验证和行为评测支架的入口与索引。
> 这里的文档和工具服务开发者与评测编排,不会作为任何 Skill 的运行时提示词自动注入 Agent。
## 1. 作用
`agent-example` 同时包含三种不同性质的验证工作:
- 运行时文档的静态卫生检查;
- 确定性工具、数据库边界和 fake pipeline 的机械测试;
- 将 Skill 交给 Agent 后的外部行为评测。
Harness 负责把这三类工作分开编排并保留证据,不能用其中一类的通过结果冒充另一类结论。
## 2. 目录索引
```text
harness/
├── README.md # 本入口:项目 harness 介绍、边界和索引
├── specs/
│ └── skill-testing.md # Skill 测试与评测规范(唯一规范正文)
├── skill_harness.py # 运行时 Skill 文档静态审计入口
├── run_selected.py # 按 manifest 选择性执行测试
├── test_skill_harness.py # 静态审计器离线测试
├── test_run_selected.py # 选择性执行器离线测试
├── manifests/
│ ├── skills.json # 运行时 Skill 责任方与协作领域清单
│ └── test-inventory.json # 测试分类、依赖、副作用与证据等级
└── evals/<skill>/ # Skill 行为评测夹具与适配器(尚未建立)
项目级实现测试位于 `../tests/skills/<skill>/`,不进入运行时 Skill 目录。
```
现有专项支架:
| 路径 | 责任 | 证据边界 |
|---|---|---|
| `humanization/eval/run_eval.py` | 去 AI 味规则合同和回归陷阱试跑 | 规则合同回放,不证明文学效果 |
| `.claude/skills/evaluate-frozen-replay/` | 正文/细纲冻结回放、盲评和质量门 | 评测编排与质量证据,不是通用 Skill 单测入口 |
| `harness/` | 跨 Skill 的开发验证与行为评测治理 | 只编排和裁决证据,不拥有业务合同 |
## 3. 权威关系
- `.claude/skills/*/SKILL.md`:Skill 的运行时行为合同;不放开发测试说明。
- `.claude/skills/*/scripts/`:Skill 使用的运行时确定性实现与机械门。
- `tests/skills/<skill>/`:对应 Skill 的实现测试、集成测试和 fake pipeline 测试;测试性质由 harness 清单标注。
- `harness/specs/`:测试和评测规范;不被业务 Skill 当作运行时指令读取。
- `harness/manifests/`:测试/评测登记与执行配置;不复制业务字段合同。
- `harness/evals/`:外部行为评测案例、适配器和报告生成逻辑。
- `.agent/docs/architecture/domains/`:领域与数据权威 SoT;harness 只引用,不复制领域定义。
- `docs/`:单次设计、运行证据和历史资料;不替代 harness 规范。
## 4. 当前状态
- `skill_harness.py` 已实现运行时 Skill 文档与 `skills.json` 的只读静态审计。
- `test-inventory.json` 已登记实现测试、集成测试、fake pipeline、领域评测和 harness 自测的依赖与证据等级。
- `run_selected.py` 已实现显式选择、磁盘/manifest 对账、危险依赖阻断、超时和执行证据检查;它不提供默认全仓一键通过结论。
- 项目运行时 Skill 的实现测试以 `tests/skills/<skill>/` 为目标位置,物理现状以 `test-inventory.json` 为准。
- `skill_behavior_eval` 当前登记数量为 0;没有外部 Agent/模型行为证据时,不声称 Skill 内容有效。
- PostgreSQL、网络和真实模型证据未由离线结果替代,是否执行仍受授权和预算约束。
## 5. 运行边界
- 默认只允许静态检查和明确标注的离线测试;
- PostgreSQL、网络、真实模型和额度探针必须显式选择并满足授权、预算和环境前置条件;
- 任何测试失败、依赖缺失或未发现测试都必须显式返回状态,不能静默跳过;
- 报告必须区分已验证事实、推断和未验证假设。