范围(不含 design-story-foundation、docs/design、docs/write-chapter、
craft/、humanization/README.md 等进行中改动):
1. humanization 规则/样例运行时数据库权威
- db/ddl/111:example_ai_flavor_rule / example_ai_flavor_sample /
example_ai_flavor_rule_event(append-only 生命周期留痕),已应用到 muse-example
- deai/load_db.py:数据库装载器,激活门/重复检测/指纹与文件装载器同源;
数据库失败关闭,不静默回退 Git 文件资产
- humanization/tools/seed_rules_db.py:YAML 种子单事务同步,幂等、
变化留痕、--strict 对 db-only 行失败关闭;真实库已种入 26 规则/107 样例
- prevent/diagnose/revise 生产路径切到数据库读取(--offline 显式读文件),
落库前新鲜度检查与合同声明来源一致;四个 SKILL.md 数据库合同同步
- 真实库验证:规则库指纹与文件种子一致(v-609bc40e21d0b5db),
三个生产脚本端到端从库装载通过
2. PostgreSQL 集成:显式授权后 9/9 通过
- 此前被依赖门阻断的 6 个 _db/smoke 测试全部通过
- extract rollback 冒烟改为回滚事务内自给夹具(pending 窗/草稿缺失时自建),
不再依赖瞬时生产状态;夹具残留核验为 0
3. Skill 行为评测脚手架(真实执行数量仍为 0)
- harness/evals/skill_eval.py:场景合同、六类评测范畴、适配器和结构化裁决报告
- diagnose-ai-flavor 参考场景 4 条 + 管道自测 7 项通过
- 真实模型适配器未授权时以稳定码 EVAL_ADAPTER_UNAVAILABLE 失败关闭;
清单登记 skill_behavior_eval 条目,默认被依赖门阻断
4. evaluate-frozen-replay raw 存储边界冲突
- docs/2026-08-19 备忘录:平台 DB-first 合同(创始人批准)与回放链
仓外 vault 强制的冲突事实、两个选项和裁决前约束;运行时合同未单方面改写
5. harness 自身修复
- runner 对账语义:行为评测入口不参与测试资产双向等值,但登记文件必须存在;
manifest 保留 skill_behavior_eval 布尔字段并校验类型
- 新增 2 条对账回归用例
验证证据: harness 三组自测 15+15+7 通过;静态审计 32 Skill / 0 问题;
76 个非数据库条目通过;9 个 PostgreSQL 集成条目显式授权后通过;
行为评测条目默认阻断;py_compile 与 git diff --check 通过。
未调用真实模型、embedding 或额度;真实行为评测执行数量仍为 0。
73 lines
4.6 KiB
Markdown
73 lines
4.6 KiB
Markdown
# agent-example Harness
|
||
|
||
> 项目开发、验证和行为评测支架的入口与索引。
|
||
> 这里的文档和工具服务开发者与评测编排,不会作为任何 Skill 的运行时提示词自动注入 Agent。
|
||
|
||
## 1. 作用
|
||
|
||
`agent-example` 同时包含三种不同性质的验证工作:
|
||
|
||
- 运行时文档的静态卫生检查;
|
||
- 确定性工具、数据库边界和 fake pipeline 的机械测试;
|
||
- 将 Skill 交给 Agent 后的外部行为评测。
|
||
|
||
Harness 负责把这三类工作分开编排并保留证据,不能用其中一类的通过结果冒充另一类结论。
|
||
|
||
## 2. 目录索引
|
||
|
||
```text
|
||
harness/
|
||
├── README.md # 本入口:项目 harness 介绍、边界和索引
|
||
├── specs/
|
||
│ └── skill-testing.md # Skill 测试与评测规范(唯一规范正文)
|
||
├── skill_harness.py # 运行时 Skill 文档静态审计入口
|
||
├── run_selected.py # 按 manifest 选择性执行测试
|
||
├── test_skill_harness.py # 静态审计器离线测试
|
||
├── test_run_selected.py # 选择性执行器离线测试
|
||
├── manifests/
|
||
│ ├── skills.json # 运行时 Skill 责任方与协作领域清单
|
||
│ └── test-inventory.json # 测试分类、依赖、副作用与证据等级
|
||
└── evals/
|
||
├── skill_eval.py # 行为评测引擎:场景合同、适配器与裁决报告
|
||
├── test_skill_eval.py # 评测管道自测(不构成 Skill 行为证据)
|
||
└── skills/<skill>/ # 逐 Skill 场景与评测入口(真实模型需显式授权)
|
||
|
||
项目级实现测试位于 `../tests/skills/<skill>/`,不进入运行时 Skill 目录。
|
||
```
|
||
|
||
现有专项支架:
|
||
|
||
| 路径 | 责任 | 证据边界 |
|
||
|---|---|---|
|
||
| `humanization/eval/run_eval.py` | 去 AI 味规则合同和回归陷阱试跑 | 规则合同回放,不证明文学效果 |
|
||
| `.claude/skills/evaluate-frozen-replay/` | 正文/细纲冻结回放、盲评和质量门 | 评测编排与质量证据,不是通用 Skill 单测入口 |
|
||
| `harness/` | 跨 Skill 的开发验证与行为评测治理 | 只编排和裁决证据,不拥有业务合同 |
|
||
|
||
## 3. 权威关系
|
||
|
||
- `.claude/skills/*/SKILL.md`:Skill 的运行时行为合同;不放开发测试说明。
|
||
- `.claude/skills/*/scripts/`:Skill 使用的运行时确定性实现与机械门。
|
||
- `tests/skills/<skill>/`:对应 Skill 的实现测试、集成测试和 fake pipeline 测试;测试性质由 harness 清单标注。
|
||
- `harness/specs/`:测试和评测规范;不被业务 Skill 当作运行时指令读取。
|
||
- `harness/manifests/`:测试/评测登记与执行配置;不复制业务字段合同。
|
||
- `harness/evals/`:外部行为评测案例、适配器和报告生成逻辑。
|
||
- `.agent/docs/architecture/domains/`:领域与数据权威 SoT;harness 只引用,不复制领域定义。
|
||
- `docs/`:单次设计、运行证据和历史资料;不替代 harness 规范。
|
||
|
||
## 4. 当前状态
|
||
|
||
- `skill_harness.py` 已实现运行时 Skill 文档与 `skills.json` 的只读静态审计。
|
||
- `test-inventory.json` 已登记实现测试、集成测试、fake pipeline、领域评测和 harness 自测的依赖与证据等级。
|
||
- `run_selected.py` 已实现显式选择、磁盘/manifest 对账、危险依赖阻断、超时和执行证据检查;它不提供默认全仓一键通过结论。
|
||
- 项目运行时 Skill 的实现测试以 `tests/skills/<skill>/` 为目标位置,物理现状以 `test-inventory.json` 为准。
|
||
- `skill_behavior_eval` 脚手架已建立:评测引擎、diagnose-ai-flavor 参考场景与管道自测就位;真实模型适配器未授权时以稳定码失败关闭,真实行为评测执行数量仍为 0;没有外部 Agent/模型行为证据时,不声称 Skill 内容有效。
|
||
- humanization 规则/样例运行时权威已入库(DDL-111 + `humanization/tools/seed_rules_db.py` 种子同步);生产读取失败关闭,不静默回退 Git 文件资产。
|
||
- PostgreSQL 集成条目在显式授权后全部通过(含规则库指纹一致性和 rollback 冒烟);网络和真实模型证据未由离线结果替代,是否执行仍受授权和预算约束。
|
||
|
||
## 5. 运行边界
|
||
|
||
- 默认只允许静态检查和明确标注的离线测试;
|
||
- PostgreSQL、网络、真实模型和额度探针必须显式选择并满足授权、预算和环境前置条件;
|
||
- 任何测试失败、依赖缺失或未发现测试都必须显式返回状态,不能静默跳过;
|
||
- 报告必须区分已验证事实、推断和未验证假设。
|