范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):
1. 新增 harness/ 控制平面
- skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
- run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
空跑与 skip-only 失败关闭、AST 测试形状门
- manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
- manifests/test-inventory.json:81 个测试资产登记
- specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责
2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
- 71 个测试文件迁移并修复项目根与临时目录运行导入
- 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
- 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
- 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变
3. 运行时文档清理
- 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
只保留运行时合同;业务运行合同、额度、授权与离线模式均保留
4. SoT 同步
- AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
- 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
- humanization 覆盖矩阵:活动测试路径同步迁移
验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。
已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
111 lines
4.4 KiB
Python
111 lines
4.4 KiB
Python
#!/usr/bin/env python3
|
|
"""persist_writer_run._semantic_verdict 的离线测试。
|
|
|
|
语义状态固化到候选行是接受通道 DB 兜底的依据,绑定/哈希校验必须失败关闭:
|
|
报告版本、候选哈希、候选版本、上下文哈希、运行 ID 任一不一致都拒绝落库。
|
|
|
|
跑法:.venv/bin/python tests/skills/write-next-chapter/test_semantic_verdict.py
|
|
"""
|
|
|
|
from __future__ import annotations
|
|
|
|
import copy
|
|
import pathlib
|
|
import sys
|
|
import unittest
|
|
|
|
PROJECT_ROOT = pathlib.Path(__file__).resolve().parents[3]
|
|
SCRIPT_DIR = PROJECT_ROOT / ".claude" / "skills" / "write-next-chapter" / "scripts"
|
|
if str(SCRIPT_DIR) not in sys.path:
|
|
sys.path.insert(0, str(SCRIPT_DIR))
|
|
|
|
import persist_writer_run as writer_persist # noqa: E402
|
|
|
|
|
|
CANDIDATE_SHA = "a" * 64
|
|
CONTEXT_SHA = "sha256:" + "b" * 64
|
|
|
|
|
|
def _context() -> dict:
|
|
return {
|
|
"runId": "run-prod-work12-ch2-x",
|
|
"contextSnapshot": {"contextSha256": CONTEXT_SHA},
|
|
}
|
|
|
|
|
|
def _report(*, status: str = "passed", candidate_sha: str = "sha256:" + CANDIDATE_SHA,
|
|
candidate_version=1) -> dict:
|
|
body = {
|
|
"schemaVersion": "semantic-detection-v3",
|
|
"runId": "run-prod-work12-ch2-x",
|
|
"sampleId": "writer-ch2",
|
|
"opaqueArmId": "production",
|
|
"inputSha256": "sha256:" + "1" * 64,
|
|
"candidateVersion": candidate_version,
|
|
"candidateSha256": candidate_sha,
|
|
"contextSnapshotSha256": CONTEXT_SHA,
|
|
"modelReceiptSha256": "sha256:" + "2" * 64,
|
|
"status": status,
|
|
"claims": [], "findings": [], "assertionVerdicts": [],
|
|
"hardConstraintVerdicts": [], "newSettingCandidates": [], "evidenceGaps": [],
|
|
}
|
|
body["reportSha256"] = "sha256:" + writer_persist.hashlib.sha256(
|
|
writer_persist._json(body).encode("utf-8")).hexdigest()
|
|
return body
|
|
|
|
|
|
class SemanticVerdictTest(unittest.TestCase):
|
|
def test_bound_passed_report_yields_status_and_bare_sha(self) -> None:
|
|
report = _report()
|
|
status, sha = writer_persist._semantic_verdict(
|
|
report, _context(), CANDIDATE_SHA, 1)
|
|
self.assertEqual(status, "passed")
|
|
self.assertEqual(sha, report["reportSha256"][len("sha256:"):])
|
|
|
|
def test_failed_and_needs_evidence_statuses_pass_through(self) -> None:
|
|
for status in ("failed", "needs_evidence"):
|
|
report = _report(status=status)
|
|
got, _ = writer_persist._semantic_verdict(report, _context(), CANDIDATE_SHA, 1)
|
|
self.assertEqual(got, status)
|
|
|
|
def test_unbound_candidate_sha_rejected(self) -> None:
|
|
report = _report(candidate_sha="sha256:" + "f" * 64)
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(report, _context(), CANDIDATE_SHA, 1)
|
|
|
|
def test_unbound_candidate_version_rejected(self) -> None:
|
|
report = _report(candidate_version=2)
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(report, _context(), CANDIDATE_SHA, 1)
|
|
|
|
def test_unbound_context_sha_rejected(self) -> None:
|
|
report = _report()
|
|
report["contextSnapshotSha256"] = "sha256:" + "c" * 64
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(report, _context(), CANDIDATE_SHA, 1)
|
|
|
|
def test_tampered_report_hash_rejected(self) -> None:
|
|
report = _report()
|
|
tampered = copy.deepcopy(report)
|
|
tampered["status"] = "passed"
|
|
tampered["reportSha256"] = report["reportSha256"]
|
|
tampered["claims"] = [{"claimId": "forged"}] # 改内容不改哈希
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(tampered, _context(), CANDIDATE_SHA, 1)
|
|
|
|
def test_bad_version_or_status_rejected(self) -> None:
|
|
bad_version = _report()
|
|
bad_version["schemaVersion"] = "semantic-detection-v2"
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(bad_version, _context(), CANDIDATE_SHA, 1)
|
|
bad_status = _report()
|
|
bad_status["status"] = "approved"
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(bad_status, _context(), CANDIDATE_SHA, 1)
|
|
with self.assertRaises(writer_persist.WriterPersistenceError):
|
|
writer_persist._semantic_verdict(None, _context(), CANDIDATE_SHA, 1)
|
|
|
|
|
|
if __name__ == "__main__":
|
|
unittest.main()
|