muse-agent-example/tests/skills/establish-voice-baseline/test_establish_voice_baseline.py
zizi c9f69d9d6d 治理: Skill 测试治理第一阶段——harness 控制平面 + 实现测试迁出运行时目录
范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):

1. 新增 harness/ 控制平面
   - skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
   - run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
     空跑与 skip-only 失败关闭、AST 测试形状门
   - manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
   - manifests/test-inventory.json:81 个测试资产登记
   - specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责

2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
   - 71 个测试文件迁移并修复项目根与临时目录运行导入
   - 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
   - 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
   - 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变

3. 运行时文档清理
   - 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
     只保留运行时合同;业务运行合同、额度、授权与离线模式均保留

4. SoT 同步
   - AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
   - 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
   - humanization 覆盖矩阵:活动测试路径同步迁移

验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。

已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
2026-08-19 01:50:20 +08:00

103 lines
4.6 KiB
Python
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

#!/usr/bin/env python3
"""技能 1 定基线离线测试:结构合同、grounding 门、人工确认强制。"""
import pathlib
import sys
import tempfile
import unittest
from unittest.mock import patch
PROJECT_ROOT = pathlib.Path(__file__).resolve().parents[3]
SCRIPT_DIR = PROJECT_ROOT / ".claude" / "skills" / "establish-voice-baseline" / "scripts"
sys.path.insert(0, str(SCRIPT_DIR))
import establish_voice_baseline as base # noqa: E402
SOURCE_TEXT = "老周敲了敲桌角:「我说小子,茶要凉了。」青云城的雨说来就来。"
LEDGER = {
"schema_version": "voice-baseline-v1",
"work_ref": "synthetic:demo",
"narrator": {"sentence_habits": ["短句收束"], "punctuation_habits": []},
"characters": {"老周": {"verbal_tics": ["我说小子"], "sample_lines": ["我说小子,茶要凉了。"]}},
"untouchable_verbal_tics": {"老周": ["我说小子"]},
"protected_spans": ["青云城的雨说来就来"],
"blacklist": ["值得注意的是"],
}
class BaselineContractTest(unittest.TestCase):
def test_draft_output_can_feed_confirm(self):
with tempfile.TemporaryDirectory() as tmp:
root = pathlib.Path(tmp)
source = root / "source.txt"
source.write_text(SOURCE_TEXT, encoding="utf-8")
draft_output = root / "draft.json"
self.assertEqual(
0,
base.main([
"draft", "--work-ref", "synthetic:demo", "--text-file", str(source),
"--output", str(draft_output), "--offline",
]),
)
with patch.object(base, "collect_ledger", return_value={"version": 1}) as collect:
code = base.main([
"confirm", "--ledger-file", str(draft_output),
"--work-ref", "synthetic:demo", "--text-file", str(source),
"--reviewer", "qingse", "--output", str(root / "confirmed.json"),
])
self.assertEqual(code, 0)
collect.assert_called_once()
self.assertEqual(collect.call_args.args[0]["schema_version"], "voice-baseline-v1")
def test_valid_ledger_passes_grounding_and_persists(self):
with patch.object(base, "persist_baseline", return_value={"version": 1}) as persist:
result = base.collect_ledger(LEDGER, work_ref="synthetic:demo",
source_texts=[SOURCE_TEXT], reviewer="qingse")
self.assertEqual(result["version"], 1)
persist.assert_called_once()
def test_ungrounded_tic_is_rejected(self):
bad = dict(LEDGER, untouchable_verbal_tics={"老周": ["根本不存在的口癖"]})
with patch.object(base, "persist_baseline") as persist:
with self.assertRaisesRegex(base.BaselineContractError, "grounding"):
base.collect_ledger(bad, work_ref="synthetic:demo",
source_texts=[SOURCE_TEXT], reviewer="qingse")
persist.assert_not_called()
def test_ungrounded_protected_span_is_rejected(self):
bad = dict(LEDGER, protected_spans=["不在正文里的句子"])
with self.assertRaisesRegex(base.BaselineContractError, "grounding"):
base.collect_ledger(bad, work_ref="synthetic:demo",
source_texts=[SOURCE_TEXT], reviewer="qingse")
def test_reviewer_is_required(self):
# persist_baseline 的确认人门在连库之前,可直接测
with self.assertRaisesRegex(base.BaselineContractError, "人工确认"):
base.persist_baseline(LEDGER, source_text=SOURCE_TEXT, reviewer="")
def test_direct_persist_rechecks_grounding_before_db(self):
with self.assertRaisesRegex(base.BaselineContractError, "grounding"):
base.persist_baseline(
dict(LEDGER, protected_spans=["不在正文里的句子"]),
source_text=SOURCE_TEXT, reviewer="qingse",
)
def test_schema_version_is_enforced(self):
bad = dict(LEDGER, schema_version="nope")
with self.assertRaisesRegex(base.BaselineContractError, "schema_version"):
base.validate_ledger(bad, work_ref="synthetic:demo")
def test_work_ref_mismatch_is_enforced(self):
with self.assertRaisesRegex(base.BaselineContractError, "work_ref"):
base.validate_ledger(LEDGER, work_ref="synthetic:other")
def test_missing_narrator_is_enforced(self):
bad = dict(LEDGER)
del bad["narrator"]
with self.assertRaisesRegex(base.BaselineContractError, "narrator"):
base.validate_ledger(bad, work_ref="synthetic:demo")
if __name__ == "__main__":
unittest.main()