范围(不含 design-story-foundation、docs/、humanization/README.md 等进行中改动):
1. 新增 harness/ 控制平面
- skill_harness.py 静态审计:32 个运行时 Skill 的 frontmatter/manifest/文档污染,当前 0 问题
- run_selected.py 选择性执行器:manifest 与磁盘一一对账、依赖阻断、
空跑与 skip-only 失败关闭、AST 测试形状门
- manifests/skills.json:32 个 Skill 的合同责任方与协作领域登记
- manifests/test-inventory.json:81 个测试资产登记
- specs/skill-testing.md 与 README.md:测试分层、证据边界与 harness 职责
2. 实现测试从 .claude/skills/*/scripts/ 迁至 tests/skills/<skill>/
- 71 个测试文件迁移并修复项目根与临时目录运行导入
- 数据库触发器测试宽泛异常收窄为 psycopg.errors.RaiseException
- 抽取离线大测试拆出真实 PG smoke(默认阻断,不计入离线通过)
- 抽取 presence 去重边界拆出独立测试:493 + 78 = 571 项检查不变
3. 运行时文档清理
- 13 个 SKILL.md 移除自测/离线验证段落、测试命令与测试文件事实源表述,
只保留运行时合同;业务运行合同、额度、授权与离线模式均保留
4. SoT 同步
- AGENTS.md:新增 Skill 领域索引(7 个合同责任方分组,覆盖 32 个运行时 Skill)
- 领域 07:测试入口改由 harness/manifests/ 登记,SKILL.md 不承载测试命令
- humanization 覆盖矩阵:活动测试路径同步迁移
验证证据: harness 自测 15 项 + runner 自测 13 项通过;静态审计 32 Skill / 0 问题;
73 个非数据库测试通过;8 个集成条目中 6 个 PostgreSQL 项被依赖门明确阻断;
py_compile 与 git diff --check 通过。未连接 PostgreSQL、网络、真实模型或额度。
已知边界: 真正 skill_behavior_eval 仍为 0,尚未验证任何 Skill 自然语言行为;
evaluate-frozen-replay 的 raw 存储边界冲突留待单独治理。
107 lines
3.1 KiB
Python
107 lines
3.1 KiB
Python
#!/usr/bin/env python3
|
|
"""search 公共范式专用范围的离线合同测试。"""
|
|
|
|
from __future__ import annotations
|
|
|
|
import pathlib
|
|
import sys
|
|
import unittest
|
|
|
|
PROJECT_ROOT = pathlib.Path(__file__).resolve().parents[3]
|
|
SCRIPT_DIR = PROJECT_ROOT / ".claude" / "skills" / "search-knowledge" / "scripts"
|
|
EMBED_SCRIPT_DIR = PROJECT_ROOT / ".claude" / "skills" / "embed-knowledge" / "scripts"
|
|
sys.path.insert(0, str(SCRIPT_DIR))
|
|
sys.path.insert(0, str(EMBED_SCRIPT_DIR))
|
|
|
|
from search import search_cards
|
|
|
|
|
|
class _Result:
|
|
def __init__(self, rows):
|
|
self._rows = rows
|
|
|
|
def fetchall(self):
|
|
return self._rows
|
|
|
|
|
|
class _Connection:
|
|
def __init__(self):
|
|
self.calls = []
|
|
|
|
def __enter__(self):
|
|
return self
|
|
|
|
def __exit__(self, *_args):
|
|
return False
|
|
|
|
def execute(self, sql, args):
|
|
self.calls.append((sql, list(args)))
|
|
if "muse_meta_schema" in sql:
|
|
return _Result([])
|
|
return _Result(
|
|
[
|
|
(
|
|
"draft",
|
|
7,
|
|
{
|
|
"型": "craft",
|
|
"名称": "递进揭示",
|
|
"一句话摘要": "逐层增加信息压力",
|
|
"字段": {"节拍": "三段递进"},
|
|
"目标库": "公共范式库",
|
|
},
|
|
"pending",
|
|
0.91,
|
|
3,
|
|
{},
|
|
None,
|
|
"active",
|
|
)
|
|
]
|
|
)
|
|
|
|
|
|
class SearchCardsTest(unittest.TestCase):
|
|
def test_public_pattern_scope_is_sql_enforced_and_tenant_bound(self):
|
|
conn = _Connection()
|
|
|
|
cards = search_cards(
|
|
"信息揭示",
|
|
scope="public_pattern",
|
|
ttype="craft",
|
|
dsn="postgresql://test/muse-example",
|
|
tenant_id=7,
|
|
connection_factory=lambda dsn: conn if dsn == "postgresql://test/muse-example" else None,
|
|
embedder=lambda _intent: [0.1, 0.2],
|
|
)
|
|
|
|
self.assertEqual(len(conn.calls), 2)
|
|
policy_sql, policy_args = conn.calls[0]
|
|
self.assertIn("muse_meta_schema", policy_sql)
|
|
self.assertEqual(policy_args, [7])
|
|
sql, args = conn.calls[1]
|
|
for fragment in (
|
|
"d.work_id=0",
|
|
"d.draft_payload->>'目标库'='公共范式库'",
|
|
"kb.kb_type='global'",
|
|
"d.source_action_policy",
|
|
"d.draft_payload->>'型' = %s",
|
|
):
|
|
self.assertIn(fragment, sql)
|
|
self.assertEqual(args, ["[0.1, 0.2]", 7, 7, 7, "craft", 5])
|
|
self.assertEqual(cards[0]["retrievalScope"], "public_pattern")
|
|
self.assertTrue(cards[0]["productionRetrievalEligible"])
|
|
|
|
def test_unknown_scope_fails_before_connecting(self):
|
|
with self.assertRaises(ValueError):
|
|
search_cards(
|
|
"冲突",
|
|
scope="unknown",
|
|
connection_factory=lambda _dsn: _Connection(),
|
|
embedder=lambda _intent: [0.1],
|
|
)
|
|
|
|
|
|
if __name__ == "__main__":
|
|
unittest.main()
|