zizi d80df3ed7c 治理: 剩余问题收口——humanization 规则/样例数据库权威 + PG 集成全通过 + 行为评测脚手架 + raw 冲突备忘录
范围(不含 design-story-foundation、docs/design、docs/write-chapter、
craft/、humanization/README.md 等进行中改动):

1. humanization 规则/样例运行时数据库权威
   - db/ddl/111:example_ai_flavor_rule / example_ai_flavor_sample /
     example_ai_flavor_rule_event(append-only 生命周期留痕),已应用到 muse-example
   - deai/load_db.py:数据库装载器,激活门/重复检测/指纹与文件装载器同源;
     数据库失败关闭,不静默回退 Git 文件资产
   - humanization/tools/seed_rules_db.py:YAML 种子单事务同步,幂等、
     变化留痕、--strict 对 db-only 行失败关闭;真实库已种入 26 规则/107 样例
   - prevent/diagnose/revise 生产路径切到数据库读取(--offline 显式读文件),
     落库前新鲜度检查与合同声明来源一致;四个 SKILL.md 数据库合同同步
   - 真实库验证:规则库指纹与文件种子一致(v-609bc40e21d0b5db),
     三个生产脚本端到端从库装载通过

2. PostgreSQL 集成:显式授权后 9/9 通过
   - 此前被依赖门阻断的 6 个 _db/smoke 测试全部通过
   - extract rollback 冒烟改为回滚事务内自给夹具(pending 窗/草稿缺失时自建),
     不再依赖瞬时生产状态;夹具残留核验为 0

3. Skill 行为评测脚手架(真实执行数量仍为 0)
   - harness/evals/skill_eval.py:场景合同、六类评测范畴、适配器和结构化裁决报告
   - diagnose-ai-flavor 参考场景 4 条 + 管道自测 7 项通过
   - 真实模型适配器未授权时以稳定码 EVAL_ADAPTER_UNAVAILABLE 失败关闭;
     清单登记 skill_behavior_eval 条目,默认被依赖门阻断

4. evaluate-frozen-replay raw 存储边界冲突
   - docs/2026-08-19 备忘录:平台 DB-first 合同(创始人批准)与回放链
     仓外 vault 强制的冲突事实、两个选项和裁决前约束;运行时合同未单方面改写

5. harness 自身修复
   - runner 对账语义:行为评测入口不参与测试资产双向等值,但登记文件必须存在;
     manifest 保留 skill_behavior_eval 布尔字段并校验类型
   - 新增 2 条对账回归用例

验证证据: harness 三组自测 15+15+7 通过;静态审计 32 Skill / 0 问题;
76 个非数据库条目通过;9 个 PostgreSQL 集成条目显式授权后通过;
行为评测条目默认阻断;py_compile 与 git diff --check 通过。
未调用真实模型、embedding 或额度;真实行为评测执行数量仍为 0。
2026-08-19 02:41:25 +08:00
..

humanization · 去 AI 味与人感体系(agent-example 先行验证副本)

本目录是去 AI 味与人感体系的资产层与执行骨架,初始拷贝自父仓 muse-deai/(提交 92a88e86,一级能力),自拷贝之日起由 agent-example 自治管理与演进。

权威与演进规则

  • 验证期本目录自治:合同、规则、样例、骨架的改动直接在本仓演进,Git 历史留痕;父仓 muse-deai 同主题暂停更新,不产生两套并行版本。
  • 同步方向只有一条:验证收敛、人感体系从 agent-example 升华进 Muse 时,把验证过的资产同步回父仓 muse-deai 并更新设计文档。升华之前不向父仓回填。
  • 设计 SoT(概念定义、五技能合同、验收口径)归属父仓 design-docs/专题-09-去AI味与人感体系设计.md;本目录不重复定义概念,验证中发现合同级缺陷时向父仓提请修订。
  • 案例卡的正式载体是 muse-example 库(见 .claude/skills/capture-ai-flavor-cases);本目录 cards/ 只存合成示例。src/deai/cards.py 保留早期离线 API 兼容层,但输出/读取已对齐 ai-flavor-case-v1,生产采集入口仍是 capture_cases.py。

目录

contracts/   数据合同:案例/规则/样例/发现/patch/审计 + voice_baseline/prevention
src/deai/    执行骨架:规则装载与完整指纹、载体 scope/mask、五层诊断、基线画像、门禁、评测生命周期
rules/       规则库 v0(26 条 active,覆盖 regex/handler/density/model_judgment 四类触发器);active 必须配齐四类样例;其中 16 条为 2026-08-16 所有者决定跳过 holdout 激活,证据栏留痕。
             这 16 条的 holdout 是欠账:升回父仓或申报专题-09 §12 一级验收前必须补齐,或提请父仓修订 SoT。
             26 条超出专题-09 §10 一级「10–20 条」区间,验证期定位是机制覆盖先行,升华进 Muse 时对齐区间或提请修订
samples/     样例库(sf / snf / boundary / regression),候选规则也必须先有四类夹具
cards/       合成案例卡示例
research/    20 项开源研究机制追踪矩阵 + 中文轻量去重人感规则目录(研究候选,不等于 active)
tests/       合同负路测试:../.venv/bin/python -m unittest discover -s tests -v(在 humanization/ 下运行)
eval/        判别试跑与回归探针:../.venv/bin/python eval/run_eval.py
config.yaml  模型角色分离配置(改写模型 ≠ 选择模型,代码强制)

与五个技能 skill 的对应

技能 skill 消费本目录什么
1 定基线 establish-voice-baseline 产出声音账,供修订保护项与前置预防正样例
2 前置预防 prevent-ai-flavor rules/ active 规则的负约束
3 诊断 diagnose-ai-flavor src/deai/diagnose.py + rules/
4 修订 revise-ai-flavor patch.py / gates.py / pairwise.py / report.py
5 挖掘 capture-ai-flavor-cases 案例卡 → rules/ 候选(propose-rule 门)

运行测试

cd agent-example/humanization
../.venv/bin/python -m unittest discover -s tests -v