86 lines
6.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
name: 审核知识卡
description: 以三种编辑视角审核公共知识卡的成立性、创作可用性和跨书复用性,并写回 pass、revise 或 reject。拆书产出公共卡后使用;不负责生成卡或确认作品私有知识。
disable-model-invocation: true
---
# 审核公共知识卡
创始人拍板(2026-07-13):审核是**流程内可复用资产**,不是每批都请 claude 角色扮演——
- **常设执行**:MiniMax-M3 扮三角色(番茄作家=爽点商业性 / 起点作家=结构工艺 / 主编=资产 vs 噪声),每批拆书产出的卡过一遍;
- **fable/opus 职责**:起量前出金标准校准本 skill(golden/),起量后做一次总审核;
- 判定写回 `draft_payload.审核` 节(批次/均分/判定/三角色分与判词),可追溯可复审。
## 用法
```bash
# 审核(全部或指定书的活卡;三角色各一次 M3 调用)
.venv/bin/python muse/content/entity/skills/review/审核知识卡/scripts/review_cards.py review --batch <批次> [--work-id N] [--dry-run]
# 校准:与 golden/scores.json(opus 金标准)对照(换模型/改 prompt 后必跑);过线则写 golden/calibrate-stamp.json
.venv/bin/python muse/content/entity/skills/review/审核知识卡/scripts/review_cards.py calibrate --batch cal-002
```
判定阈值:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject。
## 统一判定闸(自 opus 金标准三评审蒸馏,内嵌于审核 prompt)
换书测试(抹专名换题材仍成立?)· 命名黑话检测 · 装置标签判定(信息差/契诃夫之枪/身份错认各有硬定义)· 伪精确检测(编造的间隔数字)· 同功重复(family 换皮)· 干货位检查(失败模式比手法值钱=手法空洞)· 专名泄漏。
## 校准记录
| 日期 | 批次 | 结果 |
|---|---|---|
| 2026-07-13 | cal-001(19 卡试拆批) | 平均绝对偏差 **0.45**(合格线 ≤0.5)、平均偏差 -0.08(无系统倾向)、最大背离 1.33<1.5;8 卡偏差 ≤0.11。M3 三角色总评独立复现金标准全部四大系统病(同功撞车/命名黑话/伪精确/专名污染)。**已知弱点**:对「场景级走位 vs 可复用范式」辨别偏松(《路人搭讪道具借用式情报截流》金 2.67 → M3 4.0)。 |
| 2026-07-16 | cal-002(30 卡放量终态批,星环/机动跨五型伪随机抽样,opus 盲评金标准=`golden/scores-cal002.json`) | **背景**:批9 全量审核开跑前未复验旧校准(卡形态已经窗级重构+三轮治理大改),创始人叫停纠正。旧尺子实测 MAE 0.489 压线、bias **+0.215 系统性偏松**、判定一致 70%、**金标 revise 被放行 5/14(pass 假阳 36%)**。**修法**:CRITERIA 增评分硬规则(伪精确无实测标注→can≤3 / 标签错贴→cheng≤3 / 同功换皮家族仅最佳一张正常分 / 审慎默认拿不准往低打 / 4 分以上须自证)。**复验**:MAE **0.326**、bias -0.156(略偏严=安全方向:错杀进 revise 桶可复审救回,假阳进库不可救)、判定一致 77%、放行降至 1 张。教训固化:**卡形态变更后校准必须复验——先校准后放量,不能拿三天前的合格证直接放量**。 |
金标准:`golden/金标准-{番茄作家,起点作家,主编}-2026-07-13.md` + `golden/scores.json`(19 卡九维均分)+ `golden/scores-cal002.json`(cal-002 30 卡 opus 盲评)。
## 金标准对拆书 prompt 的改进清单(B4 优化环的输入,未实施)
1. 技法指纹先行+跨章聚类去重(母卡+多出处实例,消灭 family 换皮);
2. 换书测试闸门+强制占位符(专名/数字打回);
3. 两类卡模板:结构型伏笔卡(埋点/回收点/隔章记忆维持三件套)vs 场景型手法卡(复用节奏/异质化/每章上限)——不再硬套埋设/履约框架;
4. 装置类型闭合枚举+判定测试;禁「信息差」当万能主标签;
5. 翻转重心:每卡强制可迁移因果原则「当X做Y因为读者会Z」+触发条件+滥用反例;砍编造数字;
6. 补「读者收益」字段(代入/掌控/期待/打脸/意外);命名用作者短语(「先知降压」),长名降副标题;
7. 采样扩到中段爽点章(打脸/升级/反转),别只啃前三章。
## 输入
- 活卡或指定 `--work-id` 的 `muse_knowledge_draft` 公共范式卡(`draft_payload` 含技法字段与实例章号)。
- 可选:`golden/scores.json` 或 `golden/scores-cal002.json` 金标准(校准子命令)。
## 输出
- 写回每张卡的 `draft_payload.审核`:批次 id、三角色九维均分、判定(pass/revise/reject)与判词摘要。
- `calibrate` 产出与金标准的 MAE、bias、判定一致率报告(不写库时可 stdout)。
## 数据边界
- 读取:`muse_knowledge_draft` 与关联作品元数据;校准读 `golden/` 本地金标准。
- 写入:仅更新卡 `draft_payload.审核` 节与审核时间戳;不确认卡、不改作品私有知识、不直接改 `knowledge/` Git 资产。
- 模型:常设审核走 M3 三角色;fable/opus 只用于金标准产出与起量后总审核,不进每批循环。
## 红线
- 不负责生成卡或确认作品私有知识;确认归 `确认知识草稿` / 管理员 G3 门。
- 判定阈值固定:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject;不得为放量放水。
- 卡形态或 prompt 变更后必须重跑 `calibrate` 刷新 stamp,禁止复用过期合格证。
- `--dry-run` 必须可完整走通推理链但不写库。
## 复利合同
- 非 dry-run 写回审核节后经 `propose_lesson_dedup` 登记 `example_lesson`(绑 work_id / batch / 判定统计)。
- 升格仍走人工评审;系统性假阳须先 `calibrate` 再放量。
## 失败关闭
- LLM 推理阶段不持写连接;写库在全新短连接批量 UPDATE,中途异常整批回滚。
- `--dry-run` 可完整走通推理链但不写库、不登记 lesson。
- 三角色全链敏感 → 卡标 `blocked` 写入遗留项,不静默跳过;整批无卡可写时仍可提交 blocked 审计。
- 放量写库(`--batch` 不以 `cal-` 开头)必须持有 `golden/calibrate-stamp.json`:判定闸指纹吻合且 MAE≤0.5、单卡背离<1.5;过期或未过线一律拒绝。
- 校准批次 `cal-*` 允许在无 stamp 时写库,专供产出对照样本;`calibrate` 写 stamp,合格后才可放量。
## 输入