86 lines
6.3 KiB
Markdown
86 lines
6.3 KiB
Markdown
---
|
||
name: 审核知识卡
|
||
description: 以三种编辑视角审核公共知识卡的成立性、创作可用性和跨书复用性,并写回 pass、revise 或 reject。拆书产出公共卡后使用;不负责生成卡或确认作品私有知识。
|
||
disable-model-invocation: true
|
||
---
|
||
|
||
# 审核公共知识卡
|
||
|
||
创始人拍板(2026-07-13):审核是**流程内可复用资产**,不是每批都请 claude 角色扮演——
|
||
- **常设执行**:MiniMax-M3 扮三角色(番茄作家=爽点商业性 / 起点作家=结构工艺 / 主编=资产 vs 噪声),每批拆书产出的卡过一遍;
|
||
- **fable/opus 职责**:起量前出金标准校准本 skill(golden/),起量后做一次总审核;
|
||
- 判定写回 `draft_payload.审核` 节(批次/均分/判定/三角色分与判词),可追溯可复审。
|
||
|
||
## 用法
|
||
|
||
```bash
|
||
# 审核(全部或指定书的活卡;三角色各一次 M3 调用)
|
||
.venv/bin/python muse/content/entity/skills/review/审核知识卡/scripts/review_cards.py review --batch <批次> [--work-id N] [--dry-run]
|
||
|
||
# 校准:与 golden/scores.json(opus 金标准)对照(换模型/改 prompt 后必跑);过线则写 golden/calibrate-stamp.json
|
||
.venv/bin/python muse/content/entity/skills/review/审核知识卡/scripts/review_cards.py calibrate --batch cal-002
|
||
```
|
||
|
||
判定阈值:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject。
|
||
|
||
## 统一判定闸(自 opus 金标准三评审蒸馏,内嵌于审核 prompt)
|
||
|
||
换书测试(抹专名换题材仍成立?)· 命名黑话检测 · 装置标签判定(信息差/契诃夫之枪/身份错认各有硬定义)· 伪精确检测(编造的间隔数字)· 同功重复(family 换皮)· 干货位检查(失败模式比手法值钱=手法空洞)· 专名泄漏。
|
||
|
||
## 校准记录
|
||
|
||
| 日期 | 批次 | 结果 |
|
||
|---|---|---|
|
||
| 2026-07-13 | cal-001(19 卡试拆批) | 平均绝对偏差 **0.45**(合格线 ≤0.5)、平均偏差 -0.08(无系统倾向)、最大背离 1.33<1.5;8 卡偏差 ≤0.11。M3 三角色总评独立复现金标准全部四大系统病(同功撞车/命名黑话/伪精确/专名污染)。**已知弱点**:对「场景级走位 vs 可复用范式」辨别偏松(《路人搭讪道具借用式情报截流》金 2.67 → M3 4.0)。 |
|
||
| 2026-07-16 | cal-002(30 卡放量终态批,星环/机动跨五型伪随机抽样,opus 盲评金标准=`golden/scores-cal002.json`) | **背景**:批9 全量审核开跑前未复验旧校准(卡形态已经窗级重构+三轮治理大改),创始人叫停纠正。旧尺子实测 MAE 0.489 压线、bias **+0.215 系统性偏松**、判定一致 70%、**金标 revise 被放行 5/14(pass 假阳 36%)**。**修法**:CRITERIA 增评分硬规则(伪精确无实测标注→can≤3 / 标签错贴→cheng≤3 / 同功换皮家族仅最佳一张正常分 / 审慎默认拿不准往低打 / 4 分以上须自证)。**复验**:MAE **0.326**、bias -0.156(略偏严=安全方向:错杀进 revise 桶可复审救回,假阳进库不可救)、判定一致 77%、放行降至 1 张。教训固化:**卡形态变更后校准必须复验——先校准后放量,不能拿三天前的合格证直接放量**。 |
|
||
|
||
金标准:`golden/金标准-{番茄作家,起点作家,主编}-2026-07-13.md` + `golden/scores.json`(19 卡九维均分)+ `golden/scores-cal002.json`(cal-002 30 卡 opus 盲评)。
|
||
|
||
## 金标准对拆书 prompt 的改进清单(B4 优化环的输入,未实施)
|
||
|
||
1. 技法指纹先行+跨章聚类去重(母卡+多出处实例,消灭 family 换皮);
|
||
2. 换书测试闸门+强制占位符(专名/数字打回);
|
||
3. 两类卡模板:结构型伏笔卡(埋点/回收点/隔章记忆维持三件套)vs 场景型手法卡(复用节奏/异质化/每章上限)——不再硬套埋设/履约框架;
|
||
4. 装置类型闭合枚举+判定测试;禁「信息差」当万能主标签;
|
||
5. 翻转重心:每卡强制可迁移因果原则「当X做Y因为读者会Z」+触发条件+滥用反例;砍编造数字;
|
||
6. 补「读者收益」字段(代入/掌控/期待/打脸/意外);命名用作者短语(「先知降压」),长名降副标题;
|
||
7. 采样扩到中段爽点章(打脸/升级/反转),别只啃前三章。
|
||
|
||
## 输入
|
||
|
||
- 活卡或指定 `--work-id` 的 `muse_knowledge_draft` 公共范式卡(`draft_payload` 含技法字段与实例章号)。
|
||
- 可选:`golden/scores.json` 或 `golden/scores-cal002.json` 金标准(校准子命令)。
|
||
|
||
## 输出
|
||
|
||
- 写回每张卡的 `draft_payload.审核`:批次 id、三角色九维均分、判定(pass/revise/reject)与判词摘要。
|
||
- `calibrate` 产出与金标准的 MAE、bias、判定一致率报告(不写库时可 stdout)。
|
||
|
||
## 数据边界
|
||
|
||
- 读取:`muse_knowledge_draft` 与关联作品元数据;校准读 `golden/` 本地金标准。
|
||
- 写入:仅更新卡 `draft_payload.审核` 节与审核时间戳;不确认卡、不改作品私有知识、不直接改 `knowledge/` Git 资产。
|
||
- 模型:常设审核走 M3 三角色;fable/opus 只用于金标准产出与起量后总审核,不进每批循环。
|
||
|
||
## 红线
|
||
|
||
- 不负责生成卡或确认作品私有知识;确认归 `确认知识草稿` / 管理员 G3 门。
|
||
- 判定阈值固定:三角色九维均分 ≥3.5 pass / ≥2.5 revise / 其余 reject;不得为放量放水。
|
||
- 卡形态或 prompt 变更后必须重跑 `calibrate` 刷新 stamp,禁止复用过期合格证。
|
||
- `--dry-run` 必须可完整走通推理链但不写库。
|
||
|
||
## 复利合同
|
||
|
||
- 非 dry-run 写回审核节后经 `propose_lesson_dedup` 登记 `example_lesson`(绑 work_id / batch / 判定统计)。
|
||
- 升格仍走人工评审;系统性假阳须先 `calibrate` 再放量。
|
||
|
||
## 失败关闭
|
||
|
||
- LLM 推理阶段不持写连接;写库在全新短连接批量 UPDATE,中途异常整批回滚。
|
||
- `--dry-run` 可完整走通推理链但不写库、不登记 lesson。
|
||
- 三角色全链敏感 → 卡标 `blocked` 写入遗留项,不静默跳过;整批无卡可写时仍可提交 blocked 审计。
|
||
- 放量写库(`--batch` 不以 `cal-` 开头)必须持有 `golden/calibrate-stamp.json`:判定闸指纹吻合且 MAE≤0.5、单卡背离<1.5;过期或未过线一律拒绝。
|
||
- 校准批次 `cal-*` 允许在无 stamp 时写库,专供产出对照样本;`calibrate` 写 stamp,合格后才可放量。
|
||
|
||
## 输入
|